{"id":"https://openalex.org/W7162490384","doi":"https://doi.org/10.48550/arxiv.2605.27079","title":"Trust Region Q Adjoint Matching","display_name":"Trust Region Q Adjoint Matching","publication_year":2026,"publication_date":"2026-05-26","ids":{"openalex":"https://openalex.org/W7162490384","doi":"https://doi.org/10.48550/arxiv.2605.27079"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.27079","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.27079","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.27079","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137191815","display_name":"Yonghoon Dong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dong, Yonghoon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137136006","display_name":"Kyungmin Lee","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lee, Kyungmin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128192559","display_name":"Changyeon Kim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Changyeon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137092191","display_name":"Jaehyuk Kim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kim, Jaehyuk","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5137112983","display_name":"Jinwoo Shin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shin, Jinwoo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.47940000891685486,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.47940000891685486,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.40950000286102295,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.02759999968111515,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/margin","display_name":"Margin (machine learning)","score":0.6032000184059143},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.6021000146865845},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5807999968528748},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.4713999927043915},{"id":"https://openalex.org/keywords/dual","display_name":"Dual (grammatical number)","score":0.450300008058548},{"id":"https://openalex.org/keywords/flow","display_name":"Flow (mathematics)","score":0.42410001158714294},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.4187999963760376},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.40310001373291016},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.3776000142097473}],"concepts":[{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.6032000184059143},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.6021000146865845},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5807999968528748},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5619000196456909},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.4997999966144562},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.4713999927043915},{"id":"https://openalex.org/C2780980858","wikidata":"https://www.wikidata.org/wiki/Q110022","display_name":"Dual (grammatical number)","level":2,"score":0.450300008058548},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.42419999837875366},{"id":"https://openalex.org/C38349280","wikidata":"https://www.wikidata.org/wiki/Q1434290","display_name":"Flow (mathematics)","level":2,"score":0.42410001158714294},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.4187999963760376},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4138999879360199},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.40310001373291016},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.3776000142097473},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.37470000982284546},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.3610000014305115},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.3578000068664551},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.33410000801086426},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.3156999945640564},{"id":"https://openalex.org/C73602740","wikidata":"https://www.wikidata.org/wiki/Q7795822","display_name":"Thompson sampling","level":3,"score":0.3057999908924103},{"id":"https://openalex.org/C151201525","wikidata":"https://www.wikidata.org/wiki/Q177239","display_name":"Limit (mathematics)","level":2,"score":0.3043999969959259},{"id":"https://openalex.org/C2778334786","wikidata":"https://www.wikidata.org/wiki/Q1586270","display_name":"Variation (astronomy)","level":2,"score":0.29989999532699585},{"id":"https://openalex.org/C55479107","wikidata":"https://www.wikidata.org/wiki/Q97663916","display_name":"Stochastic approximation","level":3,"score":0.2915000021457672},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.28999999165534973},{"id":"https://openalex.org/C80191262","wikidata":"https://www.wikidata.org/wiki/Q5477668","display_name":"Fragility","level":2,"score":0.27320000529289246},{"id":"https://openalex.org/C124584101","wikidata":"https://www.wikidata.org/wiki/Q1053266","display_name":"Multiplier (economics)","level":2,"score":0.26649999618530273},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2632000148296356},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.26190000772476196},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.2612000107765198},{"id":"https://openalex.org/C148043351","wikidata":"https://www.wikidata.org/wiki/Q4456944","display_name":"Current (fluid)","level":2,"score":0.2574000060558319},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.2572000026702881},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.25049999356269836}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.27079","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.27079","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.27079","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.27079","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Off-policy":[0],"reinforcement":[1],"learning":[2],"of":[3,13,50,118,165],"pretrained":[4,87,132],"flow":[5,88,133],"policies":[6,89],"remains":[7],"challenging":[8],"due":[9],"to":[10,64],"the":[11,17,83,97,108,128,172],"instability":[12],"optimization":[14],"arising":[15],"from":[16,131],"multi-step":[18],"sampling":[19],"process.":[20],"Recently,":[21],"Q-learning":[22],"with":[23,40,86],"Adjoint":[24],"Matching":[25,73],"(QAM)":[26],"addressed":[27],"this":[28],"issue":[29],"by":[30,114],"reformulating":[31],"into":[32],"a":[33,41,47,75,115,121],"memoryless":[34],"stochastic":[35],"optimal":[36],"control":[37,127],"(SOC)":[38],"problem":[39],"learned":[42],"critic.":[43],"However,":[44],"QAM":[45],"inherits":[46],"fundamental":[48],"fragility":[49],"critic-guided":[51],"improvement:":[52],"small":[53],"critic":[54],"errors":[55],"are":[56,60],"amplified":[57],"when":[58],"critics":[59],"ill-conditioned,":[61],"often":[62],"leading":[63],"model":[65],"collapse.":[66],"This":[67],"paper":[68],"introduces":[69],"Trust":[70],"Region":[71],"Q-Adjoint":[72],"(TRQAM),":[74],"stable":[76,136],"off-policy":[77,137],"fine-tuning":[78],"algorithm":[79],"that":[80,107],"adaptively":[81],"controls":[82],"path-space":[84,109],"KL":[85,110],"through":[90],"projected":[91],"dual":[92],"descent.":[93],"Specifically,":[94],"we":[95],"optimize":[96],"trust-region":[98],"parameter":[99],"$\u03bb$":[100],"in":[101,150,167],"SOC":[102],"dynamics,":[103],"and":[104,154],"theoretically":[105],"show":[106],"can":[111,125],"be":[112],"represented":[113],"closed-form":[116],"function":[117],"$\u03bb$.":[119],"As":[120],"result,":[122],"our":[123],"method":[124],"precisely":[126],"exact":[129],"deviation":[130],"policies,":[134],"achieving":[135],"RL.":[138,156],"Through":[139],"experiments":[140],"on":[141],"50":[142],"OGBench":[143],"tasks,":[144],"TRQAM":[145,159],"consistently":[146],"outperforms":[147],"prior":[148],"arts":[149],"both":[151],"offline":[152,168],"RL":[153],"offline-to-online":[155],"In":[157],"particular,":[158],"achieves":[160],"an":[161],"overall":[162],"success":[163],"rate":[164],"68%":[166],"RL,":[169],"substantially":[170],"improves":[171],"strongest":[173],"baseline":[174],"at":[175],"46%.":[176]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-05-28T00:00:00"}
