{"id":"https://openalex.org/W7164080115","doi":"https://doi.org/10.48550/arxiv.2606.09825","title":"An Agency-Transferring Model-Free Policy Enhancement Technique","display_name":"An Agency-Transferring Model-Free Policy Enhancement Technique","publication_year":2026,"publication_date":"2026-06-08","ids":{"openalex":"https://openalex.org/W7164080115","doi":"https://doi.org/10.48550/arxiv.2606.09825"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.09825","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09825","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.09825","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5008864190","display_name":"Anton Bolychev","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bolychev, Anton","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138264294","display_name":"Georgiy Malaniya","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Malaniya, Georgiy","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129986839","display_name":"Sinan Ibrahim","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ibrahim, Sinan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138245270","display_name":"Pavel Osinenko","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Osinenko, Pavel","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8927000164985657,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8927000164985657,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.01769999973475933,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.012799999676644802,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.8339999914169312},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6656000018119812},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.5533999800682068},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5180000066757202},{"id":"https://openalex.org/keywords/property","display_name":"Property (philosophy)","score":0.4429999887943268},{"id":"https://openalex.org/keywords/agency","display_name":"Agency (philosophy)","score":0.43860000371932983},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.40220001339912415},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.39890000224113464}],"concepts":[{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.8339999914169312},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.671500027179718},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6656000018119812},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.5533999800682068},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5180000066757202},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5073000192642212},{"id":"https://openalex.org/C189950617","wikidata":"https://www.wikidata.org/wiki/Q937228","display_name":"Property (philosophy)","level":2,"score":0.4429999887943268},{"id":"https://openalex.org/C108170787","wikidata":"https://www.wikidata.org/wiki/Q3951828","display_name":"Agency (philosophy)","level":2,"score":0.43860000371932983},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.43689998984336853},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.40220001339912415},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.39890000224113464},{"id":"https://openalex.org/C2780428219","wikidata":"https://www.wikidata.org/wiki/Q16952335","display_name":"Cover (algebra)","level":2,"score":0.34130001068115234},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.32510000467300415},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.31349998712539673},{"id":"https://openalex.org/C123587114","wikidata":"https://www.wikidata.org/wiki/Q2101508","display_name":"Policy analysis","level":2,"score":0.29600000381469727},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.28119999170303345},{"id":"https://openalex.org/C27548731","wikidata":"https://www.wikidata.org/wiki/Q88272","display_name":"Investment (military)","level":3,"score":0.2689000070095062},{"id":"https://openalex.org/C166052673","wikidata":"https://www.wikidata.org/wiki/Q83021","display_name":"Empirical evidence","level":2,"score":0.26820001006126404},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.2637999951839447},{"id":"https://openalex.org/C2778137410","wikidata":"https://www.wikidata.org/wiki/Q2732820","display_name":"Government (linguistics)","level":2,"score":0.2554999887943268}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.09825","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09825","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.09825","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.09825","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Training":[0],"reinforcement":[1],"learning":[2,62,81,97,105,202,244],"(RL)":[3],"policies":[4],"from":[5,163],"scratch":[6],"is":[7,107,150],"costly:":[8],"it":[9,122,183],"requires":[10],"careful":[11],"reward":[12],"and":[13,18,59,78,90,140,181],"environment":[14],"design,":[15],"extensive":[16],"tuning,":[17],"substantial":[19],"computation.":[20],"Yet":[21],"many":[22],"control":[23],"problems":[24],"already":[25],"have":[26],"a":[27,34,39,44,61,79,108,137,172],"functional":[28],"but":[29],"suboptimal":[30],"policy":[31,63,77,89,106,116,127,245],"available":[32],"as":[33],"baseline.":[35,67],"This":[36],"paper":[37,119],"proposes":[38],"method":[40,72,213],"for":[41,124,195],"embedding":[42],"such":[43],"baseline":[45,76,88,115,126,249],"into":[46],"the":[47,66,71,75,87,96,100,104,125,134,164,185,196,200,211,226,233,239,243],"RL":[48],"training":[49,53,231],"process,":[50],"simultaneously":[51],"improving":[52],"efficiency":[54],"relative":[55],"to":[56,95,128,152,184],"from-scratch":[57],"methods":[58,235],"producing":[60],"that":[64,112,210,216],"outperforms":[65],"At":[68],"each":[69],"step,":[70],"arbitrates":[73],"between":[74],"trainable":[80],"policy,":[82,133],"initially":[83],"relying":[84],"strongly":[85],"on":[86,206],"then":[91],"progressively":[92],"transferring":[93],"agency":[94],"policy.":[98,203],"By":[99],"end":[101],"of":[102,166,175,199,221],"training,":[103,157],"standalone":[109,201],"neural":[110],"network":[111],"operates":[113,246],"without":[114,247],"support.":[117,250],"The":[118,146],"formalizes":[120],"what":[121],"means":[123],"be":[129],"functional:":[130],"under":[131,178],"this":[132,154,176],"agent":[135],"reaches":[136],"goal":[138],"set":[139],"remains":[141],"there":[142],"with":[143],"high":[144,159],"probability.":[145],"proposed":[147,212],"arbitration":[148],"mechanism":[149],"designed":[151],"exploit":[153],"property":[155],"during":[156],"yielding":[158],"goal-reaching":[160,197,228],"rates":[161,229],"right":[162],"beginning":[165],"training.":[167],"A":[168],"theoretical":[169],"analysis":[170],"provides":[171],"formal":[173],"interpretation":[174],"behavior":[177],"stated":[179],"assumptions":[180],"extends":[182],"final":[186,240],"baseline-free":[187],"regime,":[188],"where":[189,242],"explicit":[190],"lower":[191],"bounds":[192],"are":[193],"derived":[194],"probability":[198],"Empirical":[204],"results":[205],"continuous-control":[207],"benchmarks":[208],"show":[209],"achieves":[214],"returns":[215],"match":[217],"or":[218],"exceed":[219],"those":[220],"competitive":[222],"approaches,":[223],"while":[224],"maintaining":[225],"highest":[227],"throughout":[230],"among":[232],"compared":[234],"--":[236],"including":[237],"in":[238],"stage,":[241],"any":[248]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-10T00:00:00"}
