{"id":"https://openalex.org/W7129776287","doi":"https://doi.org/10.48550/arxiv.2602.13949","title":"Experiential Reinforcement Learning","display_name":"Experiential Reinforcement Learning","publication_year":2026,"publication_date":"2026-02-15","ids":{"openalex":"https://openalex.org/W7129776287","doi":"https://doi.org/10.48550/arxiv.2602.13949"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2602.13949","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.13949","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2602.13949","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5113985908","display_name":"Taiwei Shi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shi, Taiwei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126190189","display_name":"Sihao Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Sihao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5005131735","display_name":"Bowen Jiang","orcid":"https://orcid.org/0000-0003-2144-6311"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiang, Bowen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5063505653","display_name":"Linxin Song","orcid":"https://orcid.org/0009-0009-7562-3775"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Song, Linxin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5126272423","display_name":"Longqi Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Longqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5116252295","display_name":"Jieyu Zhao","orcid":"https://orcid.org/0000-0003-4844-8579"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Jieyu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.21199999749660492,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.21199999749660492,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.20020000636577606,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.05249999836087227,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8120999932289124},{"id":"https://openalex.org/keywords/experiential-learning","display_name":"Experiential learning","score":0.7372999787330627},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.6161999702453613},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5619999766349792},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.47999998927116394},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.45010000467300415},{"id":"https://openalex.org/keywords/reflection","display_name":"Reflection (computer programming)","score":0.4404999911785126},{"id":"https://openalex.org/keywords/software-deployment","display_name":"Software deployment","score":0.4392000138759613}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8120999932289124},{"id":"https://openalex.org/C37228920","wikidata":"https://www.wikidata.org/wiki/Q1307600","display_name":"Experiential learning","level":2,"score":0.7372999787330627},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.6161999702453613},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5619999766349792},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.47999998927116394},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.45010000467300415},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.4449999928474426},{"id":"https://openalex.org/C65682993","wikidata":"https://www.wikidata.org/wiki/Q1056451","display_name":"Reflection (computer programming)","level":2,"score":0.4404999911785126},{"id":"https://openalex.org/C105339364","wikidata":"https://www.wikidata.org/wiki/Q2297740","display_name":"Software deployment","level":2,"score":0.4392000138759613},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4203000068664551},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.3813999891281128},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.37459999322891235},{"id":"https://openalex.org/C47932503","wikidata":"https://www.wikidata.org/wiki/Q5395689","display_name":"Error-driven learning","level":3,"score":0.37059998512268066},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.36800000071525574},{"id":"https://openalex.org/C12298181","wikidata":"https://www.wikidata.org/wiki/Q7246814","display_name":"Proactive learning","level":5,"score":0.3294000029563904},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.3156999945640564},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.3109000027179718},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.2842000126838684},{"id":"https://openalex.org/C188888258","wikidata":"https://www.wikidata.org/wiki/Q7353390","display_name":"Robot learning","level":4,"score":0.26330000162124634},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.26159998774528503},{"id":"https://openalex.org/C186886427","wikidata":"https://www.wikidata.org/wiki/Q5441213","display_name":"Feedback loop","level":2,"score":0.25450000166893005},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2529999911785126},{"id":"https://openalex.org/C51672120","wikidata":"https://www.wikidata.org/wiki/Q303446","display_name":"Cooperative learning","level":3,"score":0.250900000333786}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2602.13949","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.13949","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2602.13949","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.13949","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0,53],"learning":[1,68,135,143],"has":[2],"become":[3],"the":[4,20,66,73,99],"central":[5],"approach":[6],"for":[7,47,177],"language":[8],"models":[9],"(LMs)":[10],"to":[11,149,157],"learn":[12],"from":[13,29],"environmental":[14,21,80],"reward":[15],"or":[16],"feedback.":[17],"In":[18],"practice,":[19],"feedback":[22,105,179],"is":[23,32,94],"usually":[24],"sparse":[25],"and":[26,82,96,112,128,137,155],"delayed.":[27],"Learning":[28,54],"such":[30],"signals":[31],"challenging,":[33],"as":[34],"LMs":[35],"must":[36],"implicitly":[37],"infer":[38],"how":[39],"observed":[40],"failures":[41],"should":[42],"translate":[43],"into":[44,65,98,106,170,180],"behavioral":[45,108,182],"changes":[46],"future":[48],"iterations.":[49],"We":[50],"introduce":[51],"Experiential":[52],"(ERL),":[55],"a":[56,71,84,88,174],"training":[57,172],"paradigm":[58],"that":[59,86,166],"embeds":[60],"an":[61,76],"explicit":[62,168],"experience-reflection-consolidation":[63],"loop":[64],"reinforcement":[67,142],"process.":[69],"Given":[70],"task,":[72],"model":[74],"generates":[75],"initial":[77],"attempt,":[78,91],"receives":[79],"feedback,":[81],"produces":[83],"reflection":[85],"guides":[87],"refined":[89],"second":[90],"whose":[92],"success":[93],"reinforced":[95],"internalized":[97],"base":[100],"policy.":[101],"This":[102],"process":[103],"converts":[104],"structured":[107],"revision,":[109],"improving":[110],"exploration":[111],"stabilizing":[113],"optimization":[114],"while":[115],"preserving":[116],"gains":[117,146],"at":[118],"deployment":[119],"without":[120],"additional":[121],"inference":[122],"cost.":[123],"Across":[124],"sparse-reward":[125],"control":[126],"environments":[127,154],"agentic":[129],"reasoning":[130,161],"benchmarks,":[131],"ERL":[132],"consistently":[133],"improves":[134],"efficiency":[136],"final":[138],"performance":[139],"over":[140],"strong":[141],"baselines,":[144],"achieving":[145],"of":[147],"up":[148,156],"+81%":[150],"in":[151,159],"complex":[152],"multi-step":[153],"+11%":[158],"tool-using":[160],"tasks.":[162],"These":[163],"results":[164],"suggest":[165],"integrating":[167],"self-reflection":[169],"policy":[171],"provides":[173],"practical":[175],"mechanism":[176],"transforming":[178],"durable":[181],"improvement.":[183]},"counts_by_year":[],"updated_date":"2026-08-16T07:02:28.622633","created_date":"2026-02-18T00:00:00"}
