{"id":"https://openalex.org/W7164908918","doi":"https://doi.org/10.48550/arxiv.2606.16995","title":"When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning","display_name":"When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning","publication_year":2026,"publication_date":"2026-06-15","ids":{"openalex":"https://openalex.org/W7164908918","doi":"https://doi.org/10.48550/arxiv.2606.16995"},"language":"en","primary_location":{"id":"pmh:oai:kclpure.kcl.ac.uk:openaire/38989138-73a6-46be-8b74-ee2dd9b8ef4f","is_oa":true,"landing_page_url":"https://kclpure.kcl.ac.uk/portal/en/publications/38989138-73a6-46be-8b74-ee2dd9b8ef4f","pdf_url":"https://kclpure.kcl.ac.uk/ws/files/377125287/main.pdf","source":{"id":"https://openalex.org/S4306400216","display_name":"Research Portal (King's College London)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I183935753","host_organization_name":"King's College London","host_organization_lineage":["https://openalex.org/I183935753"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Gavenski, N, Monteiro, J, Galuppo, F, Veloso, A & Rodrigues, O 2026, When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning. in LM4Plan Workshop at The International Conference on Machine Learning 2026.","raw_type":"info:eu-repo/semantics/publishedVersion"},"type":"conference-paper","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://kclpure.kcl.ac.uk/ws/files/377125287/main.pdf","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138694293","display_name":"Nathan Gavenski","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gavenski, Nathan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138693259","display_name":"Juarez Monteiro","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Monteiro, Juarez","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5114637264","display_name":"Francisco Galuppo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Galuppo, Francisco","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138720351","display_name":"Adriano Veloso","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Veloso, Adriano","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138717278","display_name":"Odinaldo Rodrigues","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Rodrigues, Odinaldo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.67322598,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.47450000047683716,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.47450000047683716,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.05900000035762787,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.043299999088048935,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7838000059127808},{"id":"https://openalex.org/keywords/deliberation","display_name":"Deliberation","score":0.7706999778747559},{"id":"https://openalex.org/keywords/plan","display_name":"Plan (archaeology)","score":0.6575999855995178},{"id":"https://openalex.org/keywords/pact","display_name":"Pact","score":0.6186000108718872},{"id":"https://openalex.org/keywords/retraining","display_name":"Retraining","score":0.5698000192642212},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.4997999966144562},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.4690000116825104},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.390500009059906}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7838000059127808},{"id":"https://openalex.org/C2776946740","wikidata":"https://www.wikidata.org/wiki/Q358652","display_name":"Deliberation","level":3,"score":0.7706999778747559},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6758000254631042},{"id":"https://openalex.org/C2776505523","wikidata":"https://www.wikidata.org/wiki/Q4785468","display_name":"Plan (archaeology)","level":2,"score":0.6575999855995178},{"id":"https://openalex.org/C2779073994","wikidata":"https://www.wikidata.org/wiki/Q1751686","display_name":"Pact","level":2,"score":0.6186000108718872},{"id":"https://openalex.org/C2778712577","wikidata":"https://www.wikidata.org/wiki/Q3505966","display_name":"Retraining","level":2,"score":0.5698000192642212},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.4997999966144562},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.4690000116825104},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.43709999322891235},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.390500009059906},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3544999957084656},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.3481000065803528},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.34529998898506165},{"id":"https://openalex.org/C123657996","wikidata":"https://www.wikidata.org/wiki/Q12271","display_name":"Architecture","level":2,"score":0.31540000438690186},{"id":"https://openalex.org/C2780210234","wikidata":"https://www.wikidata.org/wiki/Q422638","display_name":"Action plan","level":2,"score":0.3046000003814697},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3041999936103821},{"id":"https://openalex.org/C2779955035","wikidata":"https://www.wikidata.org/wiki/Q4686785","display_name":"Advice (programming)","level":2,"score":0.29440000653266907},{"id":"https://openalex.org/C94922259","wikidata":"https://www.wikidata.org/wiki/Q33215","display_name":"Constructed language","level":2,"score":0.2671000063419342},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.26260000467300415},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.2614000141620636},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.25540000200271606}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:kclpure.kcl.ac.uk:openaire/38989138-73a6-46be-8b74-ee2dd9b8ef4f","is_oa":true,"landing_page_url":"https://kclpure.kcl.ac.uk/portal/en/publications/38989138-73a6-46be-8b74-ee2dd9b8ef4f","pdf_url":"https://kclpure.kcl.ac.uk/ws/files/377125287/main.pdf","source":{"id":"https://openalex.org/S4306400216","display_name":"Research Portal (King's College London)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I183935753","host_organization_name":"King's College London","host_organization_lineage":["https://openalex.org/I183935753"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Gavenski, N, Monteiro, J, Galuppo, F, Veloso, A & Rodrigues, O 2026, When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning. in LM4Plan Workshop at The International Conference on Machine Learning 2026.","raw_type":"info:eu-repo/semantics/publishedVersion"},{"id":"doi:10.48550/arxiv.2606.16995","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.16995","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:kclpure.kcl.ac.uk:openaire/38989138-73a6-46be-8b74-ee2dd9b8ef4f","is_oa":true,"landing_page_url":"https://kclpure.kcl.ac.uk/portal/en/publications/38989138-73a6-46be-8b74-ee2dd9b8ef4f","pdf_url":"https://kclpure.kcl.ac.uk/ws/files/377125287/main.pdf","source":{"id":"https://openalex.org/S4306400216","display_name":"Research Portal (King's College London)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I183935753","host_organization_name":"King's College London","host_organization_lineage":["https://openalex.org/I183935753"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Gavenski, N, Monteiro, J, Galuppo, F, Veloso, A & Rodrigues, O 2026, When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning. in LM4Plan Workshop at The International Conference on Machine Learning 2026.","raw_type":"info:eu-repo/semantics/publishedVersion"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7164908918.pdf","grobid_xml":"https://content.openalex.org/works/W7164908918.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"Learning":[1],"(RL)":[2],"policies":[3],"often":[4],"degrade":[5],"in":[6,106,112],"unfamiliar":[7],"environments":[8],"because":[9],"they":[10],"lack":[11],"explicit":[12],"deliberation.":[13],"We":[14],"propose":[15],"Plan,":[16],"Align,":[17],"Commit,":[18],"Think":[19],"(PACT),":[20],"a":[21,26,32,53,92],"hybrid":[22],"architecture":[23],"that":[24,97],"combines":[25],"fast,":[27],"reactive":[28,101],"RL":[29,70],"policy":[30,71],"with":[31],"slow,":[33],"deliberative":[34,98],"Small":[35],"Language":[36],"Model":[37],"(SLM)":[38],"planner.":[39],"PACT":[40,85],"invokes":[41],"the":[42,69],"SLM":[43,94],"asynchronously":[44],"to":[45],"generate":[46],"and":[47,62,100],"validate":[48],"candidate":[49],"action":[50],"plans.":[51],"Once":[52],"plan":[54],"is":[55,65,110],"verified":[56],"through":[57],"simulation":[58],"as":[59],"safe,":[60],"feasible,":[61],"complete,":[63],"it":[64],"executed":[66],"directly,":[67],"bypassing":[68],"without":[72],"retraining":[73],"or":[74],"modifying":[75],"it.":[76],"Evaluated":[77],"on":[78,91],"three":[79],"FrozenLake":[80],"configurations":[81],"of":[82],"increasing":[83],"difficulty,":[84],"outperforms":[86],"all":[87],"baselines":[88],"while":[89],"relying":[90],"2B-parameter":[93],"backbone,":[95],"suggesting":[96],"planning":[99],"execution":[102],"are":[103],"more":[104],"powerful":[105],"concert":[107],"than":[108],"either":[109],"alone":[111],"these":[113],"settings.":[114]},"counts_by_year":[],"updated_date":"2026-08-21T09:56:20.448147","created_date":"2026-06-17T00:00:00"}
