{"id":"https://openalex.org/W7160901391","doi":"https://doi.org/10.48550/arxiv.2605.09009","title":"Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning","display_name":"Large Language Models for Sequential Decision-Making: Improving In-Context Learning via Supervised Fine-Tuning","publication_year":2026,"publication_date":"2026-05-09","ids":{"openalex":"https://openalex.org/W7160901391","doi":"https://doi.org/10.48550/arxiv.2605.09009"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.09009","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09009","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.09009","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101529313","display_name":"Minmin Zhang","orcid":"https://orcid.org/0000-0002-9097-8306"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Minmin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5135950180","display_name":"Sina Aghaei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Aghaei, Sina","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5068960692","display_name":"Soroush Saghafian","orcid":"https://orcid.org/0000-0002-9781-6561"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Saghafian, Soroush","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11636","display_name":"Artificial Intelligence in Healthcare and Education","score":0.20559999346733093,"subfield":{"id":"https://openalex.org/subfields/2718","display_name":"Health Informatics"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}},"topics":[{"id":"https://openalex.org/T11636","display_name":"Artificial Intelligence in Healthcare and Education","score":0.20559999346733093,"subfield":{"id":"https://openalex.org/subfields/2718","display_name":"Health Informatics"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}},{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.1834000051021576,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.0731000006198883,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.6216999888420105},{"id":"https://openalex.org/keywords/imitation","display_name":"Imitation","score":0.5396000146865845},{"id":"https://openalex.org/keywords/partially-observable-markov-decision-process","display_name":"Partially observable Markov decision process","score":0.4399000108242035},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.43560001254081726},{"id":"https://openalex.org/keywords/supervised-learning","display_name":"Supervised learning","score":0.388700008392334},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.3804999887943268},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.3781000077724457},{"id":"https://openalex.org/keywords/layer","display_name":"Layer (electronics)","score":0.35089999437332153},{"id":"https://openalex.org/keywords/training-set","display_name":"Training set","score":0.34929999709129333}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6848999857902527},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.6216999888420105},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5924000144004822},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.5396000146865845},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5199000239372253},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.4399000108242035},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.43560001254081726},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.388700008392334},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.3804999887943268},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.3781000077724457},{"id":"https://openalex.org/C2779227376","wikidata":"https://www.wikidata.org/wiki/Q6505497","display_name":"Layer (electronics)","level":2,"score":0.35089999437332153},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.34929999709129333},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.3346000015735626},{"id":"https://openalex.org/C84525736","wikidata":"https://www.wikidata.org/wiki/Q831366","display_name":"Decision tree","level":2,"score":0.32510000467300415},{"id":"https://openalex.org/C96250715","wikidata":"https://www.wikidata.org/wiki/Q965330","display_name":"Estimation","level":2,"score":0.3228999972343445},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.304500013589859},{"id":"https://openalex.org/C169258074","wikidata":"https://www.wikidata.org/wiki/Q245748","display_name":"Random forest","level":2,"score":0.30320000648498535},{"id":"https://openalex.org/C163836022","wikidata":"https://www.wikidata.org/wiki/Q6771326","display_name":"Markov model","level":3,"score":0.2994999885559082},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.2962999939918518},{"id":"https://openalex.org/C2776145971","wikidata":"https://www.wikidata.org/wiki/Q30673951","display_name":"Labeled data","level":2,"score":0.28139999508857727},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.27300000190734863},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.26899999380111694},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.2646999955177307},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.09009","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09009","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.09009","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.09009","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.7744653224945068,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"language":[1],"models":[2],"(LLMs)":[3],"have":[4],"shown":[5],"remarkable":[6],"in-context":[7,88,107],"learning":[8],"(ICL)":[9],"capabilities,":[10],"yet":[11],"their":[12],"potential":[13],"for":[14,100],"sequential":[15,30,164],"decision-making":[16,31,53,165],"remains":[17],"underexplored.":[18],"In":[19],"this":[20,92],"paper,":[21],"we":[22,71,94,122],"study":[23],"the":[24,101,106,111],"ICL":[25],"capabilities":[26,166],"of":[27,64],"LLMs":[28,49,126,162],"in":[29,141,175],"settings,":[32,121],"including":[33],"Markov":[34],"Decision":[35],"Processes":[36],"(MDPs),":[37],"Partially":[38],"Observable":[39],"MDPs":[40,75],"(POMDPs),":[41],"and":[42,76,119,134,145],"Ambiguous":[43],"POMDPs":[44],"(APOMDPs).":[45],"We":[46],"fine-tune":[47],"pretrained":[48,161],"to":[50,159],"perform":[51],"few-shot":[52],"directly":[54],"from":[55,87,110,167],"offline,":[56],"oracle-labeled":[57],"trajectories.":[58],"Our":[59],"framework":[60],"enables":[61],"flexible":[62],"imitation":[63],"policies":[65],"through":[66],"supervised":[67,153],"fine-tuning":[68,154],"(SFT).":[69],"Theoretically,":[70],"focus":[72],"on":[73,91],"linear":[74],"interpret":[77],"a":[78],"fine-tuned":[79,125],"attention":[80],"layer":[81],"as":[82,178],"implicitly":[83],"estimating":[84],"optimal":[85],"Q-functions":[86],"data.":[89],"Building":[90],"interpretation,":[93],"derive":[95],"an":[96,156,172],"end-to-end":[97],"suboptimality":[98],"bound":[99],"induced":[102],"policy":[103],"that":[104,124,152],"separates":[105],"estimation":[108],"error":[109],"training-length":[112],"bias.":[113],"Empirically,":[114],"across":[115],"synthetic":[116],"MDP,":[117],"POMDP,":[118],"APOMDP":[120],"find":[123],"achieve":[127],"substantially":[128],"smaller":[129],"optimality":[130],"gaps":[131],"than":[132],"in-context-only":[133],"random":[135],"baselines,":[136],"with":[137,163],"especially":[138],"large":[139],"gains":[140],"longer-horizon,":[142],"partially":[143],"observed,":[144],"model-ambiguous":[146],"environments.":[147],"Together,":[148],"these":[149],"results":[150],"show":[151],"provides":[155],"effective":[157],"route":[158],"endowing":[160],"offline":[168,181],"data,":[169],"which":[170],"is":[171],"important":[173],"advantage":[174],"domains":[176],"such":[177],"healthcare":[179],"where":[180],"data":[182],"are":[183],"abundant.":[184]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-13T00:00:00"}
