{"id":"https://openalex.org/W7161705850","doi":"https://doi.org/10.48550/arxiv.2605.17873","title":"HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents","display_name":"HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents","publication_year":2026,"publication_date":"2026-05-18","ids":{"openalex":"https://openalex.org/W7161705850","doi":"https://doi.org/10.48550/arxiv.2605.17873"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.17873","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.17873","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.17873","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5136483938","display_name":"Woongyeng Yeo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yeo, Woongyeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5124866247","display_name":"Yumin Choi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Choi, Yumin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5085191695","display_name":"Taekyung Ki","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ki, Taekyung","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136488783","display_name":"Sung Ju Hwang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hwang, Sung Ju","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8169000148773193,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8169000148773193,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.04170000180602074,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.023600000888109207,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/hindsight-bias","display_name":"Hindsight bias","score":0.9718000292778015},{"id":"https://openalex.org/keywords/outcome","display_name":"Outcome (game theory)","score":0.6875},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.5940999984741211},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.5929999947547913},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5777000188827515},{"id":"https://openalex.org/keywords/bridge","display_name":"Bridge (graph theory)","score":0.4821999967098236},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.477400004863739},{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.4000000059604645}],"concepts":[{"id":"https://openalex.org/C10347200","wikidata":"https://www.wikidata.org/wiki/Q1960297","display_name":"Hindsight bias","level":2,"score":0.9718000292778015},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.6875},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.5940999984741211},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.5929999947547913},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5803999900817871},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5777000188827515},{"id":"https://openalex.org/C100776233","wikidata":"https://www.wikidata.org/wiki/Q2532492","display_name":"Bridge (graph theory)","level":2,"score":0.4821999967098236},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.477400004863739},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4268999993801117},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.4000000059604645},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3785000145435333},{"id":"https://openalex.org/C112930515","wikidata":"https://www.wikidata.org/wiki/Q4389547","display_name":"Risk analysis (engineering)","level":1,"score":0.3684000074863434},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.33899998664855957},{"id":"https://openalex.org/C176777502","wikidata":"https://www.wikidata.org/wiki/Q4774623","display_name":"Anticipation (artificial intelligence)","level":2,"score":0.3046000003814697},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.287200003862381},{"id":"https://openalex.org/C2778348673","wikidata":"https://www.wikidata.org/wiki/Q739302","display_name":"Production (economics)","level":2,"score":0.28630000352859497},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.2784000039100647},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.27090001106262207},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.26899999380111694},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2687999904155731},{"id":"https://openalex.org/C166109690","wikidata":"https://www.wikidata.org/wiki/Q4677422","display_name":"Action selection","level":3,"score":0.2612999975681305},{"id":"https://openalex.org/C108010975","wikidata":"https://www.wikidata.org/wiki/Q500094","display_name":"Pruning","level":2,"score":0.2500999867916107}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.17873","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.17873","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.17873","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.17873","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Training":[0],"long-horizon":[1,162],"LLM":[2],"agents":[3],"with":[4],"reinforcement":[5],"learning":[6],"is":[7,58,153],"challenging":[8],"because":[9],"sparse":[10],"outcome":[11,25],"rewards":[12,39],"reveal":[13],"whether":[14],"a":[15,73,96,154],"task":[16],"succeeds,":[17],"but":[18],"not":[19],"which":[20],"intermediate":[21,62],"actions":[22,83,107],"caused":[23],"the":[24,82,87,129],"or":[26,40,47,67,75],"how":[27],"they":[28],"should":[29],"be":[30],"corrected.":[31],"Recent":[32],"methods":[33],"alleviate":[34],"this":[35,91],"issue":[36],"by":[37,48,134],"generating":[38,53],"textual":[41],"hints":[42],"from":[43],"turn-level":[44],"action-output":[45],"signals,":[46],"using":[49],"feedback-conditioned":[50,110],"self-distillation.":[51],"However,":[52],"feedback":[54,71,132],"at":[55,72],"every":[56],"turn":[57,77],"inefficient":[59],"when":[60],"many":[61],"turns":[63],"are":[64],"already":[65],"successful":[66],"neutral,":[68],"and":[69,108,121,160],"applying":[70],"fixed":[74],"misaligned":[76],"often":[78],"fails":[79],"to":[80,86,104,136,151],"supervise":[81],"that":[84,100,124,148],"contributed":[85],"failure.":[88],"To":[89],"bridge":[90],"gap,":[92],"we":[93],"propose":[94],"HINT-SD,":[95],"targeted":[97,114],"self-distillation":[98],"framework":[99],"uses":[101],"full-trajectory":[102],"hindsight":[103],"select":[105],"failure-relevant":[106],"applies":[109],"distillation":[111],"only":[112],"on":[113,118],"action":[115],"spans.":[116],"Experiments":[117],"BFCL":[119],"v3":[120],"AppWorld":[122],"show":[123],"our":[125],"method":[126],"improves":[127],"over":[128],"dense":[130],"per-turn":[131],"baseline":[133],"up":[135],"18.80":[137],"percent":[138],"while":[139],"achieving":[140],"2.26$\\times$":[141],"lower":[142],"time":[143],"per":[144],"training":[145],"step,":[146],"suggesting":[147],"selecting":[149],"where":[150],"distill":[152],"key":[155],"factor":[156],"for":[157],"both":[158],"effective":[159],"efficient":[161],"agent":[163],"training.":[164]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-20T00:00:00"}
