{"id":"https://openalex.org/W7151572498","doi":"https://doi.org/10.48550/arxiv.2604.04767","title":"Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems","display_name":"Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems","publication_year":2026,"publication_date":"2026-04-06","ids":{"openalex":"https://openalex.org/W7151572498","doi":"https://doi.org/10.48550/arxiv.2604.04767"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.04767","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.04767","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.04767","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5133114679","display_name":"Justin Chih-Yao Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Justin Chih-Yao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5039920828","display_name":"Archiki Prasad","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Prasad, Archiki","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133094583","display_name":"Zaid Khan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Khan, Zaid","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101278709","display_name":"Joykirat Singh","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Singh, Joykirat","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133096360","display_name":"Runchu Tian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tian, Runchu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5038276570","display_name":"Elias Stengel-Eskin","orcid":"https://orcid.org/0000-0002-6689-505X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Stengel-Eskin, Elias","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133143081","display_name":"Mohit Bansal","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bansal, Mohit","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.3109999895095825,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.3109999895095825,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.2378000020980835,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.12919999659061432,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/discriminative-model","display_name":"Discriminative model","score":0.5745000243186951},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5684000253677368},{"id":"https://openalex.org/keywords/exploit","display_name":"Exploit","score":0.5623999834060669},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5303999781608582},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.4634000062942505},{"id":"https://openalex.org/keywords/scheme","display_name":"Scheme (mathematics)","score":0.450300008058548},{"id":"https://openalex.org/keywords/simple","display_name":"Simple (philosophy)","score":0.43860000371932983}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7235999703407288},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6141999959945679},{"id":"https://openalex.org/C97931131","wikidata":"https://www.wikidata.org/wiki/Q5282087","display_name":"Discriminative model","level":2,"score":0.5745000243186951},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5684000253677368},{"id":"https://openalex.org/C165696696","wikidata":"https://www.wikidata.org/wiki/Q11287","display_name":"Exploit","level":2,"score":0.5623999834060669},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5303999781608582},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5246000289916992},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.4634000062942505},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.450300008058548},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.43860000371932983},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.3806000053882599},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.3416000008583069},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.34119999408721924},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.3052000105381012},{"id":"https://openalex.org/C47177190","wikidata":"https://www.wikidata.org/wiki/Q207137","display_name":"Curriculum","level":2,"score":0.2858000099658966},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.265500009059906},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.2651999890804291},{"id":"https://openalex.org/C28006648","wikidata":"https://www.wikidata.org/wiki/Q6934509","display_name":"Multi-task learning","level":3,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.04767","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.04767","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.04767","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.04767","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.63905930519104,"id":"https://metadata.un.org/sdg/10","display_name":"Reduced inequalities"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,82,247],"from":[2,21,89,103,145,155],"verifiable":[3],"rewards":[4],"(RLVR)":[5],"has":[6],"improved":[7],"the":[8,70,75,116,151,171,220,234,254],"reasoning":[9,197],"abilities":[10],"of":[11],"LLMs,":[12],"yet":[13,44],"a":[14,42,87,127],"fundamental":[15],"limitation":[16],"remains:":[17],"models":[18,100,194],"cannot":[19],"learn":[20,102,154],"problems":[22,55,156,175],"that":[23,68,129,157,226],"are":[24],"too":[25],"difficult":[26],"to":[27,91,97,112,147,153,188],"solve":[28],"under":[29,162],"their":[30],"current":[31],"policy,":[32],"as":[33,62,248],"these":[34],"yield":[35],"no":[36],"meaningful":[37],"reward":[38],"signal.":[39],"We":[40,51,223],"propose":[41],"simple":[43],"effective":[45,76,250],"solution":[46],"based":[47,140],"on":[48,115,121,141,170],"task":[49,243],"reformulation.":[50],"transform":[52],"challenging":[53],"open-ended":[54,118],"into":[56,136],"cognitively":[57],"simpler":[58],"variants":[59,132],"--":[60,67],"such":[61],"multiple-choice":[63],"and":[64,79,107,133,180,195,205,215,233,245],"cloze":[65],"formats":[66],"preserve":[69],"original":[71,117],"answer":[72],"while":[73],"reducing":[74],"search":[77],"space":[78],"providing":[80],"denser":[81],"signals.":[83],"These":[84],"reformulations":[85],"span":[86],"spectrum":[88],"discriminative":[90],"generative":[92],"tasks,":[93],"which":[94],"we":[95,124],"exploit":[96],"bootstrap":[98],"learning:":[99],"first":[101],"structured,":[104],"easier":[105,146],"formats,":[106,149],"this":[108,122],"knowledge":[109],"transfers":[110],"back":[111],"improve":[113],"performance":[114],"problems.":[119],"Building":[120],"insight,":[123],"introduce":[125],"Cog-DRIFT,":[126],"framework":[128],"constructs":[130],"reformulated":[131],"organizes":[134],"them":[135],"an":[137,249],"adaptive":[138],"curriculum":[139,235,246],"difficulty.":[142],"Training":[143],"progresses":[144],"harder":[148],"enabling":[150],"model":[152],"previously":[158],"yielded":[159],"zero":[160],"signal":[161],"standard":[163,203],"RL":[164],"post-training.":[165,259],"Cog-DRIFT":[166,211,227],"not":[167],"only":[168],"improves":[169,228,236],"originally":[172],"unsolvable":[173],"hard":[174],"(absolute":[176],"+10.11%":[177],"for":[178,182,252],"Qwen":[179],"+8.64%":[181],"Llama)":[183],"but":[184],"also":[185],"generalizes":[186],"well":[187],"other":[189],"held-out":[190],"datasets.":[191],"Across":[192],"2":[193],"6":[196],"benchmarks,":[198],"our":[199,240],"method":[200],"consistently":[201],"outperforms":[202],"GRPO":[204],"strong":[206],"guided-exploration":[207],"baselines.":[208],"On":[209],"average,":[210],"shows":[212],"+4.72%":[213],"(Qwen)":[214],"+3.23%":[216],"(Llama)":[217],"improvements":[218],"over":[219],"second-best":[221],"baseline.":[222],"further":[224],"show":[225],"pass@k":[229],"at":[230],"test":[231],"time,":[232],"sample":[237],"efficiency.":[238],"Overall,":[239],"results":[241],"highlight":[242],"reformulation":[244],"paradigm":[251],"overcoming":[253],"exploration":[255],"barrier":[256],"in":[257],"LLM":[258]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-08T00:00:00"}
