{"id":"https://openalex.org/W7164892753","doi":"https://doi.org/10.48550/arxiv.2606.15197","title":"StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling","display_name":"StarOR: Synergizing Tree Search and Test-Time Reinforcement Learning for Optimization Modeling","publication_year":2026,"publication_date":"2026-06-13","ids":{"openalex":"https://openalex.org/W7164892753","doi":"https://doi.org/10.48550/arxiv.2606.15197"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.15197","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15197","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.15197","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5138699076","display_name":"Jiajun Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Jiajun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138729714","display_name":"Yu Ding","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ding, Yu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5125755819","display_name":"Shisi Guan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Guan, Shisi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138731830","display_name":"Ran Hou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hou, Ran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138700233","display_name":"Wanyuan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Wanyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.296999990940094,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.296999990940094,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.07010000199079514,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.035999998450279236,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6798999905586243},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5716999769210815},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.43320000171661377},{"id":"https://openalex.org/keywords/tree","display_name":"Tree (set theory)","score":0.4146000146865845},{"id":"https://openalex.org/keywords/optimization-problem","display_name":"Optimization problem","score":0.3921000063419342},{"id":"https://openalex.org/keywords/sequence","display_name":"Sequence (biology)","score":0.3840000033378601},{"id":"https://openalex.org/keywords/tree-structure","display_name":"Tree structure","score":0.29490000009536743}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8342000246047974},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6798999905586243},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5716999769210815},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5338000059127808},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.45899999141693115},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.43320000171661377},{"id":"https://openalex.org/C113174947","wikidata":"https://www.wikidata.org/wiki/Q2859736","display_name":"Tree (set theory)","level":2,"score":0.4146000146865845},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3921000063419342},{"id":"https://openalex.org/C2778112365","wikidata":"https://www.wikidata.org/wiki/Q3511065","display_name":"Sequence (biology)","level":2,"score":0.3840000033378601},{"id":"https://openalex.org/C163797641","wikidata":"https://www.wikidata.org/wiki/Q2067937","display_name":"Tree structure","level":3,"score":0.29490000009536743},{"id":"https://openalex.org/C2778049539","wikidata":"https://www.wikidata.org/wiki/Q17002908","display_name":"Bayesian optimization","level":2,"score":0.28529998660087585},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.2685000002384186},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.2574000060558319},{"id":"https://openalex.org/C40506919","wikidata":"https://www.wikidata.org/wiki/Q7452469","display_name":"Sequence learning","level":2,"score":0.2565000057220459},{"id":"https://openalex.org/C2776654903","wikidata":"https://www.wikidata.org/wiki/Q2601463","display_name":"SAFER","level":2,"score":0.2531999945640564},{"id":"https://openalex.org/C19768560","wikidata":"https://www.wikidata.org/wiki/Q320727","display_name":"Dependency (UML)","level":2,"score":0.2515999972820282}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.15197","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15197","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.15197","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.15197","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.5201894640922546}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Optimization":[0],"modeling":[1,16,19,84,118],"is":[2],"inherently":[3],"hierarchical,":[4],"requiring":[5],"a":[6,57,75,101,125,180],"precise":[7],"sequence":[8],"of":[9],"symbolic":[10,47],"commitments.":[11],"Traditional":[12],"learning-based":[13],"automated":[14],"optimization":[15,113,170],"methods":[17,71,185],"improve":[18],"policies":[20],"through":[21],"large-scale":[22],"annotated":[23],"or":[24],"curated":[25],"training":[26],"data,":[27],"but":[28],"are":[29],"costly":[30],"to":[31,33,81],"adapt":[32],"new":[34],"problem":[35],"distributions.":[36],"Meanwhile,":[37],"one-shot":[38],"generation":[39],"remains":[40],"brittle":[41],"in":[42],"hierarchical":[43],"modeling,":[44],"where":[45],"early":[46],"errors":[48],"can":[49],"propagate":[50],"into":[51,120,147],"invalid":[52],"formulations.":[53],"Test-time":[54],"scaling":[55],"offers":[56],"promising":[58],"alternative":[59],"by":[60],"enabling":[61],"structural":[62],"exploration":[63,146],"with":[64,108,179],"additional":[65],"instance-level":[66],"computation;":[67],"however,":[68],"existing":[69,184],"search-based":[70],"typically":[72],"rely":[73],"on":[74],"fixed":[76],"policy,":[77],"causing":[78],"repeated":[79],"rollouts":[80],"inherit":[82],"similar":[83],"biases":[85],"and":[86,123,186],"providing":[87],"limited":[88],"credit":[89],"assignment":[90],"for":[91,112,160],"intermediate":[92,161],"decisions.":[93],"To":[94],"address":[95],"these":[96],"limitations,":[97],"we":[98],"propose":[99],"StarOR,":[100],"synergistic":[102],"search-and-adaptation":[103],"framework":[104],"that":[105,173],"couples":[106],"MCTS":[107],"Test-Time":[109],"Reinforcement":[110],"Learning":[111],"modeling.":[114],"StarOR":[115,143,174],"decomposes":[116],"the":[117,187],"process":[119],"four":[121],"stages":[122],"updates":[124],"transient":[126],"LoRA":[127],"adapter":[128],"via":[129],"GRPO":[130],"at":[131],"each":[132],"non-terminal":[133],"node.":[134],"By":[135],"using":[136],"MCTS-generated":[137],"siblings":[138],"as":[139],"local":[140],"comparison":[141],"sets,":[142],"transforms":[144],"search-time":[145],"instance-specific":[148],"policy":[149],"refinement.":[150],"Moreover,":[151],"an":[152],"unsupervised":[153],"multi-faceted":[154],"reward":[155],"system":[156],"provides":[157],"fine-grained":[158],"feedback":[159],"formulation":[162],"decisions":[163],"without":[164],"ground-truth":[165],"labels.":[166],"Experiments":[167],"across":[168],"five":[169],"benchmarks":[171],"show":[172],"achieves":[175],"state-of-the-art":[176],"performance":[177],"even":[178],"4B":[181],"backbone,":[182],"outperforming":[183],"frontier":[188],"LLMs.":[189]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-06-17T00:00:00"}
