{"id":"https://openalex.org/W7160947009","doi":"https://doi.org/10.48550/arxiv.2605.08686","title":"Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs","display_name":"Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs","publication_year":2026,"publication_date":"2026-05-09","ids":{"openalex":"https://openalex.org/W7160947009","doi":"https://doi.org/10.48550/arxiv.2605.08686"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.08686","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.08686","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.08686","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5012031491","display_name":"Wenzhi Fang","orcid":"https://orcid.org/0000-0003-3013-8978"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fang, Wenzhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5022883297","display_name":"Liangqi Yuan","orcid":"https://orcid.org/0000-0002-9994-6773"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuan, Liangqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5060130166","display_name":"Guangchen Lan","orcid":"https://orcid.org/0000-0001-7969-7303"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lan, Guangchen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101403023","display_name":"Dong-Jun Han","orcid":"https://orcid.org/0000-0003-2970-7336"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Han, Dong-Jun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5020399355","display_name":"Christopher G. Brinton","orcid":"https://orcid.org/0000-0003-2771-3521"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Brinton, Christopher G.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.32409998774528503,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.32409998774528503,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10456","display_name":"Multi-Agent Systems and Negotiation","score":0.06870000064373016,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.0681999996304512,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/controller","display_name":"Controller (irrigation)","score":0.7336000204086304},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.6474000215530396},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.6446999907493591},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.5059999823570251},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.4553999900817871},{"id":"https://openalex.org/keywords/iterative-method","display_name":"Iterative method","score":0.42340001463890076},{"id":"https://openalex.org/keywords/markov-chain","display_name":"Markov chain","score":0.41029998660087585},{"id":"https://openalex.org/keywords/iterative-and-incremental-development","display_name":"Iterative and incremental development","score":0.40369999408721924}],"concepts":[{"id":"https://openalex.org/C203479927","wikidata":"https://www.wikidata.org/wiki/Q5165939","display_name":"Controller (irrigation)","level":2,"score":0.7336000204086304},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6647999882698059},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.6474000215530396},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.6446999907493591},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.5059999823570251},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.4553999900817871},{"id":"https://openalex.org/C159694833","wikidata":"https://www.wikidata.org/wiki/Q2321565","display_name":"Iterative method","level":2,"score":0.42340001463890076},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.41029998660087585},{"id":"https://openalex.org/C143587482","wikidata":"https://www.wikidata.org/wiki/Q1543216","display_name":"Iterative and incremental development","level":2,"score":0.40369999408721924},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3984000086784363},{"id":"https://openalex.org/C117619785","wikidata":"https://www.wikidata.org/wiki/Q6094414","display_name":"Iterative learning control","level":3,"score":0.38190001249313354},{"id":"https://openalex.org/C133731056","wikidata":"https://www.wikidata.org/wiki/Q4917288","display_name":"Control engineering","level":1,"score":0.33629998564720154},{"id":"https://openalex.org/C161362739","wikidata":"https://www.wikidata.org/wiki/Q2301555","display_name":"Open-loop controller","level":3,"score":0.32179999351501465},{"id":"https://openalex.org/C28427503","wikidata":"https://www.wikidata.org/wiki/Q13580300","display_name":"Internal model","level":3,"score":0.3206000030040741},{"id":"https://openalex.org/C155386361","wikidata":"https://www.wikidata.org/wiki/Q1649571","display_name":"Process control","level":3,"score":0.3052999973297119},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.2825999855995178},{"id":"https://openalex.org/C17500928","wikidata":"https://www.wikidata.org/wiki/Q959968","display_name":"Control system","level":2,"score":0.27799999713897705},{"id":"https://openalex.org/C2984730371","wikidata":"https://www.wikidata.org/wiki/Q6501221","display_name":"Feedback controller","level":3,"score":0.27549999952316284},{"id":"https://openalex.org/C174998907","wikidata":"https://www.wikidata.org/wiki/Q357662","display_name":"Work in process","level":2,"score":0.2587999999523163},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.2572999894618988},{"id":"https://openalex.org/C89611455","wikidata":"https://www.wikidata.org/wiki/Q6804646","display_name":"Mechanism (biology)","level":2,"score":0.2572000026702881},{"id":"https://openalex.org/C6802819","wikidata":"https://www.wikidata.org/wiki/Q1072174","display_name":"Linear system","level":2,"score":0.2513999938964844}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.08686","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.08686","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.08686","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.08686","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.7591003775596619}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multi-agent":[0],"large":[1],"language":[2],"model":[3,30],"(LLM)":[4],"systems":[5,135],"often":[6],"rely":[7],"on":[8],"a":[9,13,29,57,65,99,110,126],"controller":[10,59,73,114,121],"to":[11,24,43,80,153],"coordinate":[12],"pool":[14],"of":[15,164],"heterogeneous":[16,133],"models,":[17],"yet":[18],"existing":[19],"controllers":[20],"are":[21],"typically":[22],"limited":[23],"one-shot":[25],"routing:":[26],"they":[27],"select":[28],"once":[31],"and":[32,118,136,148],"return":[33],"its":[34],"output":[35],"directly.":[36],"Such":[37],"routing-only":[38],"designs":[39],"provide":[40],"no":[41],"mechanism":[42],"critique":[44],"intermediate":[45],"drafts":[46],"or":[47,82],"support":[48],"iterative":[49],"refinement.":[50,93],"To":[51],"address":[52],"this":[53,96],"limitation,":[54],"we":[55],"propose":[56],"critique-and-routing":[58],"that":[60,141],"casts":[61],"multi-agent":[62,134],"coordination":[63],"as":[64,98],"sequential":[66],"decision":[67],"problem.":[68],"At":[69],"each":[70],"turn,":[71],"the":[72,75,88,120,151,154],"evaluates":[74],"current":[76],"draft,":[77],"decides":[78],"whether":[79],"stop":[81],"continue,":[83],"and,":[84],"if":[85],"needed,":[86],"selects":[87],"next":[89],"agent":[90],"for":[91,113,160],"further":[92],"We":[94],"formulate":[95],"process":[97],"finite-horizon":[100],"Markov":[101],"Decision":[102],"Process":[103],"(MDP)":[104],"with":[105],"explicit":[106],"agent-utilization":[107],"constraints,":[108],"design":[109],"composite":[111],"reward":[112],"decisions":[115],"across":[116,131],"turns,":[117],"optimize":[119],"via":[122],"policy":[123],"gradients":[124],"under":[125],"Lagrangian-relaxed":[127],"objective.":[128],"Extensive":[129],"experiments":[130],"multiple":[132],"seven":[137],"reasoning":[138],"benchmarks":[139],"show":[140],"our":[142],"method":[143],"consistently":[144],"outperforms":[145],"state-of-the-art":[146],"baselines":[147],"substantially":[149],"narrows":[150],"gap":[152],"strongest":[155],"agent,":[156],"while":[157],"using":[158],"it":[159],"fewer":[161],"than":[162],"25%":[163],"total":[165],"calls.":[166]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-13T00:00:00"}
