{"id":"https://openalex.org/W7163700030","doi":"https://doi.org/10.48550/arxiv.2606.05296","title":"Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents","display_name":"Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents","publication_year":2026,"publication_date":"2026-06-03","ids":{"openalex":"https://openalex.org/W7163700030","doi":"https://doi.org/10.48550/arxiv.2606.05296"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.05296","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05296","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.05296","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5137977426","display_name":"Dae Yon Hwang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hwang, Dae Yon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137935965","display_name":"Raunaq Suri","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Suri, Raunaq","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5005089622","display_name":"Valentin Villecroze","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Villecroze, Valentin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5006499420","display_name":"Anthony L. Caterini","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Caterini, Anthony L.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5011437676","display_name":"Jesse C. Cresswell","orcid":"https://orcid.org/0000-0002-9284-8804"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cresswell, Jesse C.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5038173846","display_name":"No\u00ebl Vouitsis","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Vouitsis, No\u00ebl","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5086448188","display_name":"Brendan Leigh Ross","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ross, Brendan Leigh","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6049000024795532,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.6049000024795532,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.03660000115633011,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.03290000185370445,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8270999789237976},{"id":"https://openalex.org/keywords/monte-carlo-method","display_name":"Monte Carlo method","score":0.5390999913215637},{"id":"https://openalex.org/keywords/bayesian-probability","display_name":"Bayesian probability","score":0.5285999774932861},{"id":"https://openalex.org/keywords/rendering","display_name":"Rendering (computer graphics)","score":0.4880000054836273},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.45249998569488525},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.4505000114440918},{"id":"https://openalex.org/keywords/bayesian-optimization","display_name":"Bayesian optimization","score":0.4259999990463257},{"id":"https://openalex.org/keywords/equivalence","display_name":"Equivalence (formal languages)","score":0.4235999882221222}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8270999789237976},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7023000121116638},{"id":"https://openalex.org/C19499675","wikidata":"https://www.wikidata.org/wiki/Q232207","display_name":"Monte Carlo method","level":2,"score":0.5390999913215637},{"id":"https://openalex.org/C107673813","wikidata":"https://www.wikidata.org/wiki/Q812534","display_name":"Bayesian probability","level":2,"score":0.5285999774932861},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5184999704360962},{"id":"https://openalex.org/C205711294","wikidata":"https://www.wikidata.org/wiki/Q176953","display_name":"Rendering (computer graphics)","level":2,"score":0.4880000054836273},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.48330000042915344},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.45249998569488525},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.4505000114440918},{"id":"https://openalex.org/C2778049539","wikidata":"https://www.wikidata.org/wiki/Q17002908","display_name":"Bayesian optimization","level":2,"score":0.4259999990463257},{"id":"https://openalex.org/C2780069185","wikidata":"https://www.wikidata.org/wiki/Q7977945","display_name":"Equivalence (formal languages)","level":2,"score":0.4235999882221222},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.41780000925064087},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.41519999504089355},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.396699994802475},{"id":"https://openalex.org/C160234255","wikidata":"https://www.wikidata.org/wiki/Q812535","display_name":"Bayesian inference","level":3,"score":0.3386000096797943},{"id":"https://openalex.org/C73602740","wikidata":"https://www.wikidata.org/wiki/Q7795822","display_name":"Thompson sampling","level":3,"score":0.3359000086784363},{"id":"https://openalex.org/C52421305","wikidata":"https://www.wikidata.org/wiki/Q1151499","display_name":"Particle filter","level":3,"score":0.3181000053882599},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.31380000710487366},{"id":"https://openalex.org/C177769412","wikidata":"https://www.wikidata.org/wiki/Q278090","display_name":"Prior probability","level":3,"score":0.30880001187324524},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.25540000200271606}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.05296","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05296","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.05296","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.05296","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.7376854419708252,"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"LLM":[0,100,173],"agents":[1,8,16,28],"operate":[2],"in":[3],"two":[4],"distinct":[5],"regimes:":[6],"open-weight":[7],"amenable":[9],"to":[10,52,67,107,117],"reinforcement":[11],"learning":[12,113],"(RL)":[13],"and":[14,58,145],"black-box":[15,27,76,99,125,172],"whose":[17,92],"behaviour":[18],"must":[19],"be":[20],"controlled":[21],"purely":[22],"at":[23,178],"test":[24],"time.":[25],"Although":[26],"are":[29],"often":[30],"backed":[31],"by":[32,112],"state-of-the-art":[33],"proprietary":[34],"LLMs,":[35],"API-only":[36],"access":[37],"precludes":[38],"parameter-level":[39],"optimization,":[40],"rendering":[41],"most":[42],"RL":[43,57],"methods":[44],"inapplicable.":[45],"To":[46],"address":[47],"this":[48,110],"limitation,":[49],"we":[50,94,154],"turn":[51],"a":[53,75,88,114],"known":[54],"equivalence":[55],"between":[56],"Bayesian":[59],"inference.":[60],"We":[61,102,128],"propose":[62],"Agentic":[63],"Monte":[64,105],"Carlo":[65,106],"(AMC)":[66],"directly":[68],"sample":[69,108],"from":[70,109,135],"the":[71,97,119,123,136,156,164],"optimal":[72,85],"policy":[73,86],"of":[74,159,166,171],"agent":[77,120],"rather":[78],"than":[79],"training":[80],"it":[81],"through":[82],"RL.":[83],"The":[84],"is":[87,176],"posterior":[89,111],"over":[90,142],"trajectories":[91],"prior":[93],"define":[95],"as":[96,153],"fixed":[98],"agent.":[101],"employ":[103],"Sequential":[104],"value":[115],"function":[116],"steer":[118],"while":[121],"leaving":[122],"underlying":[124],"model":[126],"unchanged.":[127],"validate":[129],"AMC":[130,162],"on":[131],"three":[132],"diverse":[133],"environments":[134],"AgentGym":[137],"benchmark,":[138],"demonstrating":[139],"significant":[140],"improvements":[141],"prompting":[143],"baselines":[144],"even":[146],"outperforming":[147],"Group":[148],"Relative":[149],"Policy":[150],"Optimization":[151],"(GRPO)":[152],"scale":[155],"test-time":[157],"compute":[158],"our":[160],"method.":[161],"demonstrates":[163],"feasibility":[165],"performing":[167],"principled":[168],"RL-style":[169],"optimization":[170],"agents.":[174],"Code":[175],"available":[177],"https://github.com/layer6ai-labs/Agentic-Monte-Carlo":[179]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-06T00:00:00"}
