{"id":"https://openalex.org/W7154224435","doi":"https://doi.org/10.48550/arxiv.2604.09855","title":"Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards","display_name":"Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards","publication_year":2026,"publication_date":"2026-04-10","ids":{"openalex":"https://openalex.org/W7154224435","doi":"https://doi.org/10.48550/arxiv.2604.09855"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.09855","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.09855","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.09855","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5061588035","display_name":"Shuze Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Shuze Daniel","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133564145","display_name":"Claire Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Claire","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133575979","display_name":"Jiabao Sean Xiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiao, Jiabao Sean","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133573661","display_name":"Lei Lei","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lei, Lei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133611974","display_name":"Yuheng Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Yuheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5133578023","display_name":"Yisong Yue","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yue, Yisong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5133624358","display_name":"David Simchi-Levi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Simchi-Levi, David","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.10180000215768814,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.10180000215768814,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.09679999947547913,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.09260000288486481,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7052000164985657},{"id":"https://openalex.org/keywords/negotiation","display_name":"Negotiation","score":0.7021999955177307},{"id":"https://openalex.org/keywords/adversarial-system","display_name":"Adversarial system","score":0.45260000228881836},{"id":"https://openalex.org/keywords/verifiable-secret-sharing","display_name":"Verifiable secret sharing","score":0.39809998869895935},{"id":"https://openalex.org/keywords/maximization","display_name":"Maximization","score":0.387800008058548},{"id":"https://openalex.org/keywords/bureaucracy","display_name":"Bureaucracy","score":0.3589000105857849},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.35569998621940613},{"id":"https://openalex.org/keywords/incentive","display_name":"Incentive","score":0.3452000021934509}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7052000164985657},{"id":"https://openalex.org/C199776023","wikidata":"https://www.wikidata.org/wiki/Q202875","display_name":"Negotiation","level":2,"score":0.7021999955177307},{"id":"https://openalex.org/C175444787","wikidata":"https://www.wikidata.org/wiki/Q39072","display_name":"Microeconomics","level":1,"score":0.4959999918937683},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.49050000309944153},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.45260000228881836},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.4456000030040741},{"id":"https://openalex.org/C85847156","wikidata":"https://www.wikidata.org/wiki/Q59015987","display_name":"Verifiable secret sharing","level":3,"score":0.39809998869895935},{"id":"https://openalex.org/C2776330181","wikidata":"https://www.wikidata.org/wiki/Q18358244","display_name":"Maximization","level":2,"score":0.387800008058548},{"id":"https://openalex.org/C51575053","wikidata":"https://www.wikidata.org/wiki/Q72468","display_name":"Bureaucracy","level":3,"score":0.3589000105857849},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.35569998621940613},{"id":"https://openalex.org/C29122968","wikidata":"https://www.wikidata.org/wiki/Q1414816","display_name":"Incentive","level":2,"score":0.3452000021934509},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.3278000056743622},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3271999955177307},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.3095000088214874},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.2939999997615814},{"id":"https://openalex.org/C99221444","wikidata":"https://www.wikidata.org/wiki/Q1532069","display_name":"Private information retrieval","level":2,"score":0.2854999899864197},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.2784000039100647},{"id":"https://openalex.org/C43091099","wikidata":"https://www.wikidata.org/wiki/Q1067788","display_name":"Through-the-lens metering","level":3,"score":0.2761000096797943},{"id":"https://openalex.org/C2779795794","wikidata":"https://www.wikidata.org/wiki/Q7315343","display_name":"Reset (finance)","level":2,"score":0.274399995803833},{"id":"https://openalex.org/C110121322","wikidata":"https://www.wikidata.org/wiki/Q865811","display_name":"Distribution (mathematics)","level":2,"score":0.26980000734329224},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.26930001378059387},{"id":"https://openalex.org/C171268870","wikidata":"https://www.wikidata.org/wiki/Q1486676","display_name":"GRASP","level":2,"score":0.2565999925136566},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.2554999887943268},{"id":"https://openalex.org/C41065033","wikidata":"https://www.wikidata.org/wiki/Q2825412","display_name":"Adversary","level":2,"score":0.2522999942302704},{"id":"https://openalex.org/C177142836","wikidata":"https://www.wikidata.org/wiki/Q44455","display_name":"Game theory","level":2,"score":0.2506999969482422}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.09855","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.09855","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.09855","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.09855","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0,108],"recent":[1],"advancement":[2],"of":[3,23,80,91,123],"Large":[4],"Language":[5],"Models":[6],"(LLMs)":[7],"has":[8],"established":[9],"their":[10],"potential":[11],"as":[12,27],"autonomous":[13],"interactive":[14],"agents.":[15],"However,":[16],"they":[17],"often":[18],"struggle":[19],"in":[20,88,152],"strategic":[21,53,106],"games":[22],"incomplete":[24],"information,":[25],"such":[26],"bilateral":[28],"price":[29],"negotiation.":[30],"In":[31],"this":[32,135],"paper,":[33],"we":[34,50,101],"investigate":[35],"if":[36],"Reinforcement":[37],"Learning":[38],"from":[39,111],"Verifiable":[40],"Rewards":[41],"(RLVR)":[42],"can":[43],"effectively":[44],"teach":[45],"LLMs":[46],"to":[47,97,114,142,161],"negotiate.":[48],"Specifically,":[49],"explore":[51],"the":[52,58,89,156],"behaviors":[54],"that":[55,65,134],"emerge":[56],"during":[57,165],"learning":[59],"process.":[60],"We":[61],"introduce":[62],"a":[63,67,72,77,103,121,139],"framework":[64],"trains":[66],"mid-sized":[68],"buyer":[69],"agent":[70,109,141,158],"against":[71],"regulated":[73],"LLM":[74],"seller":[75,175],"across":[76],"wide":[78],"distribution":[79],"real-world":[81],"products.":[82],"By":[83],"grounding":[84],"reward":[85],"signals":[86],"directly":[87],"maximization":[90],"economic":[92],"surplus":[93],"and":[94,125,167],"strict":[95],"adherence":[96],"private":[98],"budget":[99],"constraints,":[100],"reveal":[102],"novel":[104],"four-phase":[105],"evolution.":[107],"progresses":[110],"naive":[112],"bargaining":[113],"using":[115],"aggressive":[116],"starting":[117],"prices,":[118],"moves":[119],"through":[120],"phase":[122],"deadlock,":[124],"ultimately":[126],"develops":[127],"sophisticated":[128],"persuasive":[129],"skills.":[130],"Our":[131],"results":[132],"demonstrate":[133],"verifiable":[136],"training":[137,166],"allows":[138],"30B":[140],"significantly":[143],"outperform":[144],"frontier":[145],"models":[146],"over":[147],"ten":[148],"times":[149],"its":[150],"size":[151],"extracting":[153],"surplus.":[154],"Furthermore,":[155],"trained":[157],"generalizes":[159],"robustly":[160],"stronger":[162],"counterparties":[163],"unseen":[164],"remains":[168],"effective":[169],"even":[170],"when":[171],"facing":[172],"hostile,":[173],"adversarial":[174],"personas.":[176]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-15T00:00:00"}
