{"id":"https://openalex.org/W7134268323","doi":"https://doi.org/10.48550/arxiv.2603.06065","title":"ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning","display_name":"ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning","publication_year":2026,"publication_date":"2026-03-06","ids":{"openalex":"https://openalex.org/W7134268323","doi":"https://doi.org/10.48550/arxiv.2603.06065"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.06065","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5128141975","display_name":"Yiruo Cheng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cheng, Yiruo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5074229248","display_name":"Kelong Mao","orcid":"https://orcid.org/0000-0002-5648-568X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mao, Kelong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128541221","display_name":"Tianhao Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li, Tianhao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128459267","display_name":"Jiejun Tan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tan, Jiejun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128590882","display_name":"Ji-Rong Wen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wen, Ji-Rong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5128561775","display_name":"Zhicheng Dou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dou, Zhicheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.28474126,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.10809999704360962,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.10809999704360962,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.10260000079870224,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12128","display_name":"AI in Service Interactions","score":0.08169999718666077,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7405999898910522},{"id":"https://openalex.org/keywords/construct","display_name":"Construct (python library)","score":0.5620999932289124},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5550000071525574},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.5455999970436096},{"id":"https://openalex.org/keywords/quality","display_name":"Quality (philosophy)","score":0.5354999899864197},{"id":"https://openalex.org/keywords/interdependence","display_name":"Interdependence","score":0.5095999836921692},{"id":"https://openalex.org/keywords/outcome","display_name":"Outcome (game theory)","score":0.4966000020503998},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.489300012588501}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7914000153541565},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7405999898910522},{"id":"https://openalex.org/C2780801425","wikidata":"https://www.wikidata.org/wiki/Q5164392","display_name":"Construct (python library)","level":2,"score":0.5620999932289124},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5550000071525574},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.5455999970436096},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.5354999899864197},{"id":"https://openalex.org/C185874996","wikidata":"https://www.wikidata.org/wiki/Q269699","display_name":"Interdependence","level":2,"score":0.5095999836921692},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5088000297546387},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.4966000020503998},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.489300012588501},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4805999994277954},{"id":"https://openalex.org/C81917197","wikidata":"https://www.wikidata.org/wiki/Q628760","display_name":"Selection (genetic algorithm)","level":2,"score":0.4666000008583069},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.43130001425743103},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.3515999913215637},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.3425999879837036},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.31209999322891235},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.2937000095844269},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.29330000281333923},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.28369998931884766}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.06065","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.06065","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.06065","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.06065","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Conversational":[0],"shopping":[1,35,85],"agents":[2,26,36,41],"represent":[3],"a":[4,68,80,88],"critical":[5],"consumer-facing":[6],"application":[7],"of":[8],"Large":[9],"Language":[10],"Model":[11],"(LLM)-powered":[12],"agents,":[13],"yet":[14],"how":[15],"to":[16,23,71,110,185],"effectively":[17],"apply":[18],"post-training":[19],"Reinforcement":[20],"Learning":[21],"(RL)":[22],"optimize":[24],"such":[25],"remains":[27],"underexplored.":[28],"This":[29],"work":[30,178],"investigates":[31],"RL-based":[32],"optimization":[33],"for":[34,182],"in":[37],"real-world":[38,186],"scenarios,":[39],"where":[40],"must":[42],"simultaneously":[43],"satisfy":[44],"multiple":[45],"interdependent":[46],"objectives":[47],"spanning":[48],"objective":[49],"metrics":[50],"(product":[51],"correctness),":[52],"subjective":[53],"qualities":[54],"(persuasiveness),":[55],"outcome":[56],"rewards":[57,63],"(final":[58],"response":[59,137],"quality),":[60],"and":[61,149],"process":[62],"(tool":[64],"efficiency).":[65],"We":[66],"present":[67],"complete":[69],"methodology":[70],"address":[72],"this":[73,101],"challenge.":[74],"Specifically,":[75],"we":[76,104,127],"first":[77],"construct":[78],"SmartShopBench,":[79],"benchmark":[81],"that":[82,91,118,155],"captures":[83],"diverse":[84],"intents":[86],"with":[87,139],"hierarchical":[89],"evaluation":[90,102],"decomposes":[92],"complex":[93],"quality":[94,138],"requirements":[95],"into":[96],"measurable":[97],"levels.":[98],"Building":[99],"on":[100,147,166],"framework,":[103],"design":[105],"Hierarchical":[106],"Reward":[107],"Modeling":[108],"(HRM)":[109],"structure":[111],"mixed":[112],"reward":[113,148],"types":[114],"through":[115,142],"conditional":[116],"gating":[117],"reflects":[119],"their":[120],"logical":[121],"dependencies.":[122],"To":[123],"enable":[124],"efficient":[125],"training,":[126],"further":[128],"propose":[129],"Dynamic":[130],"Contrastive":[131],"Policy":[132],"Optimization":[133],"(DCPO),":[134],"which":[135],"balances":[136],"operational":[140],"efficiency":[141],"dynamic":[143],"trajectory":[144],"selection":[145],"based":[146],"reasoning":[150],"length.":[151],"Extensive":[152],"experiments":[153],"demonstrate":[154],"our":[156],"RL-trained":[157],"agent,":[158],"namely":[159],"ChatShopBuddy,":[160],"consistently":[161],"outperforms":[162],"larger":[163],"models":[164],"relying":[165],"generic":[167],"reasoning,":[168],"achieving":[169],"superior":[170],"stability":[171],"rather":[172],"than":[173],"merely":[174],"higher":[175],"peaks.":[176],"Our":[177],"provides":[179],"valuable":[180],"guidance":[181],"applying":[183],"RL":[184],"conversational":[187],"agents.":[188]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-10T00:00:00"}
