{"id":"https://openalex.org/W7137829469","doi":"https://doi.org/10.48550/arxiv.2603.15434","title":"Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning","display_name":"Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning","publication_year":2026,"publication_date":"2026-03-16","ids":{"openalex":"https://openalex.org/W7137829469","doi":"https://doi.org/10.48550/arxiv.2603.15434"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.15434","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.15434","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.15434","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129698020","display_name":"Jing Christine Ye","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ye, Jing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5102636467","display_name":"Xinpei Zhao","orcid":"https://orcid.org/0009-0000-6597-7582"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhao, Xinpei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129746876","display_name":"Lu Xiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiang, Lu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129741869","display_name":"Yaping Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Yaping","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129694634","display_name":"Chengqing Zong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zong, Chengqing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12031","display_name":"Speech and dialogue systems","score":0.6362000107765198,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12031","display_name":"Speech and dialogue systems","score":0.6362000107765198,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.16449999809265137,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10667","display_name":"Emotion and Mood Recognition","score":0.05909999832510948,"subfield":{"id":"https://openalex.org/subfields/3205","display_name":"Experimental and Cognitive Psychology"},"field":{"id":"https://openalex.org/fields/32","display_name":"Psychology"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7610999941825867},{"id":"https://openalex.org/keywords/hindsight-bias","display_name":"Hindsight bias","score":0.7315000295639038},{"id":"https://openalex.org/keywords/active-listening","display_name":"Active listening","score":0.5174000263214111},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.4724000096321106},{"id":"https://openalex.org/keywords/rubric","display_name":"Rubric","score":0.4203999936580658},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4108999967575073},{"id":"https://openalex.org/keywords/ranking","display_name":"Ranking (information retrieval)","score":0.3296999931335449},{"id":"https://openalex.org/keywords/bootstrapping","display_name":"Bootstrapping (finance)","score":0.30390000343322754}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7610999941825867},{"id":"https://openalex.org/C10347200","wikidata":"https://www.wikidata.org/wiki/Q1960297","display_name":"Hindsight bias","level":2,"score":0.7315000295639038},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7172999978065491},{"id":"https://openalex.org/C177291462","wikidata":"https://www.wikidata.org/wiki/Q423038","display_name":"Active listening","level":2,"score":0.5174000263214111},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4878000020980835},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.4724000096321106},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4593999981880188},{"id":"https://openalex.org/C111640148","wikidata":"https://www.wikidata.org/wiki/Q847349","display_name":"Rubric","level":2,"score":0.4203999936580658},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4108999967575073},{"id":"https://openalex.org/C189430467","wikidata":"https://www.wikidata.org/wiki/Q7293293","display_name":"Ranking (information retrieval)","level":2,"score":0.3296999931335449},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3131999969482422},{"id":"https://openalex.org/C207609745","wikidata":"https://www.wikidata.org/wiki/Q4944086","display_name":"Bootstrapping (finance)","level":2,"score":0.30390000343322754},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.29989999532699585},{"id":"https://openalex.org/C3770464","wikidata":"https://www.wikidata.org/wiki/Q775963","display_name":"Smoothing","level":2,"score":0.28780001401901245},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.2874999940395355},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.27559998631477356},{"id":"https://openalex.org/C155911762","wikidata":"https://www.wikidata.org/wiki/Q422321","display_name":"Blueprint","level":2,"score":0.2639000117778778},{"id":"https://openalex.org/C197129107","wikidata":"https://www.wikidata.org/wiki/Q1921621","display_name":"Merge (version control)","level":2,"score":0.2637999951839447},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.259799987077713},{"id":"https://openalex.org/C2164484","wikidata":"https://www.wikidata.org/wiki/Q5170150","display_name":"Core (optical fiber)","level":2,"score":0.2563000023365021},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.25619998574256897},{"id":"https://openalex.org/C110384440","wikidata":"https://www.wikidata.org/wiki/Q1143270","display_name":"Upsampling","level":3,"score":0.25369998812675476},{"id":"https://openalex.org/C2779843651","wikidata":"https://www.wikidata.org/wiki/Q7390335","display_name":"SIGNAL (programming language)","level":2,"score":0.25119999051094055},{"id":"https://openalex.org/C97256817","wikidata":"https://www.wikidata.org/wiki/Q1462316","display_name":"Spurious relationship","level":2,"score":0.25040000677108765}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.15434","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.15434","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.15434","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.15434","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"While":[0],"current":[1],"emotional":[2,45,116],"support":[3],"dialogue":[4,86],"systems":[5],"typically":[6],"rely":[7],"on":[8,155],"expert-defined":[9],"scalar":[10,139],"rewards":[11],"for":[12,142,149],"alignment,":[13],"these":[14],"signals":[15,128],"suffer":[16],"from":[17,38,57],"severe":[18],"information":[19],"sparsity.":[20],"They":[21],"cannot":[22],"explain":[23],"why":[24],"a":[25,73,88],"response":[26],"failed":[27],"or":[28],"how":[29],"to":[30,32,96],"adapt":[31],"dynamic":[33],"user":[34,94,115,123],"states,":[35],"often":[36],"diverging":[37],"the":[39,49,58],"actual":[40],"goal":[41],"of":[42],"facilitating":[43],"positive":[44,170],"shifts.":[46],"In":[47],"practice,":[48],"most":[50],"direct":[51],"and":[52,91,129,132,157],"reliable":[53],"learning":[54,166],"signal":[55],"emerges":[56],"user's":[59],"continuous":[60],"reactions":[61,124],"during":[62],"ongoing":[63],"interaction.":[64],"We":[65],"therefore":[66],"propose":[67],"Reaction":[68],"Aware":[69],"Policy":[70,135],"Optimization":[71],"(RAPO),":[72],"framework":[74],"that":[75,112,160],"optimizes":[76],"over":[77],"interaction":[78,171],"consequences":[79],"rather":[80],"than":[81],"rubric":[82],"scores.":[83],"RAPO":[84,161],"treats":[85],"as":[87],"reaction-driven":[89],"process":[90],"utilizes":[92],"simulated":[93],"responses":[95],"generate":[97],"dense":[98],"natural-language":[99,130],"feedback":[100,147],"through":[101],"three":[102],"core":[103],"components:":[104],"Hindsight":[105,119],"Dialogue":[106],"Selection,":[107],"which":[108,121,137],"isolates":[109],"pivotal":[110],"turns":[111],"meaningfully":[113],"alter":[114],"trajectories;":[117],"Generative":[118],"Feedback,":[120],"transforms":[122],"into":[125],"contrastive":[126],"ranking":[127],"critiques;":[131],"Scalar-Verbal":[133],"Hybrid":[134],"Optimization,":[136],"couples":[138],"reward":[140],"optimization":[141],"global":[143],"alignment":[144],"with":[145],"verbal":[146],"distillation":[148],"fine-grained":[150],"semantic":[151],"refinement.":[152],"Extensive":[153],"experiments":[154],"ESC":[156],"Sotopia":[158],"demonstrate":[159],"significantly":[162],"outperforms":[163],"strong":[164],"reinforcement":[165],"baselines":[167],"in":[168],"driving":[169],"outcomes.":[172]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-03-18T00:00:00"}
