{"id":"https://openalex.org/W4415230157","doi":"https://doi.org/10.1609/aies.v8i2.36657","title":"Reward-on-the-Line: A Novel Offline Reinforcement Learning Method for Building Legal Conversational Agents","display_name":"Reward-on-the-Line: A Novel Offline Reinforcement Learning Method for Building Legal Conversational Agents","publication_year":2025,"publication_date":"2025-10-15","ids":{"openalex":"https://openalex.org/W4415230157","doi":"https://doi.org/10.1609/aies.v8i2.36657"},"language":"en","primary_location":{"id":"doi:10.1609/aies.v8i2.36657","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aies.v8i2.36657","pdf_url":"https://ojs.aaai.org/index.php/AIES/article/download/36657/38795","source":{"id":"https://openalex.org/S5407048695","display_name":"Proceedings of the AAAI/ACM Conference on AI Ethics and Society","issn_l":"3065-8365","issn":["3065-8365"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society","raw_type":"journal-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"bronze","oa_url":"https://ojs.aaai.org/index.php/AIES/article/download/36657/38795","any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5108663545","display_name":"Xubo Lin","orcid":null},"institutions":[{"id":"https://openalex.org/I184565670","display_name":"Georgetown University","ror":"https://ror.org/05vzafd60","country_code":"US","type":"education","lineage":["https://openalex.org/I184565670"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Xubo Lin","raw_affiliation_strings":["Georgetown University, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Georgetown University, USA","institution_ids":["https://openalex.org/I184565670"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5115600760","display_name":"Mingze Wang","orcid":"https://orcid.org/0009-0001-6049-8782"},"institutions":[{"id":"https://openalex.org/I184565670","display_name":"Georgetown University","ror":"https://ror.org/05vzafd60","country_code":"US","type":"education","lineage":["https://openalex.org/I184565670"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Mingze Wang","raw_affiliation_strings":["Georgetown University, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Georgetown University, USA","institution_ids":["https://openalex.org/I184565670"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5002485529","display_name":"Grace Hui Yang","orcid":"https://orcid.org/0000-0001-6095-8358"},"institutions":[{"id":"https://openalex.org/I184565670","display_name":"Georgetown University","ror":"https://ror.org/05vzafd60","country_code":"US","type":"education","lineage":["https://openalex.org/I184565670"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Grace Hui Yang","raw_affiliation_strings":["Georgetown University, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Georgetown University, USA","institution_ids":["https://openalex.org/I184565670"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100696404","display_name":"Daniel Chen","orcid":"https://orcid.org/0000-0002-4716-549X"},"institutions":[{"id":"https://openalex.org/I3131550300","display_name":"Universit\u00e9 Toulouse-I-Capitole","ror":"https://ror.org/0443n9e75","country_code":"FR","type":"education","lineage":["https://openalex.org/I3131550300"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Daniel Chen","raw_affiliation_strings":["Universit\u00e9 Toulouse Capitole, France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Universit\u00e9 Toulouse Capitole, France","institution_ids":["https://openalex.org/I3131550300"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.25666954,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"8","issue":"2","first_page":"1575","last_page":"1584"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T13643","display_name":"Artificial Intelligence in Law","score":0.9786999821662903,"subfield":{"id":"https://openalex.org/subfields/3320","display_name":"Political Science and International Relations"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T13643","display_name":"Artificial Intelligence in Law","score":0.9786999821662903,"subfield":{"id":"https://openalex.org/subfields/3320","display_name":"Political Science and International Relations"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10456","display_name":"Multi-Agent Systems and Negotiation","score":0.9524999856948853,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8083000183105469},{"id":"https://openalex.org/keywords/negotiation","display_name":"Negotiation","score":0.7152000069618225},{"id":"https://openalex.org/keywords/path","display_name":"Path (computing)","score":0.4221999943256378},{"id":"https://openalex.org/keywords/supreme-court","display_name":"Supreme court","score":0.37619999051094055},{"id":"https://openalex.org/keywords/resource","display_name":"Resource (disambiguation)","score":0.3693999946117401},{"id":"https://openalex.org/keywords/intelligent-agent","display_name":"Intelligent agent","score":0.32199999690055847},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.29429998993873596}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8083000183105469},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.722599983215332},{"id":"https://openalex.org/C199776023","wikidata":"https://www.wikidata.org/wiki/Q202875","display_name":"Negotiation","level":2,"score":0.7152000069618225},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5831000208854675},{"id":"https://openalex.org/C2777735758","wikidata":"https://www.wikidata.org/wiki/Q817765","display_name":"Path (computing)","level":2,"score":0.4221999943256378},{"id":"https://openalex.org/C2778272461","wikidata":"https://www.wikidata.org/wiki/Q190752","display_name":"Supreme court","level":2,"score":0.37619999051094055},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3756999969482422},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.3693999946117401},{"id":"https://openalex.org/C74072328","wikidata":"https://www.wikidata.org/wiki/Q1142726","display_name":"Intelligent agent","level":2,"score":0.32199999690055847},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.29429998993873596},{"id":"https://openalex.org/C2780102126","wikidata":"https://www.wikidata.org/wiki/Q10928179","display_name":"Online and offline","level":2,"score":0.29109999537467957},{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.28940001130104065},{"id":"https://openalex.org/C2780490138","wikidata":"https://www.wikidata.org/wiki/Q7079636","display_name":"Offline learning","level":3,"score":0.2806999981403351},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.27570000290870667},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.27489998936653137},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.26969999074935913},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.25859999656677246},{"id":"https://openalex.org/C13687954","wikidata":"https://www.wikidata.org/wiki/Q4826847","display_name":"Autonomous agent","level":2,"score":0.25200000405311584}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1609/aies.v8i2.36657","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aies.v8i2.36657","pdf_url":"https://ojs.aaai.org/index.php/AIES/article/download/36657/38795","source":{"id":"https://openalex.org/S5407048695","display_name":"Proceedings of the AAAI/ACM Conference on AI Ethics and Society","issn_l":"3065-8365","issn":["3065-8365"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society","raw_type":"journal-article"}],"best_oa_location":{"id":"doi:10.1609/aies.v8i2.36657","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aies.v8i2.36657","pdf_url":"https://ojs.aaai.org/index.php/AIES/article/download/36657/38795","source":{"id":"https://openalex.org/S5407048695","display_name":"Proceedings of the AAAI/ACM Conference on AI Ethics and Society","issn_l":"3065-8365","issn":["3065-8365"],"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society","raw_type":"journal-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"grobid_xml":false,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4415230157.pdf"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Offline":[0],"reinforcement":[1],"learning":[2,116],"(RL)":[3],"offers":[4],"a":[5,41,83],"promising":[6],"path":[7],"for":[8,22,46],"training":[9,53,69],"domain-specific":[10],"conversational":[11],"agents":[12],"(CAs)":[13],"using":[14],"large-scale":[15],"historical":[16,122],"dialogue":[17,119,158],"data,":[18,70],"without":[19],"the":[20,30,59,63,68,106,127,138],"need":[21],"costly":[23],"online":[24],"interactions":[25],"or":[26],"human":[27],"annotations.":[28],"In":[29],"legal":[31,49],"domain,":[32],"vast":[33],"amounts":[34],"of":[35,100,130],"publicly":[36],"available":[37],"courtroom":[38],"transcripts":[39],"provide":[40],"rich":[42],"and":[43,62,152],"underutilized":[44],"resource":[45],"developing":[47],"intelligent":[48],"CAs.":[50,101],"However,":[51],"offline":[52,85],"suffers":[54],"from":[55,121],"distribution":[56,150],"shift":[57,151],"between":[58],"learned":[60],"policy":[61,65],"behavior":[64],"embedded":[66],"in":[67,115,143,156],"which":[71,90],"can":[72],"degrade":[73],"agent":[74,154],"performance":[75,155],"at":[76],"deployment.":[77],"We":[78,102],"address":[79],"this":[80],"challenge":[81],"with":[82],"novel":[84],"RL":[86],"method,":[87],"Reward-on-the-Line":[88],"(ROL),":[89],"calibrates":[91],"rewards":[92],"based":[93],"on":[94,137],"action-selection":[95],"agreement":[96],"among":[97],"an":[98],"ensemble":[99],"apply":[103],"ROL":[104,136,148],"to":[105,111],"U.S.":[107],"Supreme":[108],"Court":[109],"dataset":[110],"demonstrate":[112],"its":[113],"effectiveness":[114],"proactive,":[117],"legally-informed":[118],"strategies":[120],"court":[123],"proceedings.":[124],"To":[125],"show":[126],"broader":[128],"applicability":[129],"our":[131],"approach,":[132],"we":[133],"also":[134],"evaluate":[135],"CraigslistBargain":[139],"negotiation":[140],"dataset.":[141],"Results":[142],"both":[144],"domains":[145],"confirm":[146],"that":[147],"reduces":[149],"improves":[153],"unseen":[157],"scenarios.":[159]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-16T00:00:00"}
