{"id":"https://openalex.org/W7166878685","doi":"https://doi.org/10.18653/v1/2026.acl-long.1539","title":"LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generation","display_name":"LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generation","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166878685","doi":"https://doi.org/10.18653/v1/2026.acl-long.1539"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.acl-long.1539","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1539","pdf_url":"https://aclanthology.org/2026.acl-long.1539.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.acl-long.1539.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5064109244","display_name":"Caiqi Zhang","orcid":null},"institutions":[{"id":"https://openalex.org/I241749","display_name":"University of Cambridge","ror":"https://ror.org/013meh722","country_code":"GB","type":"education","lineage":["https://openalex.org/I241749"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Caiqi Zhang","raw_affiliation_strings":["University of Cambridge"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Cambridge","institution_ids":["https://openalex.org/I241749"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139730206","display_name":"Xiaochen Zhu","orcid":null},"institutions":[{"id":"https://openalex.org/I241749","display_name":"University of Cambridge","ror":"https://ror.org/013meh722","country_code":"GB","type":"education","lineage":["https://openalex.org/I241749"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Xiaochen Zhu","raw_affiliation_strings":["University of Cambridge"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Cambridge","institution_ids":["https://openalex.org/I241749"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5070178016","display_name":"Chengzu Li","orcid":"https://orcid.org/0000-0002-1879-7391"},"institutions":[{"id":"https://openalex.org/I241749","display_name":"University of Cambridge","ror":"https://ror.org/013meh722","country_code":"GB","type":"education","lineage":["https://openalex.org/I241749"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Chengzu Li","raw_affiliation_strings":["University of Cambridge"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Cambridge","institution_ids":["https://openalex.org/I241749"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5073413742","display_name":"Nigel Collier","orcid":"https://orcid.org/0000-0002-7230-4164"},"institutions":[{"id":"https://openalex.org/I241749","display_name":"University of Cambridge","ror":"https://ror.org/013meh722","country_code":"GB","type":"education","lineage":["https://openalex.org/I241749"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Nigel Collier","raw_affiliation_strings":["University of Cambridge"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Cambridge","institution_ids":["https://openalex.org/I241749"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5023496003","display_name":"Andreas Vlachos","orcid":"https://orcid.org/0000-0002-2646-3770"},"institutions":[{"id":"https://openalex.org/I241749","display_name":"University of Cambridge","ror":"https://ror.org/013meh722","country_code":"GB","type":"education","lineage":["https://openalex.org/I241749"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Andreas Vlachos","raw_affiliation_strings":["University of Cambridge"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Cambridge","institution_ids":["https://openalex.org/I241749"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I241749"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.90618647,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"33336","last_page":"33363"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10719","display_name":"3D Shape Modeling and Analysis","score":0.15950000286102295,"subfield":{"id":"https://openalex.org/subfields/2206","display_name":"Computational Mechanics"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10719","display_name":"3D Shape Modeling and Analysis","score":0.15950000286102295,"subfield":{"id":"https://openalex.org/subfields/2206","display_name":"Computational Mechanics"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.13979999721050262,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.12389999628067017,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.48669999837875366},{"id":"https://openalex.org/keywords/self-confidence","display_name":"Self-confidence","score":0.3483000099658966},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.33820000290870667},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.27149999141693115},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.26980000734329224}],"concepts":[{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.6370000243186951},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.48669999837875366},{"id":"https://openalex.org/C180747234","wikidata":"https://www.wikidata.org/wiki/Q23373","display_name":"Cognitive psychology","level":1,"score":0.40139999985694885},{"id":"https://openalex.org/C77805123","wikidata":"https://www.wikidata.org/wiki/Q161272","display_name":"Social psychology","level":1,"score":0.3646000027656555},{"id":"https://openalex.org/C48444904","wikidata":"https://www.wikidata.org/wiki/Q4116378","display_name":"Self-confidence","level":2,"score":0.3483000099658966},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.33820000290870667},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2809999883174896},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.2797999978065491},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.27149999141693115},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.26980000734329224},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.26019999384880066},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2572000026702881},{"id":"https://openalex.org/C138496976","wikidata":"https://www.wikidata.org/wiki/Q175002","display_name":"Developmental psychology","level":1,"score":0.25380000472068787}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.acl-long.1539","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1539","pdf_url":"https://aclanthology.org/2026.acl-long.1539.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.acl-long.1539","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.acl-long.1539","pdf_url":"https://aclanthology.org/2026.acl-long.1539.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","raw_type":"proceedings-article"},"sustainable_development_goals":[{"display_name":"Reduced inequalities","score":0.4397495687007904,"id":"https://metadata.un.org/sdg/10"}],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166878685.pdf","grobid_xml":"https://content.openalex.org/works/W7166878685.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Hallucination":[0],"remains":[1],"a":[2,46,78,105],"major":[3],"challenge":[4],"for":[5],"the":[6,111],"safe":[7],"and":[8,62,107,121,144],"trustworthy":[9],"deployment":[10],"of":[11,110,113],"large":[12],"language":[13],"models":[14,140],"(LLMs)":[15],"in":[16],"factual":[17],"content":[18],"generation.Prior":[19],"work":[20],"has":[21],"explored":[22],"confidence":[23,44,92,101,128],"estimation":[24,129],"as":[25,104],"an":[26,89],"effective":[27],"approach":[28],"to":[29,56,67,87,94,124],"hallucination":[30],"detection,":[31],"but":[32,50],"often":[33],"relies":[34],"on":[35,131],"post-hoc":[36],"self-consistency":[37,159],"methods":[38,160],"that":[39,84,137],"require":[40],"computationally":[41],"expensive":[42],"sampling.Verbalized":[43],"offers":[45],"more":[47],"efficient":[48],"alternative,":[49],"existing":[51],"approaches":[52],"are":[53],"largely":[54],"limited":[55],"shortform":[57],"question":[58],"answering":[59],"(QA)":[60],"tasks":[61],"do":[63],"not":[64],"generalize":[65,145],"well":[66],"open-ended":[68],"generation.In":[69],"this":[70],"paper,":[71],"we":[72],"propose":[73],"LOVEC":[74],"(Long-form":[75],"Verbalized":[76],"Confidence),":[77],"novel":[79],"reinforcement":[80],"learning":[81],"(RL)-based":[82],"method":[83,150],"trains":[85],"LLMs":[86],"append":[88],"on-the-fly":[90],"numerical":[91],"score":[93,102],"each":[95],"generated":[96],"statement":[97],"during":[98],"longform":[99],"generation.The":[100],"serves":[103],"direct":[106],"interpretable":[108],"signal":[109],"factuality":[112],"generation.We":[114],"introduce":[115],"two":[116],"evaluation":[117],"settings,":[118],"free-form":[119],"tagging":[120],"iterative":[122],"tagging,":[123],"assess":[125],"different":[126],"verbalized":[127],"methods.Experiments":[130],"three":[132],"long-form":[133],"QA":[134],"datasets":[135],"show":[136],"our":[138,149],"RLtrained":[139],"achieve":[141],"better":[142,163],"calibration":[143],"robustly":[146],"across":[147],"domains.Also,":[148],"is":[151],"highly":[152],"efficient,":[153],"being":[154],"20\u00d7":[155],"faster":[156],"than":[157],"traditional":[158],"while":[161],"achieving":[162],"calibration.":[164]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
