{"id":"https://openalex.org/W7168366791","doi":"https://doi.org/10.48550/arxiv.2607.12687","title":"From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation","display_name":"From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation","publication_year":2026,"publication_date":"2026-07-14","ids":{"openalex":"https://openalex.org/W7168366791","doi":"https://doi.org/10.48550/arxiv.2607.12687"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2607.12687","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.12687","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2607.12687","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5140876745","display_name":"Mehak Dhaliwal","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dhaliwal, Mehak","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140806596","display_name":"Rasta Tadayon","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tadayon, Rasta","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140772775","display_name":"Andong Hua","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hua, Andong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140912204","display_name":"Haewon Jeong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jeong, Haewon","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5140906813","display_name":"Yao Qin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qin, Yao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.38580000400543213,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.38580000400543213,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.16429999470710754,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11636","display_name":"Artificial Intelligence in Healthcare and Education","score":0.12370000034570694,"subfield":{"id":"https://openalex.org/subfields/2718","display_name":"Health Informatics"},"field":{"id":"https://openalex.org/fields/27","display_name":"Medicine"},"domain":{"id":"https://openalex.org/domains/4","display_name":"Health Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/overfitting","display_name":"Overfitting","score":0.9063000082969666},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6525999903678894},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.6036999821662903},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.59579998254776},{"id":"https://openalex.org/keywords/estimation","display_name":"Estimation","score":0.5037999749183655},{"id":"https://openalex.org/keywords/domain","display_name":"Domain (mathematical analysis)","score":0.39719998836517334},{"id":"https://openalex.org/keywords/value","display_name":"Value (mathematics)","score":0.38929998874664307}],"concepts":[{"id":"https://openalex.org/C22019652","wikidata":"https://www.wikidata.org/wiki/Q331309","display_name":"Overfitting","level":3,"score":0.9063000082969666},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.6639999747276306},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6565999984741211},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6525999903678894},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6399999856948853},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.6036999821662903},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.59579998254776},{"id":"https://openalex.org/C96250715","wikidata":"https://www.wikidata.org/wiki/Q965330","display_name":"Estimation","level":2,"score":0.5037999749183655},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.39719998836517334},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.38929998874664307},{"id":"https://openalex.org/C51110983","wikidata":"https://www.wikidata.org/wiki/Q16503490","display_name":"Overconfidence effect","level":2,"score":0.3855000138282776},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.3409999907016754},{"id":"https://openalex.org/C44249647","wikidata":"https://www.wikidata.org/wiki/Q208498","display_name":"Confidence interval","level":2,"score":0.3287999927997589},{"id":"https://openalex.org/C45804977","wikidata":"https://www.wikidata.org/wiki/Q7239673","display_name":"Predictive modelling","level":2,"score":0.3179999887943268},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.29739999771118164},{"id":"https://openalex.org/C27158222","wikidata":"https://www.wikidata.org/wiki/Q5532422","display_name":"Generalizability theory","level":2,"score":0.2888000011444092},{"id":"https://openalex.org/C149782125","wikidata":"https://www.wikidata.org/wiki/Q160039","display_name":"Econometrics","level":1,"score":0.2881999909877777},{"id":"https://openalex.org/C95986675","wikidata":"https://www.wikidata.org/wiki/Q185168","display_name":"Quantitative analysis (chemistry)","level":2,"score":0.2705000042915344},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.25279998779296875}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2607.12687","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.12687","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2607.12687","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.12687","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/4","display_name":"Quality Education","score":0.42004576325416565}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"LLMs":[0],"can":[1,32],"perform":[2],"language-based":[3,68],"quantitative":[4,69,135],"prediction":[5,48,83,104,136],"from":[6],"unstructured":[7],"inputs,":[8],"but":[9,28],"remain":[10],"susceptible":[11],"to":[12,20,85,90,97],"hallucinations":[13],"and":[14,52,63,122,124,130,149,163],"overconfident":[15],"errors,":[16],"making":[17],"it":[18],"critical":[19],"know":[21],"not":[22],"only":[23],"what":[24],"a":[25,38,44,73,80,99,113],"model":[26,127],"predicts,":[27],"when":[29],"its":[30],"predictions":[31],"be":[33],"trusted.":[34],"We":[35],"introduce":[36],"CARE-PPO,":[37],"reinforcement":[39],"learning":[40,58],"framework":[41],"that":[42],"establishes":[43],"connection":[45],"between":[46],"loss":[47],"for":[49,76],"uncertainty":[50],"estimation":[51],"actor-critic":[53],"PPO":[54],"fine-tuning,":[55],"enabling":[56],"joint":[57],"of":[59,82,181],"accurate":[60],"numerical":[61],"estimates":[62,143],"reliable":[64],"confidence":[65,114,142],"signals":[66],"in":[67,120],"prediction.":[70],"CARE-PPO":[71,132,167],"uses":[72],"Confidence-Aligned":[74],"Reward":[75],"Estimation,":[77],"defined":[78],"as":[79,112],"function":[81,101],"error,":[84],"provide":[86],"dense":[87],"error-aware":[88],"feedback":[89],"the":[91,95,110,145,177],"actor":[92],"while":[93,138],"inducing":[94],"critic":[96,111,146],"learn":[98],"value":[100],"aligned":[102],"with":[103,176],"quality.":[105],"During":[106],"inference,":[107],"we":[108],"repurpose":[109],"estimator.":[115],"Across":[116],"two":[117,125],"real-world":[118],"tasks":[119],"healthcare":[121],"finance":[123],"Qwen-3":[126],"scales":[128],"(4B":[129],"8B),":[131],"achieves":[133],"strong":[134],"performance,":[137],"producing":[139],"significantly":[140],"better-aligned":[141],"through":[144],"than":[147],"logit-based":[148],"verbalized":[150],"baselines.":[151],"These":[152],"gains":[153],"persist":[154],"under":[155],"realistic":[156],"out-of-distribution":[157],"settings":[158],"across":[159],"domains,":[160],"spanning":[161],"linguistic":[162],"domain":[164],"shifts.":[165],"Finally,":[166],"reduces":[168],"task-specific":[169],"overfitting":[170],"on":[171],"general":[172],"instruction-following":[173],"prompts,":[174],"consistent":[175],"broader":[178],"generalization":[179],"advantages":[180],"RL":[182],"fine-tuning":[183],"over":[184],"supervised":[185],"approaches.":[186]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-16T00:00:00"}
