{"id":"https://openalex.org/W7133320365","doi":"https://doi.org/10.1109/tps-isa67132.2025.00045","title":"Guiding Reinforcement Learning Using Uncertainty-Aware Large Language Models","display_name":"Guiding Reinforcement Learning Using Uncertainty-Aware Large Language Models","publication_year":2025,"publication_date":"2025-11-12","ids":{"openalex":"https://openalex.org/W7133320365","doi":"https://doi.org/10.1109/tps-isa67132.2025.00045"},"language":null,"primary_location":{"id":"doi:10.1109/tps-isa67132.2025.00045","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tps-isa67132.2025.00045","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 7th International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications (TPS-ISA)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5032841131","display_name":"Maryam Shoaeinaeini","orcid":null},"institutions":[{"id":"https://openalex.org/I143302722","display_name":"University of Kentucky","ror":"https://ror.org/02k3smh20","country_code":"US","type":"education","lineage":["https://openalex.org/I143302722"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Maryam Shoaeinaeini","raw_affiliation_strings":["University of Kentucky,dept. of Computer Science,Lexington,KY,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Kentucky,dept. of Computer Science,Lexington,KY,USA","institution_ids":["https://openalex.org/I143302722"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5047163199","display_name":"Brent Harrison","orcid":"https://orcid.org/0000-0002-1301-5928"},"institutions":[{"id":"https://openalex.org/I143302722","display_name":"University of Kentucky","ror":"https://ror.org/02k3smh20","country_code":"US","type":"education","lineage":["https://openalex.org/I143302722"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Brent Harrison","raw_affiliation_strings":["University of Kentucky,dept. of Computer Science,Lexington,KY,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Kentucky,dept. of Computer Science,Lexington,KY,USA","institution_ids":["https://openalex.org/I143302722"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I143302722"],"apc_list":null,"apc_paid":null,"fwci":1.673,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":{"value":0.89568349,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":94,"max":97},"biblio":{"volume":null,"issue":null,"first_page":"363","last_page":"371"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.26339998841285706,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.26339998841285706,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.13570000231266022,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.06449999660253525,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/overconfidence-effect","display_name":"Overconfidence effect","score":0.7832000255584717},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7784000039100647},{"id":"https://openalex.org/keywords/inefficiency","display_name":"Inefficiency","score":0.6875},{"id":"https://openalex.org/keywords/calibration","display_name":"Calibration","score":0.42309999465942383},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.412200003862381},{"id":"https://openalex.org/keywords/dropout","display_name":"Dropout (neural networks)","score":0.3264999985694885},{"id":"https://openalex.org/keywords/principle-of-maximum-entropy","display_name":"Principle of maximum entropy","score":0.3199000060558319}],"concepts":[{"id":"https://openalex.org/C51110983","wikidata":"https://www.wikidata.org/wiki/Q16503490","display_name":"Overconfidence effect","level":2,"score":0.7832000255584717},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7784000039100647},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7038000226020813},{"id":"https://openalex.org/C2778869765","wikidata":"https://www.wikidata.org/wiki/Q6028363","display_name":"Inefficiency","level":2,"score":0.6875},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4738999903202057},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.45260000228881836},{"id":"https://openalex.org/C165838908","wikidata":"https://www.wikidata.org/wiki/Q736777","display_name":"Calibration","level":2,"score":0.42309999465942383},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.412200003862381},{"id":"https://openalex.org/C2776145597","wikidata":"https://www.wikidata.org/wiki/Q25339462","display_name":"Dropout (neural networks)","level":2,"score":0.3264999985694885},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.3199000060558319},{"id":"https://openalex.org/C2776090536","wikidata":"https://www.wikidata.org/wiki/Q187819","display_name":"Dash","level":2,"score":0.3156000077724457},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.30660000443458557},{"id":"https://openalex.org/C19499675","wikidata":"https://www.wikidata.org/wiki/Q232207","display_name":"Monte Carlo method","level":2,"score":0.2978000044822693},{"id":"https://openalex.org/C134697681","wikidata":"https://www.wikidata.org/wiki/Q1609677","display_name":"Clearing","level":2,"score":0.2872999906539917},{"id":"https://openalex.org/C43214815","wikidata":"https://www.wikidata.org/wiki/Q7310987","display_name":"Reliability (semiconductor)","level":3,"score":0.27639999985694885},{"id":"https://openalex.org/C96250715","wikidata":"https://www.wikidata.org/wiki/Q965330","display_name":"Estimation","level":2,"score":0.2603999972343445}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/tps-isa67132.2025.00045","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tps-isa67132.2025.00045","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 7th International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications (TPS-ISA)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":29,"referenced_works":["https://openalex.org/W2156869222","https://openalex.org/W2610189169","https://openalex.org/W2788862220","https://openalex.org/W2803756472","https://openalex.org/W2877093712","https://openalex.org/W2963489214","https://openalex.org/W3006086787","https://openalex.org/W3038676770","https://openalex.org/W3039772337","https://openalex.org/W3099204253","https://openalex.org/W3119264617","https://openalex.org/W3153712677","https://openalex.org/W3161972356","https://openalex.org/W3173844397","https://openalex.org/W3184144760","https://openalex.org/W3199958362","https://openalex.org/W4205731756","https://openalex.org/W4214918501","https://openalex.org/W4309674289","https://openalex.org/W4362650357","https://openalex.org/W4384561707","https://openalex.org/W4385644834","https://openalex.org/W4386215566","https://openalex.org/W4393763811","https://openalex.org/W4402716424","https://openalex.org/W7124175820","https://openalex.org/W7124206866","https://openalex.org/W7133211372","https://openalex.org/W7133242429"],"related_works":[],"abstract_inverted_index":{"Human":[0],"guidance":[1,64,109],"in":[2,53,131,138,174,178,187,197],"reinforcement":[3],"learning":[4],"(RL)":[5],"is":[6,43],"often":[7],"impractical":[8],"for":[9],"large-scale":[10],"applications":[11],"due":[12,45],"to":[13,27,46,71,99,108,149],"high":[14],"costs":[15],"and":[16,32,49,154,190],"time":[17],"constraints.":[18],"Large":[19],"Language":[20],"Models":[21],"(LLMs)":[22],"offer":[23],"a":[24,62,87,132],"promising":[25],"alternative":[26],"mitigate":[28],"RL":[29,41,89,105,115],"sample":[30],"inefficiency":[31],"potentially":[33],"replace":[34],"human":[35],"trainers.":[36],"However,":[37],"applying":[38],"LLMs":[39,156,189],"as":[40],"trainers":[42],"challenging":[44],"their":[47],"overconfidence":[48,186],"less":[50],"reliable":[51,120],"solutions":[52],"sequential":[54,198],"tasks.":[55],"We":[56],"address":[57],"this":[58],"limitation":[59],"by":[60,76,117],"introducing":[61],"calibrated":[63,155],"system":[65],"that":[66],"uses":[67],"Monte":[68],"Carlo":[69],"Dropout":[70],"enhance":[72],"LLM":[73,121],"advice":[74],"reliability":[75],"assessing":[77],"prediction":[78],"variances":[79],"from":[80],"multiple":[81],"forward":[82],"passes.":[83],"Additionally,":[84],"we":[85,127,162],"develop":[86],"novel":[88],"policy":[90],"shaping":[91,159],"method":[92],"based":[93],"on":[94,104,119],"dynamic":[95],"model":[96,146],"average":[97,172],"entropy":[98,173],"adjust":[100],"the":[101,169,184,192],"LLM's":[102],"influence":[103],"policies":[106],"according":[107],"uncertainty.":[110],"This":[111],"approach":[112],"ensures":[113],"robust":[114],"training":[116],"relying":[118],"guidance.":[122,180],"To":[123],"validate":[124],"our":[125],"contributions,":[126],"conduct":[128],"extensive":[129],"experiments":[130],"Minigrid":[133],"environment":[134,140],"with":[135,157],"three":[136],"goals":[137],"varying":[139],"sizes.":[141],"The":[142],"results":[143],"showcase":[144],"superior":[145],"performance":[147],"compared":[148],"uncalibrated":[150],"LLMs,":[151],"unguided":[152],"RL,":[153],"different":[158],"policies.":[160],"Moreover,":[161],"analyze":[163],"various":[164],"uncertainty":[165,177],"estimation":[166],"methods,":[167],"demonstrating":[168],"effectiveness":[170],"of":[171,194],"reflecting":[175],"higher":[176],"incorrect":[179],"These":[181],"findings":[182],"highlight":[183],"persistent":[185],"fine-tuned":[188],"underscore":[191],"importance":[193],"effective":[195],"calibration":[196],"decision-making":[199],"problems.":[200]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-03-04T00:00:00"}
