{"id":"https://openalex.org/W4416251826","doi":"https://doi.org/10.1109/ijcnn64981.2025.11228950","title":"Single Pass Uncertainty Estimation in Q-Learning via Dropout Distillation","display_name":"Single Pass Uncertainty Estimation in Q-Learning via Dropout Distillation","publication_year":2025,"publication_date":"2025-06-30","ids":{"openalex":"https://openalex.org/W4416251826","doi":"https://doi.org/10.1109/ijcnn64981.2025.11228950"},"language":null,"primary_location":{"id":"doi:10.1109/ijcnn64981.2025.11228950","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11228950","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5116078160","display_name":"Nikolaos Kaparinos","orcid":null},"institutions":[{"id":"https://openalex.org/I21370196","display_name":"Aristotle University of Thessaloniki","ror":"https://ror.org/02j61yw88","country_code":"GR","type":"education","lineage":["https://openalex.org/I21370196"]}],"countries":["GR"],"is_corresponding":false,"raw_author_name":"Nikolaos Kaparinos","raw_affiliation_strings":["Aristotle University of Thessaloniki,Computational Intelligence and Deep Learning Group,AIIA Lab. Dept. of Informatics,Greece"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Aristotle University of Thessaloniki,Computational Intelligence and Deep Learning Group,AIIA Lab. Dept. of Informatics,Greece","institution_ids":["https://openalex.org/I21370196"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5061050264","display_name":"Nikolaos Passalis","orcid":"https://orcid.org/0000-0003-1177-9139"},"institutions":[{"id":"https://openalex.org/I21370196","display_name":"Aristotle University of Thessaloniki","ror":"https://ror.org/02j61yw88","country_code":"GR","type":"education","lineage":["https://openalex.org/I21370196"]}],"countries":["GR"],"is_corresponding":false,"raw_author_name":"Nikolaos Passalis","raw_affiliation_strings":["Aristotle University of Thessaloniki,Dept. of Chemical Engineering,Greece"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Aristotle University of Thessaloniki,Dept. of Chemical Engineering,Greece","institution_ids":["https://openalex.org/I21370196"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5041054091","display_name":"Anastasios Tefas","orcid":"https://orcid.org/0000-0003-1288-3667"},"institutions":[{"id":"https://openalex.org/I21370196","display_name":"Aristotle University of Thessaloniki","ror":"https://ror.org/02j61yw88","country_code":"GR","type":"education","lineage":["https://openalex.org/I21370196"]}],"countries":["GR"],"is_corresponding":false,"raw_author_name":"Anastasios Tefas","raw_affiliation_strings":["Aristotle University of Thessaloniki,Computational Intelligence and Deep Learning Group,AIIA Lab. Dept. of Informatics,Greece"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Aristotle University of Thessaloniki,Computational Intelligence and Deep Learning Group,AIIA Lab. Dept. of Informatics,Greece","institution_ids":["https://openalex.org/I21370196"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I21370196"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"7"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7062000036239624,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7062000036239624,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.18000000715255737,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.02969999983906746,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/consistency","display_name":"Consistency (knowledge bases)","score":0.732699990272522},{"id":"https://openalex.org/keywords/dropout","display_name":"Dropout (neural networks)","score":0.6931999921798706},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.6371999979019165},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5992000102996826},{"id":"https://openalex.org/keywords/calibration","display_name":"Calibration","score":0.5523999929428101},{"id":"https://openalex.org/keywords/distillation","display_name":"Distillation","score":0.4327999949455261}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7583000063896179},{"id":"https://openalex.org/C2776436953","wikidata":"https://www.wikidata.org/wiki/Q5163215","display_name":"Consistency (knowledge bases)","level":2,"score":0.732699990272522},{"id":"https://openalex.org/C2776145597","wikidata":"https://www.wikidata.org/wiki/Q25339462","display_name":"Dropout (neural networks)","level":2,"score":0.6931999921798706},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.6371999979019165},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5992000102996826},{"id":"https://openalex.org/C165838908","wikidata":"https://www.wikidata.org/wiki/Q736777","display_name":"Calibration","level":2,"score":0.5523999929428101},{"id":"https://openalex.org/C204030448","wikidata":"https://www.wikidata.org/wiki/Q101017","display_name":"Distillation","level":2,"score":0.4327999949455261},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.42329999804496765},{"id":"https://openalex.org/C19499675","wikidata":"https://www.wikidata.org/wiki/Q232207","display_name":"Monte Carlo method","level":2,"score":0.4052000045776367},{"id":"https://openalex.org/C96250715","wikidata":"https://www.wikidata.org/wiki/Q965330","display_name":"Estimation","level":2,"score":0.38749998807907104},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3686999976634979},{"id":"https://openalex.org/C137209882","wikidata":"https://www.wikidata.org/wiki/Q1403517","display_name":"Measurement uncertainty","level":2,"score":0.3553999960422516},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.3391999900341034},{"id":"https://openalex.org/C177803969","wikidata":"https://www.wikidata.org/wiki/Q29205","display_name":"Uncertainty analysis","level":2,"score":0.274399995803833},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.27300000190734863},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2531999945640564}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn64981.2025.11228950","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11228950","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320320300","display_name":"European Commission","ror":"https://ror.org/00k4n6c32"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":16,"referenced_works":["https://openalex.org/W2150468603","https://openalex.org/W2766447205","https://openalex.org/W2887783173","https://openalex.org/W2962736495","https://openalex.org/W2963099939","https://openalex.org/W2964059111","https://openalex.org/W2973815009","https://openalex.org/W2982316857","https://openalex.org/W2998398431","https://openalex.org/W3012333258","https://openalex.org/W3047659929","https://openalex.org/W4306679387","https://openalex.org/W4312612815","https://openalex.org/W4388115613","https://openalex.org/W4402402057","https://openalex.org/W4403466896"],"related_works":[],"abstract_inverted_index":{"While":[0],"Reinforcement":[1],"Learning":[2],"(RL)":[3],"has":[4],"demonstrated":[5],"success":[6],"in":[7,23,66,127,191],"numerous":[8],"applications,":[9],"ensuring":[10],"the":[11,28,41,97,103,119,128,158,172,192],"consistency":[12],"and":[13,30,106,111],"safety":[14],"of":[15,33,79,156,160,171],"learned":[16],"policies":[17],"remains":[18],"a":[19,59,85,108,114,125,148,169,187,207,211],"significant":[20],"challenge,":[21],"particularly":[22],"safety-critical":[24],"domains.":[25],"To":[26,143],"enable":[27],"reliable":[29],"safe":[31],"operation":[32],"RL":[34,104,150,173,216],"agents,":[35],"it":[36],"is":[37],"essential":[38],"to":[39,50,91,100],"quantify":[40],"agent\u2019s":[42],"uncertainty":[43,65,135,152,166,180],"regarding":[44],"its":[45,92],"action":[46],"selection,":[47],"commonly":[48],"referred":[49],"as":[51],"Policy":[52],"Uncertainty.":[53],"In":[54],"this":[55],"work,":[56],"we":[57,123,146],"propose":[58,147],"novel":[60,149],"approach":[61,182],"for":[62,214],"estimating":[63],"policy":[64,151,165,179],"Deep":[67],"Q-learning":[68],"(DQN)":[69],"agents":[70],"by":[71],"leveraging":[72],"Dropout":[73],"Distillation":[74],"Networks.":[75],"Our":[76],"methodology":[77],"consists":[78],"three":[80],"key":[81],"steps:":[82],"(1)":[83],"training":[84,113],"DQN":[86],"agent":[87,99,162],"with":[88,102],"dropout":[89],"applied":[90],"network":[93,116],"layers,":[94],"(2)":[95],"using":[96,118],"trained":[98],"interact":[101],"environment":[105],"collect":[107],"distillation":[109],"dataset,":[110],"(3)":[112],"student":[115],"(DDN)":[117],"collected":[120],"dataset.":[121],"Furthermore,":[122],"identify":[124],"gap":[126],"literature,":[129],"where":[130],"existing":[131],"works":[132],"primarily":[133],"introduce":[134],"estimation":[136,141,181],"algorithms":[137],"without":[138],"assessing":[139,157],"their":[140],"accuracy.":[142],"address":[144],"this,":[145],"evaluation":[153],"algorithm":[154],"capable":[155],"calibration":[159,203],"any":[161],"that":[163,197],"provides":[164],"estimates,":[167],"utilizing":[168],"simulator":[170],"environment.":[174],"We":[175],"compare":[176],"our":[177,198],"proposed":[178],"against":[183],"Monte":[184],"Carlo":[185],"Dropout,":[186],"widely":[188],"used":[189],"technique":[190],"literature.":[193],"Experimental":[194],"results":[195],"indicate":[196],"method":[199],"consistently":[200],"achieves":[201],"better":[202],"while":[204],"requiring":[205],"only":[206],"single":[208],"forward":[209],"pass,":[210],"crucial":[212],"advantage":[213],"real-time":[215],"applications.":[217]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-11-14T00:00:00"}
