{"id":"https://openalex.org/W7163889864","doi":"https://doi.org/10.48550/arxiv.2606.06746","title":"Performance Variation in Deep Reinforcement Learning","display_name":"Performance Variation in Deep Reinforcement Learning","publication_year":2026,"publication_date":"2026-06-04","ids":{"openalex":"https://openalex.org/W7163889864","doi":"https://doi.org/10.48550/arxiv.2606.06746"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.06746","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.06746","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.06746","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5129721622","display_name":"Haruto Tanaka","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Tanaka, Haruto","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138106501","display_name":"A. Rupam Mahmood","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mahmood, A. Rupam","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8303999900817871,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8303999900817871,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10639","display_name":"Advanced Software Engineering Methodologies","score":0.013100000098347664,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.01080000028014183,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/variation","display_name":"Variation (astronomy)","score":0.8593000173568726},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7039999961853027},{"id":"https://openalex.org/keywords/statistic","display_name":"Statistic","score":0.6546000242233276},{"id":"https://openalex.org/keywords/percentile","display_name":"Percentile","score":0.4431000053882599},{"id":"https://openalex.org/keywords/independent-and-identically-distributed-random-variables","display_name":"Independent and identically distributed random variables","score":0.41100001335144043},{"id":"https://openalex.org/keywords/visualization","display_name":"Visualization","score":0.4027999937534332},{"id":"https://openalex.org/keywords/sample","display_name":"Sample (material)","score":0.38510000705718994}],"concepts":[{"id":"https://openalex.org/C2778334786","wikidata":"https://www.wikidata.org/wiki/Q1586270","display_name":"Variation (astronomy)","level":2,"score":0.8593000173568726},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7039999961853027},{"id":"https://openalex.org/C89128539","wikidata":"https://www.wikidata.org/wiki/Q1949963","display_name":"Statistic","level":2,"score":0.6546000242233276},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6226999759674072},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5550000071525574},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.49869999289512634},{"id":"https://openalex.org/C122048520","wikidata":"https://www.wikidata.org/wiki/Q2913954","display_name":"Percentile","level":2,"score":0.4431000053882599},{"id":"https://openalex.org/C141513077","wikidata":"https://www.wikidata.org/wiki/Q378542","display_name":"Independent and identically distributed random variables","level":3,"score":0.41100001335144043},{"id":"https://openalex.org/C36464697","wikidata":"https://www.wikidata.org/wiki/Q451553","display_name":"Visualization","level":2,"score":0.4027999937534332},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.38510000705718994},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.35339999198913574},{"id":"https://openalex.org/C22679943","wikidata":"https://www.wikidata.org/wiki/Q159375","display_name":"Standard deviation","level":2,"score":0.3434000015258789},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.31299999356269836},{"id":"https://openalex.org/C172367668","wikidata":"https://www.wikidata.org/wiki/Q6504956","display_name":"Data visualization","level":3,"score":0.2939000129699707},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.2856999933719635},{"id":"https://openalex.org/C124101348","wikidata":"https://www.wikidata.org/wiki/Q172491","display_name":"Data mining","level":1,"score":0.27900001406669617},{"id":"https://openalex.org/C2982736386","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Statistical learning","level":2,"score":0.2736000120639801},{"id":"https://openalex.org/C196083921","wikidata":"https://www.wikidata.org/wiki/Q7915758","display_name":"Variance (accounting)","level":2,"score":0.2603999972343445},{"id":"https://openalex.org/C122123141","wikidata":"https://www.wikidata.org/wiki/Q176623","display_name":"Random variable","level":2,"score":0.2535000145435333}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.06746","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.06746","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.06746","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.06746","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Deep":[0],"reinforcement":[1],"learning":[2],"(RL)":[3],"algorithms":[4,184],"often":[5,46],"suffer":[6],"from":[7],"low":[8],"run-to-run":[9,113],"robustness,":[10],"manifesting":[11],"as":[12],"significant":[13],"performance":[14,114,132,189],"variation":[15,65,133,138,158],"across":[16,31],"independent":[17],"runs":[18],"of":[19,29,61,75,106,172,188],"identically":[20],"configured":[21],"agents.":[22],"Although":[23],"this":[24,55,118],"issue":[25],"poses":[26],"a":[27,170],"spectrum":[28],"challenges":[30],"research":[32,44],"and":[33,64,72,84,89,101,128,150,152,174],"practice,":[34],"relatively":[35],"few":[36],"studies":[37],"develop":[38],"methods":[39],"to":[40,99],"evaluate":[41],"it;":[42],"RL":[43],"instead":[45],"reports":[47],"uncertainty":[48,63],"in":[49,134,142,169],"the":[50,59,73,137,156,161,166],"estimated":[51],"mean":[52],"performance.":[53],"In":[54],"paper,":[56],"we":[57,124,145,180],"outline":[58],"limitations":[60],"conventional":[62],"estimates,":[66],"particularly":[67],"their":[68],"misalignment":[69],"with":[70],"purpose":[71],"risk":[74],"underreporting.":[76],"We":[77,116],"then":[78],"propose":[79],"an":[80],"alternative":[81],"percentile-based":[82,95],"statistic":[83],"visualization":[85],"method,":[86],"min-max":[87],"IPR":[88],"run-wise":[90],"percentile":[91],"highlighting,":[92],"respectively.":[93],"These":[94],"tools":[96],"are":[97],"easy":[98],"interpret":[100],"rely":[102],"on":[103,176],"standard":[104],"properties":[105],"sample":[107],"percentiles,":[108],"providing":[109],"rich":[110],"information":[111],"about":[112],"variation.":[115,190],"demonstrate":[117],"through":[119],"three":[120],"case":[121],"studies.":[122],"First,":[123],"show":[125,153,181],"that":[126,182],"LayerNorm":[127],"penultimate-layer":[129],"normalizations":[130],"narrow":[131],"PPO,":[135,147],"whereas":[136],"is":[139],"mostly":[140],"unchanged":[141],"SAC.":[143],"Second,":[144],"compare":[146],"SAC,":[148],"TD-MPC,":[149],"TD-MPC2,":[151],"TD-MPC":[154],"exhibits":[155],"least":[157],"while":[159],"being":[160],"most":[162],"data":[163],"efficient":[164],"among":[165],"four.":[167],"Finally,":[168],"comparison":[171],"DQN":[173],"Rainbow":[175],"five":[177],"Atari":[178],"environments,":[179],"both":[183],"exhibit":[185],"similar":[186],"levels":[187]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-09T00:00:00"}
