{"id":"https://openalex.org/W4416749487","doi":"https://doi.org/10.1109/iros60139.2025.11245819","title":"Diffusion Policies for Risk-Averse Behavior Modeling in Offline Reinforcement Learning","display_name":"Diffusion Policies for Risk-Averse Behavior Modeling in Offline Reinforcement Learning","publication_year":2025,"publication_date":"2025-10-19","ids":{"openalex":"https://openalex.org/W4416749487","doi":"https://doi.org/10.1109/iros60139.2025.11245819"},"language":null,"primary_location":{"id":"doi:10.1109/iros60139.2025.11245819","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros60139.2025.11245819","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5057487706","display_name":"Xiaocong Chen","orcid":"https://orcid.org/0000-0002-8849-4943"},"institutions":[{"id":"https://openalex.org/I1292875679","display_name":"Commonwealth Scientific and Industrial Research Organisation","ror":"https://ror.org/03qn8fb07","country_code":"AU","type":"government","lineage":["https://openalex.org/I1292875679","https://openalex.org/I2801453606","https://openalex.org/I4387156119"]},{"id":"https://openalex.org/I42894916","display_name":"Data61","ror":"https://ror.org/03q397159","country_code":"AU","type":"other","lineage":["https://openalex.org/I1292875679","https://openalex.org/I2801453606","https://openalex.org/I42894916","https://openalex.org/I4387156119"]}],"countries":["AU"],"is_corresponding":false,"raw_author_name":"Xiaocong Chen","raw_affiliation_strings":["Data 61, CSIRO,Australia"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Data 61, CSIRO,Australia","institution_ids":["https://openalex.org/I1292875679","https://openalex.org/I42894916"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100358930","display_name":"Siyu Wang","orcid":"https://orcid.org/0009-0008-8726-5277"},"institutions":[{"id":"https://openalex.org/I99043593","display_name":"Macquarie University","ror":"https://ror.org/01sf06y89","country_code":"AU","type":"education","lineage":["https://openalex.org/I99043593"]}],"countries":["AU"],"is_corresponding":false,"raw_author_name":"Siyu Wang","raw_affiliation_strings":["Macquarie University,School of Computing,Australia"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Macquarie University,School of Computing,Australia","institution_ids":["https://openalex.org/I99043593"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5102523419","display_name":"Tong Yu","orcid":null},"institutions":[{"id":"https://openalex.org/I1306409833","display_name":"Adobe Systems (United States)","ror":"https://ror.org/059tvcg64","country_code":"US","type":"company","lineage":["https://openalex.org/I1306409833"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Tong Yu","raw_affiliation_strings":["Adobe Research,USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Adobe Research,USA","institution_ids":["https://openalex.org/I1306409833"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5103021890","display_name":"Lina Yao","orcid":"https://orcid.org/0000-0003-2772-0385"},"institutions":[{"id":"https://openalex.org/I1292875679","display_name":"Commonwealth Scientific and Industrial Research Organisation","ror":"https://ror.org/03qn8fb07","country_code":"AU","type":"government","lineage":["https://openalex.org/I1292875679","https://openalex.org/I2801453606","https://openalex.org/I4387156119"]},{"id":"https://openalex.org/I42894916","display_name":"Data61","ror":"https://ror.org/03q397159","country_code":"AU","type":"other","lineage":["https://openalex.org/I1292875679","https://openalex.org/I2801453606","https://openalex.org/I42894916","https://openalex.org/I4387156119"]}],"countries":["AU"],"is_corresponding":false,"raw_author_name":"Lina Yao","raw_affiliation_strings":["Data 61, CSIRO,Australia"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Data 61, CSIRO,Australia","institution_ids":["https://openalex.org/I1292875679","https://openalex.org/I42894916"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":4,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":1.673,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":{"value":0.87763508,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":94,"max":97},"biblio":{"volume":null,"issue":null,"first_page":"567","last_page":"574"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9169999957084656,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9169999957084656,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.018799999728798866,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11413","display_name":"Risk and Portfolio Optimization","score":0.010599999688565731,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7771000266075134},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.5934000015258789},{"id":"https://openalex.org/keywords/value","display_name":"Value (mathematics)","score":0.4140999913215637},{"id":"https://openalex.org/keywords/uncertainty-quantification","display_name":"Uncertainty quantification","score":0.35120001435279846},{"id":"https://openalex.org/keywords/offline-learning","display_name":"Offline learning","score":0.3034000098705292},{"id":"https://openalex.org/keywords/policy-learning","display_name":"Policy learning","score":0.274399995803833}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7771000266075134},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.59579998254776},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.5934000015258789},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4327999949455261},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.4140999913215637},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.412200003862381},{"id":"https://openalex.org/C32230216","wikidata":"https://www.wikidata.org/wiki/Q7882499","display_name":"Uncertainty quantification","level":2,"score":0.35120001435279846},{"id":"https://openalex.org/C2780490138","wikidata":"https://www.wikidata.org/wiki/Q7079636","display_name":"Offline learning","level":3,"score":0.3034000098705292},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.274399995803833},{"id":"https://openalex.org/C2780102126","wikidata":"https://www.wikidata.org/wiki/Q10928179","display_name":"Online and offline","level":2,"score":0.26579999923706055},{"id":"https://openalex.org/C43214815","wikidata":"https://www.wikidata.org/wiki/Q7310987","display_name":"Reliability (semiconductor)","level":3,"score":0.2612999975681305},{"id":"https://openalex.org/C110121322","wikidata":"https://www.wikidata.org/wiki/Q865811","display_name":"Distribution (mathematics)","level":2,"score":0.2590000033378601},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.2540000081062317}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/iros60139.2025.11245819","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros60139.2025.11245819","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":6,"referenced_works":["https://openalex.org/W166862392","https://openalex.org/W2051228319","https://openalex.org/W2158782408","https://openalex.org/W2765302304","https://openalex.org/W4249736682","https://openalex.org/W4252707658"],"related_works":[],"abstract_inverted_index":{"Offline":[0],"reinforcement":[1],"learning":[2,46,82],"(RL)":[3],"presents":[4],"distinct":[5],"challenges":[6],"as":[7,94],"it":[8],"relies":[9],"solely":[10],"on":[11],"observational":[12],"data.":[13],"A":[14],"central":[15],"concern":[16],"in":[17,114],"this":[18,54],"context":[19],"is":[20,108],"ensuring":[21],"the":[22,25,87,99],"safety":[23],"of":[24,81,90,102],"learned":[26],"policy":[27],"by":[28,45],"quantifying":[29],"uncertainties":[30],"associated":[31],"with":[32],"various":[33],"actions":[34],"and":[35,70,85,117],"environmental":[36,51,71],"stochasticity.":[37,52,72],"Traditional":[38],"approaches":[39],"primarily":[40],"emphasize":[41],"mitigating":[42],"epistemic":[43,68],"uncertainty":[44,69],"risk-averse":[47,83],"policies,":[48],"often":[49],"overlooking":[50],"In":[53],"study,":[55],"we":[56],"propose":[57,74],"an":[58],"uncertainty-aware":[59],"distributional":[60],"offline":[61,77],"RL":[62,78],"method":[63,107],"to":[64,96],"simultaneously":[65],"address":[66],"both":[67,115],"We":[73],"a":[75],"model-free":[76],"algorithm":[79],"capable":[80],"policies":[84],"characterizing":[86],"entire":[88],"distribution":[89],"discounted":[91,104],"cumulative":[92],"rewards,":[93],"opposed":[95],"merely":[97],"maximizing":[98],"expected":[100],"value":[101],"accumulated":[103],"returns.":[105],"Our":[106],"rigorously":[109],"evaluated":[110],"through":[111],"comprehensive":[112],"experiments":[113],"risk-sensitive":[116],"risk-neutral":[118],"benchmarks,":[119],"demonstrating":[120],"its":[121],"superior":[122],"performance.":[123]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-11-28T00:00:00"}
