{"id":"https://openalex.org/W7140211264","doi":"https://doi.org/10.48550/arxiv.2603.20230","title":"Beyond Scalar Rewards: Distributional Reinforcement Learning with Preordered Objectives for Safe and Reliable Autonomous Driving","display_name":"Beyond Scalar Rewards: Distributional Reinforcement Learning with Preordered Objectives for Safe and Reliable Autonomous Driving","publication_year":2026,"publication_date":"2026-03-06","ids":{"openalex":"https://openalex.org/W7140211264","doi":"https://doi.org/10.48550/arxiv.2603.20230"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.20230","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.20230","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.20230","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5025333727","display_name":"Ahmed Abouelazm","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Abouelazm, Ahmed","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5037357007","display_name":"Jonas Michel","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Michel, Jonas","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5052715598","display_name":"Daniel Bogdoll","orcid":"https://orcid.org/0000-0003-0432-4937"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bogdoll, Daniel","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5024924624","display_name":"Philip Sch\u00f6rner","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sch\u00f6rner, Philip","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5146594056","display_name":"J. Marius Z\u00f6llner","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Z\u00f6llner, J. Marius","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.396699994802475,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.396699994802475,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11099","display_name":"Autonomous Vehicle Technology and Safety","score":0.26660001277923584,"subfield":{"id":"https://openalex.org/subfields/2203","display_name":"Automotive Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.13750000298023224,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7416999936103821},{"id":"https://openalex.org/keywords/preorder","display_name":"Preorder","score":0.6919000148773193},{"id":"https://openalex.org/keywords/pairwise-comparison","display_name":"Pairwise comparison","score":0.6344000101089478},{"id":"https://openalex.org/keywords/hierarchy","display_name":"Hierarchy","score":0.38199999928474426},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.3578000068664551},{"id":"https://openalex.org/keywords/class","display_name":"Class (philosophy)","score":0.3474999964237213},{"id":"https://openalex.org/keywords/autonomous-agent","display_name":"Autonomous agent","score":0.3190999925136566}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7416999936103821},{"id":"https://openalex.org/C2333172","wikidata":"https://www.wikidata.org/wiki/Q1425985","display_name":"Preorder","level":2,"score":0.6919000148773193},{"id":"https://openalex.org/C184898388","wikidata":"https://www.wikidata.org/wiki/Q1435712","display_name":"Pairwise comparison","level":2,"score":0.6344000101089478},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.632099986076355},{"id":"https://openalex.org/C31170391","wikidata":"https://www.wikidata.org/wiki/Q188619","display_name":"Hierarchy","level":2,"score":0.38199999928474426},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.3578000068664551},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.3474999964237213},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.34610000252723694},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3431999981403351},{"id":"https://openalex.org/C13687954","wikidata":"https://www.wikidata.org/wiki/Q4826847","display_name":"Autonomous agent","level":2,"score":0.3190999925136566},{"id":"https://openalex.org/C206588197","wikidata":"https://www.wikidata.org/wiki/Q846574","display_name":"Reuse","level":2,"score":0.31520000100135803},{"id":"https://openalex.org/C177774035","wikidata":"https://www.wikidata.org/wiki/Q1246948","display_name":"Granularity","level":2,"score":0.2709999978542328},{"id":"https://openalex.org/C2834757","wikidata":"https://www.wikidata.org/wiki/Q4925424","display_name":"Monotone polygon","level":2,"score":0.2703999876976013},{"id":"https://openalex.org/C149441793","wikidata":"https://www.wikidata.org/wiki/Q200726","display_name":"Probability distribution","level":2,"score":0.2687000036239624},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.26600000262260437},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.25920000672340393},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.25279998779296875}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.20230","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.20230","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.20230","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.20230","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.786404550075531}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Autonomous":[0],"driving":[1,199],"involves":[2],"multiple,":[3],"often":[4,31],"conflicting":[5],"objectives":[6,18,71],"such":[7],"as":[8],"safety,":[9],"efficiency,":[10],"and":[11,30,136,172,175,183],"comfort.":[12],"In":[13],"reinforcement":[14],"learning":[15],"(RL),":[16],"these":[17],"are":[19],"typically":[20],"combined":[21],"through":[22],"weighted":[23],"summation,":[24],"which":[25,49,128],"collapses":[26],"their":[27],"relative":[28],"priorities":[29],"yields":[32],"policies":[33,180,188],"that":[34,95,122],"violate":[35],"safety-critical":[36],"constraints.":[37],"To":[38,77],"overcome":[39],"this":[40,79],"limitation,":[41],"we":[42,82,110],"introduce":[43],"the":[44,118],"Preordered":[45],"Multi-Objective":[46],"MDP":[47],"(Pr-MOMDP),":[48],"augments":[50],"standard":[51],"MOMDPs":[52],"with":[53,65,86,143,155],"a":[54,68,74,87,104,149,156],"preorder":[55],"over":[56],"reward":[57],"components.":[58],"This":[59],"structure":[60,80],"enables":[61],"reasoning":[62],"about":[63],"actions":[64,121],"respect":[66,189],"to":[67,132],"hierarchy":[69],"of":[70,120,159],"rather":[72],"than":[73,181],"scalar":[75],"signal.":[76],"make":[78],"actionable,":[81],"extend":[83],"distributional":[84,160],"RL":[85,161],"novel":[88],"pairwise":[89],"comparison":[90],"metric,":[91],"Quantile":[92,145],"Dominance":[93],"(QD),":[94],"evaluates":[96],"action":[97],"return":[98],"distributions":[99],"without":[100],"reducing":[101],"them":[102],"into":[103],"single":[105],"statistic.":[106],"Building":[107],"on":[108],"QD,":[109],"propose":[111],"an":[112],"algorithm":[113],"for":[114],"extracting":[115],"optimal":[116],"subsets,":[117],"subset":[119],"remain":[123],"non-dominated":[124],"under":[125],"each":[126],"objective,":[127],"allows":[129],"precedence":[130],"information":[131],"shape":[133],"both":[134],"decision-making":[135],"training":[137],"targets.":[138],"Our":[139],"framework":[140],"is":[141],"instantiated":[142],"Implicit":[144],"Networks":[146],"(IQN),":[147],"establishing":[148],"concrete":[150],"implementation":[151],"while":[152],"preserving":[153],"compatibility":[154],"broad":[157],"class":[158],"methods.":[162],"Experiments":[163],"in":[164],"Carla":[165],"show":[166],"improved":[167],"success":[168],"rates,":[169],"fewer":[170],"collisions":[171],"off-road":[173],"events,":[174],"deliver":[176],"statistically":[177],"more":[178,196],"robust":[179],"IQN":[182],"ensemble-IQN":[184],"baselines.":[185],"By":[186],"ensuring":[187],"rewards":[190],"preorder,":[191],"our":[192],"work":[193],"advances":[194],"safer,":[195],"reliable":[197],"autonomous":[198],"systems.":[200]},"counts_by_year":[],"updated_date":"2026-08-12T21:12:35.861297","created_date":"2026-03-25T00:00:00"}
