{"id":"https://openalex.org/W7128490639","doi":"https://doi.org/10.48550/arxiv.2602.07764","title":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","display_name":"Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization","publication_year":2026,"publication_date":"2026-02-08","ids":{"openalex":"https://openalex.org/W7128490639","doi":"https://doi.org/10.48550/arxiv.2602.07764"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2602.07764","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5125536649","display_name":"Tanmay Ambadkar","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ambadkar, Tanmay","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5125557658","display_name":"Sourav Panda","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Panda, Sourav","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5125477690","display_name":"Shreyash Kale","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kale, Shreyash","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5053324798","display_name":"Jonathan Dodge","orcid":"https://orcid.org/0009-0000-5175-5962"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Dodge, Jonathan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5101988843","display_name":"Abhinav Verma","orcid":"https://orcid.org/0000-0002-9820-8285"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Verma, Abhinav","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.1556194,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5148000121116638,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.5148000121116638,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10848","display_name":"Advanced Multi-Objective Optimization Algorithms","score":0.2298000007867813,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.026799999177455902,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6876000165939331},{"id":"https://openalex.org/keywords/preference","display_name":"Preference","score":0.6186000108718872},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.578499972820282},{"id":"https://openalex.org/keywords/pipeline","display_name":"Pipeline (software)","score":0.4893999993801117},{"id":"https://openalex.org/keywords/pareto-principle","display_name":"Pareto principle","score":0.48500001430511475},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.43479999899864197},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.36169999837875366},{"id":"https://openalex.org/keywords/multi-objective-optimization","display_name":"Multi-objective optimization","score":0.35280001163482666}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6876000165939331},{"id":"https://openalex.org/C2781249084","wikidata":"https://www.wikidata.org/wiki/Q908656","display_name":"Preference","level":2,"score":0.6186000108718872},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.578499972820282},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5343999862670898},{"id":"https://openalex.org/C43521106","wikidata":"https://www.wikidata.org/wiki/Q2165493","display_name":"Pipeline (software)","level":2,"score":0.4893999993801117},{"id":"https://openalex.org/C137635306","wikidata":"https://www.wikidata.org/wiki/Q182667","display_name":"Pareto principle","level":2,"score":0.48500001430511475},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.43479999899864197},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.39259999990463257},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.36169999837875366},{"id":"https://openalex.org/C68781425","wikidata":"https://www.wikidata.org/wiki/Q2052203","display_name":"Multi-objective optimization","level":2,"score":0.35280001163482666},{"id":"https://openalex.org/C21200559","wikidata":"https://www.wikidata.org/wiki/Q7451068","display_name":"Sensitivity (control systems)","level":2,"score":0.3467999994754791},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.34279999136924744},{"id":"https://openalex.org/C2779110102","wikidata":"https://www.wikidata.org/wiki/Q1323737","display_name":"Revealed preference","level":2,"score":0.34049999713897705},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.32820001244544983},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.32679998874664307},{"id":"https://openalex.org/C2781316041","wikidata":"https://www.wikidata.org/wiki/Q1230584","display_name":"Diversity (politics)","level":2,"score":0.3264000117778778},{"id":"https://openalex.org/C2778049539","wikidata":"https://www.wikidata.org/wiki/Q17002908","display_name":"Bayesian optimization","level":2,"score":0.322299987077713},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3181000053882599},{"id":"https://openalex.org/C158154518","wikidata":"https://www.wikidata.org/wiki/Q7310970","display_name":"Relevance (law)","level":2,"score":0.310699999332428},{"id":"https://openalex.org/C66283442","wikidata":"https://www.wikidata.org/wiki/Q1389268","display_name":"Failure mode and effects analysis","level":2,"score":0.2597000002861023},{"id":"https://openalex.org/C48677424","wikidata":"https://www.wikidata.org/wiki/Q6888088","display_name":"Mode (computer interface)","level":2,"score":0.2583000063896179},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.25760000944137573},{"id":"https://openalex.org/C181204326","wikidata":"https://www.wikidata.org/wiki/Q7239820","display_name":"Preference learning","level":3,"score":0.25450000166893005}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2602.07764","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2602.07764","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2602.07764","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2602.07764","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multi-objective":[0],"reinforcement":[1],"learning":[2,80],"(MORL)":[3],"seeks":[4],"to":[5,30,111,135],"train":[6],"agents":[7],"capable":[8],"of":[9],"balancing":[10],"conflicting":[11,100],"objectives.":[12,101],"While":[13],"single":[14,182],"preference-conditioned":[15],"policies":[16],"offer":[17],"a":[18,69,83,103,152,181],"highly":[19],"scalable":[20],"solution,":[21],"existing":[22],"approaches":[23],"remain":[24],"brittle":[25],"in":[26],"practice,":[27],"frequently":[28],"failing":[29],"recover":[31],"dense":[32],"Pareto":[33,169],"fronts.":[34],"We":[35],"demonstrate":[36],"that":[37,72,148],"this":[38],"failure":[39],"stems":[40],"from":[41],"two":[42],"structural":[43],"pathologies:":[44],"destructive":[45],"advantage":[46],"cancellation":[47],"caused":[48,133],"by":[49,124],"premature":[50],"Early":[51],"Scalarization":[52],"(ES),":[53],"and":[54,86,161,177],"representational":[55],"mode":[56],"collapse":[57],"across":[58],"the":[59,118],"preference":[60,112],"space.":[61],"To":[62],"overcome":[63],"these":[64],"bottlenecks,":[65],"we":[66],"introduce":[67],"$D^3PO$,":[68],"PPO-based":[70],"framework":[71],"fundamentally":[73],"reorganizes":[74],"multi-objective":[75],"optimization.":[76],"By":[77,129],"preserving":[78],"per-objective":[79],"signals":[81],"through":[82],"decomposed":[84],"pipeline":[85],"integrating":[87],"preferences":[88],"only":[89],"after":[90],"trust-region":[91],"stabilization":[92],"(Late-Stage":[93],"Weighting),":[94],"$D^3PO$":[95,114,164],"improves":[96],"credit":[97],"assignment":[98],"under":[99],"Concurrently,":[102],"scaled":[104],"diversity":[105],"regularizer":[106],"encourages":[107],"behavioral":[108],"divergence":[109],"proportional":[110],"distance.":[113],"operates":[115],"entirely":[116],"within":[117],"efficient":[119],"linear":[120,136],"scalarization":[121,137],"regime":[122],"shared":[123],"standard":[125,157],"deep":[126],"MORL":[127],"baselines.":[128],"reducing":[130],"information":[131],"loss":[132],"due":[134],"rather":[138],"than":[139,171],"relying":[140],"on":[141],"expensive":[142],"non-linear":[143],"utility":[144,179],"functions,":[145],"it":[146],"suggests":[147],"optimization":[149],"bottlenecks":[150],"play":[151],"significant":[153],"role.":[154],"Across":[155],"available":[156],"benchmarks,":[158],"including":[159],"high-dimensional":[160],"many-objective":[162],"environments,":[163],"consistently":[165],"discovers":[166],"broader,":[167],"higher-quality":[168],"fronts":[170],"prior":[172],"methods,":[173],"exceeding":[174],"state-of-the-art":[175],"hypervolume":[176],"expected":[178],"using":[180],"deployable":[183],"policy.":[184]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-02-11T00:00:00"}
