{"id":"https://openalex.org/W7166689019","doi":"https://doi.org/10.48550/arxiv.2606.28764","title":"Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization","display_name":"Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization","publication_year":2026,"publication_date":"2026-06-27","ids":{"openalex":"https://openalex.org/W7166689019","doi":"https://doi.org/10.48550/arxiv.2606.28764"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.28764","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.28764","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.28764","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139698481","display_name":"Yuexuan Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wang, Yuexuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139681196","display_name":"Jingyuan Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Jingyuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139703588","display_name":"Kaidi Yang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yang, Kaidi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7929999828338623,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7929999828338623,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10848","display_name":"Advanced Multi-Objective Optimization Algorithms","score":0.0478999987244606,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.03970000147819519,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/heuristic","display_name":"Heuristic","score":0.566100001335144},{"id":"https://openalex.org/keywords/abstraction","display_name":"Abstraction","score":0.5328999757766724},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.486299991607666},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.44670000672340393},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.3978999853134155},{"id":"https://openalex.org/keywords/resource-allocation","display_name":"Resource allocation","score":0.388700008392334},{"id":"https://openalex.org/keywords/constraint","display_name":"Constraint (computer-aided design)","score":0.38339999318122864},{"id":"https://openalex.org/keywords/optimization-problem","display_name":"Optimization problem","score":0.3422999978065491}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7556999921798706},{"id":"https://openalex.org/C173801870","wikidata":"https://www.wikidata.org/wiki/Q201413","display_name":"Heuristic","level":2,"score":0.566100001335144},{"id":"https://openalex.org/C124304363","wikidata":"https://www.wikidata.org/wiki/Q673661","display_name":"Abstraction","level":2,"score":0.5328999757766724},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.486299991607666},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.44670000672340393},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4140999913215637},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3978999853134155},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.39719998836517334},{"id":"https://openalex.org/C29202148","wikidata":"https://www.wikidata.org/wiki/Q287260","display_name":"Resource allocation","level":2,"score":0.388700008392334},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.38659998774528503},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.38339999318122864},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.3422999978065491},{"id":"https://openalex.org/C206345919","wikidata":"https://www.wikidata.org/wiki/Q20380951","display_name":"Resource (disambiguation)","level":2,"score":0.3142000138759613},{"id":"https://openalex.org/C2779304628","wikidata":"https://www.wikidata.org/wiki/Q3503480","display_name":"Face (sociological concept)","level":2,"score":0.30970001220703125},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.27469998598098755},{"id":"https://openalex.org/C2778049539","wikidata":"https://www.wikidata.org/wiki/Q17002908","display_name":"Bayesian optimization","level":2,"score":0.273499995470047},{"id":"https://openalex.org/C207467116","wikidata":"https://www.wikidata.org/wiki/Q4385666","display_name":"Inverse","level":2,"score":0.26019999384880066},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.25690001249313354},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.25270000100135803},{"id":"https://openalex.org/C2780609101","wikidata":"https://www.wikidata.org/wiki/Q17156588","display_name":"Resource management (computing)","level":2,"score":0.25049999356269836},{"id":"https://openalex.org/C28901747","wikidata":"https://www.wikidata.org/wiki/Q177571","display_name":"Decision theory","level":2,"score":0.25029999017715454}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.28764","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.28764","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.28764","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.28764","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.6569945216178894,"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Hierarchical":[0],"decision-making":[1],"frameworks":[2,75],"are":[3],"pivotal":[4],"for":[5],"addressing":[6],"complex":[7],"control":[8,42],"tasks,":[9],"enabling":[10],"agents":[11],"to":[12,34,110],"decompose":[13],"intricate":[14],"problems":[15],"into":[16],"manageable":[17],"subgoals.":[18],"Despite":[19],"their":[20],"promise,":[21],"existing":[22,175],"hierarchical":[23,57,176],"policies":[24],"face":[25],"critical":[26],"limitations:":[27],"(i)":[28],"reinforcement":[29],"learning":[30],"(RL)-based":[31],"methods":[32],"struggle":[33],"guarantee":[35],"strict":[36],"constraint":[37],"satisfaction,":[38],"and":[39,49,153,174,182],"(ii)":[40],"optimal":[41,172],"(OC)-based":[43],"approaches":[44,178],"often":[45,78],"rely":[46],"on":[47,80,145,168],"myopic":[48,83],"computationally":[50],"prohibitive":[51],"formulations.":[52],"To":[53,137],"reconcile":[54],"these":[55,74],"trade-offs,":[56],"RL-OC":[58],"architectures":[59],"have":[60],"emerged":[61],"as":[62],"a":[63,90],"promising":[64],"paradigm.":[65],"However,":[66],"the":[67,70,112,115,123,126,132,139],"formulation":[68],"of":[69,114,125],"lower-level":[71,101,116,127],"optimization":[72,108],"within":[73],"remains":[76,129],"underexplored,":[77],"relying":[79],"heuristic":[81],"or":[82],"objectives.":[84],"In":[85],"this":[86],"work,":[87],"we":[88],"propose":[89],"principled":[91],"framework":[92,142],"that":[93,122,160],"systematically":[94],"integrates":[95],"upper-level":[96],"goal":[97],"abstraction":[98],"with":[99,131],"structured":[100],"decision":[102,147,183],"making.":[103],"We":[104],"adopt":[105],"an":[106],"inverse":[107],"approach":[109],"inform":[111],"structure":[113],"problem":[117],"from":[118],"expert":[119],"demonstrations,":[120],"ensuring":[121],"objective":[124],"policy":[128],"aligned":[130],"overall":[133],"long-term":[134],"task":[135],"goal.":[136],"validate":[138],"approach,":[140],"our":[141,161],"is":[143],"evaluated":[144],"distinct":[146],"making":[148],"tasks:":[149],"network-based":[150],"resource":[151],"allocation":[152],"continuous":[154],"collision":[155],"avoidance.":[156],"Empirical":[157],"results":[158],"demonstrate":[159],"method":[162],"consistently":[163],"outperforms":[164],"strong":[165],"baselines":[166],"based":[167],"end-to-end":[169],"RL,":[170],"learning-augmented":[171],"control,":[173],"RL":[177],"in":[179],"both":[180],"efficiency":[181],"quality.":[184]},"counts_by_year":[],"updated_date":"2026-07-01T06:29:00.853634","created_date":"2026-07-01T00:00:00"}
