{"id":"https://openalex.org/W7139089361","doi":"https://doi.org/10.48550/arxiv.2603.17544","title":"Per-Domain Generalizing Policies: On Learning Efficient and Robust Q-Value Functions (Extended Version with Technical Appendix)","display_name":"Per-Domain Generalizing Policies: On Learning Efficient and Robust Q-Value Functions (Extended Version with Technical Appendix)","publication_year":2026,"publication_date":"2026-03-18","ids":{"openalex":"https://openalex.org/W7139089361","doi":"https://doi.org/10.48550/arxiv.2603.17544"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.17544","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.17544","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.17544","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5130073187","display_name":"Nicola J. M\u00fcller","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"M\u00fcller, Nicola J.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5061021094","display_name":"Moritz Oster","orcid":"https://orcid.org/0000-0002-8943-6657"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Oster, Moritz","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130092028","display_name":"Isabel Valera","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Valera, Isabel","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130114533","display_name":"J\u00f6rg Hoffmann","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hoffmann, J\u00f6rg","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5033310691","display_name":"Timo P. Gros","orcid":"https://orcid.org/0000-0002-1100-1952"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gros, Timo P.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10906","display_name":"AI-based Problem Solving and Planning","score":0.816100001335144,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10906","display_name":"AI-based Problem Solving and Planning","score":0.816100001335144,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.10819999873638153,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10586","display_name":"Robotic Path Planning Algorithms","score":0.009200000204145908,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/planner","display_name":"Planner","score":0.5529999732971191},{"id":"https://openalex.org/keywords/supervised-learning","display_name":"Supervised learning","score":0.4383000135421753},{"id":"https://openalex.org/keywords/graph","display_name":"Graph","score":0.4348999857902527},{"id":"https://openalex.org/keywords/policy-learning","display_name":"Policy learning","score":0.391400009393692},{"id":"https://openalex.org/keywords/range","display_name":"Range (aeronautics)","score":0.38760000467300415},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.3792000114917755},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.37880000472068787},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.36079999804496765}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5928000211715698},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5878999829292297},{"id":"https://openalex.org/C2776999362","wikidata":"https://www.wikidata.org/wiki/Q2349274","display_name":"Planner","level":2,"score":0.5529999732971191},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5070000290870667},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.4383000135421753},{"id":"https://openalex.org/C132525143","wikidata":"https://www.wikidata.org/wiki/Q141488","display_name":"Graph","level":2,"score":0.4348999857902527},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.391400009393692},{"id":"https://openalex.org/C204323151","wikidata":"https://www.wikidata.org/wiki/Q905424","display_name":"Range (aeronautics)","level":2,"score":0.38760000467300415},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.3792000114917755},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.37880000472068787},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.36079999804496765},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.3578000068664551},{"id":"https://openalex.org/C58973888","wikidata":"https://www.wikidata.org/wiki/Q1041418","display_name":"Semi-supervised learning","level":2,"score":0.3546999990940094},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.3255000114440918},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.30300000309944153},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.28679999709129333},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.2800999879837036},{"id":"https://openalex.org/C120822770","wikidata":"https://www.wikidata.org/wiki/Q5156355","display_name":"Competitive learning","level":3,"score":0.2736999988555908},{"id":"https://openalex.org/C146380142","wikidata":"https://www.wikidata.org/wiki/Q1137726","display_name":"Directed graph","level":2,"score":0.26660001277923584}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.17544","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.17544","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.17544","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.17544","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Learning":[0],"per-domain":[1],"generalizing":[2],"policies":[3,44,107,112],"is":[4],"a":[5,30,51,114],"key":[6],"challenge":[7],"in":[8,105],"learning":[9,24,39,70],"for":[10,38,50],"planning.":[11],"Standard":[12],"approaches":[13],"learn":[14,79],"state-value":[15,111],"functions":[16,41],"represented":[17],"as":[18,54,75],"graph":[19],"neural":[20],"networks":[21],"using":[22,97],"supervised":[23,69],"on":[25],"optimal":[26],"plans":[27],"generated":[28],"by":[29,90,96],"teacher":[31],"planner.":[32],"In":[33],"this":[34,95,102],"work,":[35],"we":[36],"advocate":[37],"Q-value":[40,106],"instead.":[42],"Such":[43],"are":[45,120],"drastically":[46],"cheaper":[47],"to":[48,57,80],"evaluate":[49],"given":[52],"state,":[53],"they":[55],"need":[56],"process":[58],"only":[59],"the":[60,83,91,123],"current":[61],"state":[62],"rather":[63],"than":[64],"every":[65],"successor.":[66],"Surprisingly,":[67],"vanilla":[68],"of":[71,116],"Q-values":[72],"performs":[73],"poorly":[74],"it":[76],"does":[77],"not":[78,88],"distinguish":[81],"between":[82],"actions":[84],"taken":[85,89],"and":[86,119],"those":[87],"teacher.":[92],"We":[93],"address":[94],"regularization":[98],"terms":[99],"that":[100,108],"enforce":[101],"distinction,":[103],"resulting":[104],"consistently":[109],"outperform":[110],"across":[113],"range":[115],"10":[117],"domains":[118],"competitive":[121],"with":[122],"planner":[124],"LAMA-first.":[125]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-20T00:00:00"}
