{"id":"https://openalex.org/W4417447611","doi":"https://doi.org/10.48550/arxiv.2512.12046","title":"Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning","display_name":"Goal Reaching with Eikonal-Constrained Hierarchical Quasimetric Reinforcement Learning","publication_year":2025,"publication_date":"2025-12-12","ids":{"openalex":"https://openalex.org/W4417447611","doi":"https://doi.org/10.48550/arxiv.2512.12046"},"language":null,"primary_location":{"id":"pmh:oai:arXiv.org:2512.12046","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2512.12046","pdf_url":"https://arxiv.org/pdf/2512.12046","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"type":"preprint","indexed_in":["arxiv","datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://arxiv.org/pdf/2512.12046","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5075631895","display_name":"Vittorio Giammarino","orcid":"https://orcid.org/0000-0001-7082-3262"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Giammarino, Vittorio","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5056336556","display_name":"Ahmed H. Qureshi","orcid":"https://orcid.org/0000-0003-2104-2333"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Qureshi, Ahmed H.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10982","display_name":"Motor Control and Adaptation","score":0.20200000703334808,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},"topics":[{"id":"https://openalex.org/T10982","display_name":"Motor Control and Adaptation","score":0.20200000703334808,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.17499999701976776,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.14229999482631683,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8173999786376953},{"id":"https://openalex.org/keywords/consistency","display_name":"Consistency (knowledge bases)","score":0.4977000057697296},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.46970000863075256},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.4634000062942505},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.42660000920295715},{"id":"https://openalex.org/keywords/temporal-difference-learning","display_name":"Temporal difference learning","score":0.36390000581741333},{"id":"https://openalex.org/keywords/framing","display_name":"Framing (construction)","score":0.3440000116825104}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8173999786376953},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6796000003814697},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5008000135421753},{"id":"https://openalex.org/C2776436953","wikidata":"https://www.wikidata.org/wiki/Q5163215","display_name":"Consistency (knowledge bases)","level":2,"score":0.4977000057697296},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.46970000863075256},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.4634000062942505},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.42660000920295715},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.36390000581741333},{"id":"https://openalex.org/C169087156","wikidata":"https://www.wikidata.org/wiki/Q2131593","display_name":"Framing (construction)","level":2,"score":0.3440000116825104},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.3255000114440918},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.30379998683929443},{"id":"https://openalex.org/C93226319","wikidata":"https://www.wikidata.org/wiki/Q193137","display_name":"Differential (mechanical device)","level":2,"score":0.2904999852180481},{"id":"https://openalex.org/C2983787585","wikidata":"https://www.wikidata.org/wiki/Q93586","display_name":"Feature matching","level":3,"score":0.2784999907016754},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.2531000077724457},{"id":"https://openalex.org/C91873725","wikidata":"https://www.wikidata.org/wiki/Q3445816","display_name":"Function approximation","level":3,"score":0.2515000104904175},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.250900000333786}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:oai:arXiv.org:2512.12046","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2512.12046","pdf_url":"https://arxiv.org/pdf/2512.12046","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},{"id":"doi:10.48550/arxiv.2512.12046","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2512.12046","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:oai:arXiv.org:2512.12046","is_oa":true,"landing_page_url":"http://arxiv.org/abs/2512.12046","pdf_url":"https://arxiv.org/pdf/2512.12046","source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"text"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4417447611.pdf","grobid_xml":"https://content.openalex.org/works/W4417447611.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Goal-Conditioned":[0],"Reinforcement":[1],"Learning":[2],"(GCRL)":[3],"mitigates":[4],"the":[5,25,66],"difficulty":[6],"of":[7,62],"reward":[8,20],"design":[9],"by":[10],"framing":[11],"tasks":[12],"as":[13],"goal":[14],"reaching":[15],"rather":[16],"than":[17],"maximizing":[18],"hand-crafted":[19],"signals.":[21],"In":[22],"this":[23],"setting,":[24],"optimal":[26],"goal-conditioned":[27,125],"value":[28,40],"function":[29],"naturally":[30],"forms":[31],"a":[32,59,115],"quasimetric,":[33],"motivating":[34],"Quasimetric":[35,56],"RL":[36,57],"(QRL),":[37],"which":[38,111],"constrains":[39],"learning":[41],"to":[42],"quasimetric":[43],"mappings":[44],"and":[45,82,94,127],"enforces":[46],"local":[47],"consistency":[48],"through":[49],"discrete,":[50],"trajectory-based":[51],"constraints.":[52],"We":[53,88],"propose":[54],"Eikonal-Constrained":[55],"(Eik-QRL),":[58],"continuous-time":[60],"reformulation":[61],"QRL":[63,109,132],"based":[64],"on":[65],"Eikonal":[67],"Partial":[68],"Differential":[69],"Equation":[70],"(PDE).":[71],"This":[72],"PDE-based":[73],"structure":[74],"makes":[75],"Eik-QRL":[76,93,113],"trajectory-free,":[77],"requiring":[78],"only":[79],"sampled":[80],"states":[81],"goals,":[83],"while":[84],"improving":[85],"out-of-distribution":[86],"generalization.":[87],"provide":[89],"theoretical":[90],"guarantees":[91],"for":[92],"identify":[95],"limitations":[96],"that":[97],"arise":[98],"under":[99],"complex":[100],"dynamics.":[101],"To":[102],"address":[103],"these":[104],"challenges,":[105],"we":[106],"introduce":[107],"Eik-Hierarchical":[108],"(Eik-HiQRL),":[110],"integrates":[112],"into":[114],"hierarchical":[116],"decomposition.":[117],"Empirically,":[118],"Eik-HiQRL":[119],"achieves":[120],"state-of-the-art":[121],"performance":[122],"in":[123,133],"offline":[124],"navigation":[126],"yields":[128],"consistent":[129],"gains":[130],"over":[131],"manipulation":[134],"tasks,":[135],"matching":[136],"temporal-difference":[137],"methods.":[138]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-12-17T00:00:00"}
