{"id":"https://openalex.org/W6891855279","doi":"https://doi.org/10.48550/arxiv.2502.17813","title":"Safe Multi-Agent Navigation guided by Goal-Conditioned Safe Reinforcement Learning","display_name":"Safe Multi-Agent Navigation guided by Goal-Conditioned Safe Reinforcement Learning","publication_year":2025,"publication_date":"2025-02-25","ids":{"openalex":"https://openalex.org/W6891855279","doi":"https://doi.org/10.48550/arxiv.2502.17813"},"language":"en","primary_location":{"id":"doi:10.48550/arxiv.2502.17813","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2502.17813","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2502.17813","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Feng, Meng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Feng, Meng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Parimi, Viraj","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Parimi, Viraj","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"Williams, Brian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Williams, Brian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":true,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4302999973297119,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.4302999973297119,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10586","display_name":"Robotic Path Planning Algorithms","score":0.18140000104904175,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11099","display_name":"Autonomous Vehicle Technology and Safety","score":0.1111999973654747,"subfield":{"id":"https://openalex.org/subfields/2203","display_name":"Automotive Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8039000034332275},{"id":"https://openalex.org/keywords/safer","display_name":"SAFER","score":0.6801000237464905},{"id":"https://openalex.org/keywords/leverage","display_name":"Leverage (statistics)","score":0.6287000179290771},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.5968999862670898},{"id":"https://openalex.org/keywords/heuristics","display_name":"Heuristics","score":0.5928999781608582},{"id":"https://openalex.org/keywords/graph","display_name":"Graph","score":0.5127000212669373},{"id":"https://openalex.org/keywords/benchmarking","display_name":"Benchmarking","score":0.492900013923645}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8039000034332275},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7178999781608582},{"id":"https://openalex.org/C2776654903","wikidata":"https://www.wikidata.org/wiki/Q2601463","display_name":"SAFER","level":2,"score":0.6801000237464905},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.6287000179290771},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.5968999862670898},{"id":"https://openalex.org/C127705205","wikidata":"https://www.wikidata.org/wiki/Q5748245","display_name":"Heuristics","level":2,"score":0.5928999781608582},{"id":"https://openalex.org/C132525143","wikidata":"https://www.wikidata.org/wiki/Q141488","display_name":"Graph","level":2,"score":0.5127000212669373},{"id":"https://openalex.org/C86251818","wikidata":"https://www.wikidata.org/wiki/Q816754","display_name":"Benchmarking","level":2,"score":0.492900013923645},{"id":"https://openalex.org/C55439883","wikidata":"https://www.wikidata.org/wiki/Q360812","display_name":"Correctness","level":2,"score":0.36880001425743103},{"id":"https://openalex.org/C81074085","wikidata":"https://www.wikidata.org/wiki/Q366872","display_name":"Motion planning","level":3,"score":0.3517000079154968},{"id":"https://openalex.org/C2776505523","wikidata":"https://www.wikidata.org/wiki/Q4785468","display_name":"Plan (archaeology)","level":2,"score":0.3458000123500824},{"id":"https://openalex.org/C2989549987","wikidata":"https://www.wikidata.org/wiki/Q350882","display_name":"Route planning","level":2,"score":0.3093999922275543},{"id":"https://openalex.org/C22507642","wikidata":"https://www.wikidata.org/wiki/Q1069369","display_name":"Hazardous waste","level":2,"score":0.3019999861717224},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2962000072002411},{"id":"https://openalex.org/C2777904410","wikidata":"https://www.wikidata.org/wiki/Q7397","display_name":"Software","level":2,"score":0.28529998660087585},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2671999931335449},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.2590999901294708},{"id":"https://openalex.org/C170130773","wikidata":"https://www.wikidata.org/wiki/Q216378","display_name":"Usability","level":2,"score":0.25519999861717224}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2502.17813","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2502.17813","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2502.17813","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2502.17813","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Safe":[0],"navigation":[1,87,164,184],"is":[2,237],"essential":[3],"for":[4,86,177,181,221],"autonomous":[5],"systems":[6],"operating":[7],"in":[8,50,197,216,224],"hazardous":[9,227],"environments.":[10,228],"Traditional":[11],"planning":[12,69],"methods":[13],"excel":[14],"at":[15,239],"long-horizon":[16,47],"tasks":[17],"but":[18,43],"rely":[19],"on":[20,40],"a":[21,60,83,107,122,148],"predefined":[22],"graph":[23,108,146],"with":[24,109],"fixed":[25],"distance":[26,92,218],"metrics.":[27],"In":[28,55,166],"contrast,":[29],"safe":[30,71,79,152,163,183,195],"Reinforcement":[31],"Learning":[32],"(RL)":[33],"can":[34],"learn":[35,82],"complex":[36,225],"behaviors":[37],"without":[38],"relying":[39],"manual":[41],"heuristics":[42],"fails":[44],"to":[45,81,159,173],"solve":[46],"tasks,":[48],"particularly":[49],"goal-conditioned":[51,76,84,151,194],"and":[52,70,78,93,120,136,147,226,231],"multi-agent":[53,162,198],"scenarios.":[54],"this":[56,143,157],"paper,":[57],"we":[58,155,168],"introduce":[59],"novel":[61],"method":[62,74,116,215],"that":[63,125],"integrates":[64],"the":[65,112,126,161,191,211],"strengths":[66],"of":[67,193,213],"both":[68],"RL.":[72],"Our":[73,229],"leverages":[75],"RL":[77,80,153,196],"policy":[85],"while":[88],"concurrently":[89],"estimating":[90],"cumulative":[91],"safety":[94],"levels":[95],"using":[96],"learned":[97],"value":[98],"functions":[99],"via":[100],"an":[101],"automated":[102],"self-training":[103],"algorithm.":[104],"By":[105],"constructing":[106],"states":[110],"from":[111],"replay":[113],"buffer,":[114],"our":[115,214],"prunes":[117],"unsafe":[118],"edges":[119],"generates":[121],"waypoint-based":[123,175],"plan":[124],"agent":[127],"follows":[128],"until":[129],"reaching":[130],"its":[131],"goal,":[132],"effectively":[133],"balancing":[134],"faster":[135],"safer":[137],"routes":[138],"over":[139,185],"extended":[140,186],"distances.":[141],"Utilizing":[142],"unified":[144],"high-level":[145],"shared":[149],"low-level":[150],"policy,":[154],"extend":[156],"approach":[158],"address":[160],"problem.":[165],"particular,":[167],"leverage":[169],"Conflict-Based":[170],"Search":[171],"(CBS)":[172],"create":[174],"plans":[176],"multiple":[178,222],"agents":[179,223],"allowing":[180],"their":[182],"horizons.":[187],"This":[188],"integration":[189],"enhances":[190],"scalability":[192],"scenarios,":[199],"enabling":[200],"efficient":[201],"coordination":[202],"among":[203],"agents.":[204],"Extensive":[205],"benchmarking":[206],"against":[207],"state-of-the-art":[208],"baselines":[209],"demonstrates":[210],"effectiveness":[212],"achieving":[217],"goals":[219],"safely":[220],"code":[230],"further":[232],"details":[233],"about":[234],"or":[235],"work":[236],"available":[238],"https://safe-visual-mapf-mers.csail.mit.edu/.":[240]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-10-10T00:00:00"}
