{"id":"https://openalex.org/W4416750700","doi":"https://doi.org/10.1109/iros60139.2025.11246629","title":"Multi-Agent Reinforcement Learning Guided by Signal Temporal Logic Specifications","display_name":"Multi-Agent Reinforcement Learning Guided by Signal Temporal Logic Specifications","publication_year":2025,"publication_date":"2025-10-19","ids":{"openalex":"https://openalex.org/W4416750700","doi":"https://doi.org/10.1109/iros60139.2025.11246629"},"language":null,"primary_location":{"id":"doi:10.1109/iros60139.2025.11246629","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros60139.2025.11246629","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101462161","display_name":"Jiangwei Wang","orcid":"https://orcid.org/0000-0002-0172-5922"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiangwei Wang","raw_affiliation_strings":["University of Connecticut"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Connecticut","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101601665","display_name":"Shuo Yang","orcid":"https://orcid.org/0000-0003-4516-9953"},"institutions":[{"id":"https://openalex.org/I36788626","display_name":"California University of Pennsylvania","ror":"https://ror.org/01spssf70","country_code":"US","type":"education","lineage":["https://openalex.org/I36788626"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Shuo Yang","raw_affiliation_strings":["University of Pennsylvania"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Pennsylvania","institution_ids":["https://openalex.org/I36788626"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5002719380","display_name":"Ziyan An","orcid":"https://orcid.org/0000-0002-1083-0011"},"institutions":[{"id":"https://openalex.org/I200719446","display_name":"Vanderbilt University","ror":"https://ror.org/02vm5rt34","country_code":"US","type":"education","lineage":["https://openalex.org/I200719446"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Ziyan An","raw_affiliation_strings":["Vanderbilt University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Vanderbilt University","institution_ids":["https://openalex.org/I200719446"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5026925915","display_name":"Songyang Han","orcid":"https://orcid.org/0000-0001-8314-4832"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Songyang Han","raw_affiliation_strings":["University of Connecticut"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Connecticut","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103664955","display_name":"Zhili Zhang","orcid":"https://orcid.org/0000-0003-0076-7511"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhili Zhang","raw_affiliation_strings":["University of Connecticut"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Connecticut","institution_ids":[]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5009445756","display_name":"Rahul Mangharam","orcid":"https://orcid.org/0000-0002-3388-8283"},"institutions":[{"id":"https://openalex.org/I36788626","display_name":"California University of Pennsylvania","ror":"https://ror.org/01spssf70","country_code":"US","type":"education","lineage":["https://openalex.org/I36788626"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Rahul Mangharam","raw_affiliation_strings":["University of Pennsylvania"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Pennsylvania","institution_ids":["https://openalex.org/I36788626"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5007967134","display_name":"Meiyi Ma","orcid":"https://orcid.org/0000-0001-6916-8774"},"institutions":[{"id":"https://openalex.org/I200719446","display_name":"Vanderbilt University","ror":"https://ror.org/02vm5rt34","country_code":"US","type":"education","lineage":["https://openalex.org/I200719446"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Meiyi Ma","raw_affiliation_strings":["Vanderbilt University"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Vanderbilt University","institution_ids":["https://openalex.org/I200719446"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100660283","display_name":"Fei Miao","orcid":"https://orcid.org/0000-0003-2417-0808"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fei Miao","raw_affiliation_strings":["University of Connecticut"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Connecticut","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"6048","last_page":"6054"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10142","display_name":"Formal Methods in Verification","score":0.4097999930381775,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10142","display_name":"Formal Methods in Verification","score":0.4097999930381775,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.20319999754428864,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.07440000027418137,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8532999753952026},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.6115000247955322},{"id":"https://openalex.org/keywords/flexibility","display_name":"Flexibility (engineering)","score":0.5544000267982483},{"id":"https://openalex.org/keywords/temporal-logic","display_name":"Temporal logic","score":0.4950000047683716},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.43459999561309814},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.3952000141143799},{"id":"https://openalex.org/keywords/component","display_name":"Component (thermodynamics)","score":0.3443000018596649},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.3361999988555908}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8532999753952026},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7384999990463257},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.6115000247955322},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.5544000267982483},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5397999882698059},{"id":"https://openalex.org/C25016198","wikidata":"https://www.wikidata.org/wiki/Q781833","display_name":"Temporal logic","level":2,"score":0.4950000047683716},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.43459999561309814},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.40209999680519104},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3952000141143799},{"id":"https://openalex.org/C168167062","wikidata":"https://www.wikidata.org/wiki/Q1117970","display_name":"Component (thermodynamics)","level":2,"score":0.3443000018596649},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3361999988555908},{"id":"https://openalex.org/C111498074","wikidata":"https://www.wikidata.org/wiki/Q173326","display_name":"Formal verification","level":2,"score":0.3222000002861023},{"id":"https://openalex.org/C199190896","wikidata":"https://www.wikidata.org/wiki/Q3509276","display_name":"Learning classifier system","level":3,"score":0.3066999912261963},{"id":"https://openalex.org/C2780502288","wikidata":"https://www.wikidata.org/wiki/Q28838156","display_name":"Expansive","level":3,"score":0.28940001130104065},{"id":"https://openalex.org/C132010649","wikidata":"https://www.wikidata.org/wiki/Q189222","display_name":"Intuition","level":2,"score":0.27959999442100525},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.27619999647140503},{"id":"https://openalex.org/C75606506","wikidata":"https://www.wikidata.org/wiki/Q1049183","display_name":"Formal methods","level":2,"score":0.2651999890804291},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.2644999921321869},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.2612999975681305},{"id":"https://openalex.org/C4777664","wikidata":"https://www.wikidata.org/wiki/Q1536492","display_name":"Linear temporal logic","level":2,"score":0.25440001487731934}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/iros60139.2025.11246629","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros60139.2025.11246629","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320306076","display_name":"National Science Foundation","ror":"https://ror.org/021nxhr62"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":25,"referenced_works":["https://openalex.org/W1542941925","https://openalex.org/W1547304883","https://openalex.org/W2560504659","https://openalex.org/W2567705466","https://openalex.org/W2793611744","https://openalex.org/W2841721725","https://openalex.org/W2915117209","https://openalex.org/W2969525674","https://openalex.org/W2991046523","https://openalex.org/W2995074243","https://openalex.org/W3004091789","https://openalex.org/W3089408878","https://openalex.org/W3164005523","https://openalex.org/W3173294282","https://openalex.org/W3186317065","https://openalex.org/W3195968524","https://openalex.org/W3204848416","https://openalex.org/W4283821610","https://openalex.org/W4284699363","https://openalex.org/W4313016741","https://openalex.org/W4318983719","https://openalex.org/W4381733136","https://openalex.org/W4383097628","https://openalex.org/W4385767976","https://openalex.org/W4389519952"],"related_works":[],"abstract_inverted_index":{"Reward":[0],"design":[1,76],"is":[2,77],"a":[3,23,102,169],"key":[4],"component":[5],"of":[6,57,63,82,123,177],"deep":[7],"reinforcement":[8,72,106],"learning":[9,73,107],"(DRL),":[10],"yet":[11],"some":[12],"tasks":[13],"and":[14,44,50,55,87,126],"designer\u2019s":[15],"objectives":[16],"may":[17],"be":[18],"unnatural":[19],"to":[20,41,114,120,141,162],"define":[21],"as":[22],"scalar":[24],"cost":[25],"function.":[26],"Among":[27],"the":[28,48,58,61,121,134,173,178],"various":[29,152],"techniques,":[30],"formal":[31],"methods":[32],"integrated":[33],"with":[34,168],"DRL":[35],"have":[36],"garnered":[37],"considerable":[38],"attention":[39],"due":[40],"their":[42],"expressiveness":[43],"flexibility":[45],"in":[46,91,172],"defining":[47],"reward":[49,75],"requirements":[51,90,111],"for":[52,69],"different":[53],"states":[54,135],"actions":[56],"agent.":[59],"Nevertheless,":[60],"exploration":[62],"leveraging":[64],"Signal":[65],"Temporal":[66],"Logic":[67],"(STL)":[68],"guiding":[70],"multi-agent":[71,92,105,179],"(MARL)":[74],"still":[78],"limited.":[79],"The":[80,109,129,154],"presence":[81],"complex":[83],"interactions,":[84],"heterogeneous":[85],"goals,":[86],"critical":[88],"safety":[89,127,175],"systems":[93],"exacerbates":[94],"this":[95,98],"challenge.":[96],"In":[97],"paper,":[99],"we":[100],"propose":[101],"novel":[103],"STL-guided":[104],"framework.":[108],"STL":[110,137,165],"are":[112,139],"designed":[113],"include":[115],"both":[116],"task":[117],"specifications":[118,138],"according":[119],"objective":[122],"each":[124],"agent":[125],"specifications.":[128],"robustness":[130],"values":[131],"from":[132],"checking":[133],"against":[136],"leveraged":[140],"generate":[142],"rewards.":[143],"We":[144],"validate":[145],"our":[146],"approach":[147],"by":[148],"conducting":[149],"experiments":[150],"across":[151],"testbeds.":[153],"experimental":[155],"results":[156],"demonstrate":[157],"significant":[158],"performance":[159],"improvements":[160],"compared":[161],"MARL":[163],"without":[164],"guidance,":[166],"along":[167],"remarkable":[170],"increase":[171],"overall":[174],"rate":[176],"systems.":[180]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-11-28T00:00:00"}
