{"id":"https://openalex.org/W4416749579","doi":"https://doi.org/10.1109/iros60139.2025.11246765","title":"Robust Reinforcement Learning based on Momentum Adversarial Training","display_name":"Robust Reinforcement Learning based on Momentum Adversarial Training","publication_year":2025,"publication_date":"2025-10-19","ids":{"openalex":"https://openalex.org/W4416749579","doi":"https://doi.org/10.1109/iros60139.2025.11246765"},"language":null,"primary_location":{"id":"doi:10.1109/iros60139.2025.11246765","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros60139.2025.11246765","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5032688465","display_name":"He Li","orcid":"https://orcid.org/0000-0003-3993-7928"},"institutions":[{"id":"https://openalex.org/I4210116723","display_name":"Robotics Research (United States)","ror":"https://ror.org/020w2fr77","country_code":"US","type":"company","lineage":["https://openalex.org/I4210116723"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Li He","raw_affiliation_strings":["Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433","institution_ids":["https://openalex.org/I4210116723"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Hanchen Liu","orcid":null},"institutions":[{"id":"https://openalex.org/I4210116723","display_name":"Robotics Research (United States)","ror":"https://ror.org/020w2fr77","country_code":"US","type":"company","lineage":["https://openalex.org/I4210116723"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Hanchen Liu","raw_affiliation_strings":["Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433","institution_ids":["https://openalex.org/I4210116723"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5081998172","display_name":"Junru Sheng","orcid":null},"institutions":[{"id":"https://openalex.org/I4210116723","display_name":"Robotics Research (United States)","ror":"https://ror.org/020w2fr77","country_code":"US","type":"company","lineage":["https://openalex.org/I4210116723"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Junru Sheng","raw_affiliation_strings":["Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433","institution_ids":["https://openalex.org/I4210116723"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100414906","display_name":"Lihua Zhang","orcid":"https://orcid.org/0000-0003-0467-4347"},"institutions":[{"id":"https://openalex.org/I4210116723","display_name":"Robotics Research (United States)","ror":"https://ror.org/020w2fr77","country_code":"US","type":"company","lineage":["https://openalex.org/I4210116723"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Lihua Zhang","raw_affiliation_strings":["Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433","institution_ids":["https://openalex.org/I4210116723"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5067808391","display_name":"Zhiyan Dong","orcid":"https://orcid.org/0000-0002-9459-1889"},"institutions":[{"id":"https://openalex.org/I4210116723","display_name":"Robotics Research (United States)","ror":"https://ror.org/020w2fr77","country_code":"US","type":"company","lineage":["https://openalex.org/I4210116723"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zhiyan Dong","raw_affiliation_strings":["Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Fudan Unversity,College of Intelligent Robotics and Advanced Manufacturing,Shanghai,China,200433","institution_ids":["https://openalex.org/I4210116723"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I4210116723"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.34284739,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"15231","last_page":"15238"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.34459999203681946,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.34459999203681946,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.31200000643730164,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11133","display_name":"UAV Applications and Optimization","score":0.08789999783039093,"subfield":{"id":"https://openalex.org/subfields/2202","display_name":"Aerospace Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.746399998664856},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.7404999732971191},{"id":"https://openalex.org/keywords/adaptability","display_name":"Adaptability","score":0.5174000263214111},{"id":"https://openalex.org/keywords/gradient-descent","display_name":"Gradient descent","score":0.4505999982357025},{"id":"https://openalex.org/keywords/perturbation","display_name":"Perturbation (astronomy)","score":0.40230000019073486},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.38830000162124634},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.3702000081539154}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.746399998664856},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.7404999732971191},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6384000182151794},{"id":"https://openalex.org/C177606310","wikidata":"https://www.wikidata.org/wiki/Q5674297","display_name":"Adaptability","level":2,"score":0.5174000263214111},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.48339998722076416},{"id":"https://openalex.org/C153258448","wikidata":"https://www.wikidata.org/wiki/Q1199743","display_name":"Gradient descent","level":3,"score":0.4505999982357025},{"id":"https://openalex.org/C177918212","wikidata":"https://www.wikidata.org/wiki/Q803623","display_name":"Perturbation (astronomy)","level":2,"score":0.40230000019073486},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.38830000162124634},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.3702000081539154},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3684999942779541},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.34200000762939453},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.3310999870300293},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.2896000146865845},{"id":"https://openalex.org/C206688291","wikidata":"https://www.wikidata.org/wiki/Q7617819","display_name":"Stochastic gradient descent","level":3,"score":0.28839999437332153},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.2784999907016754},{"id":"https://openalex.org/C150415221","wikidata":"https://www.wikidata.org/wiki/Q40687","display_name":"Robotic arm","level":2,"score":0.27000001072883606},{"id":"https://openalex.org/C31531917","wikidata":"https://www.wikidata.org/wiki/Q915157","display_name":"Robust control","level":3,"score":0.26499998569488525}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/iros60139.2025.11246765","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros60139.2025.11246765","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":14,"referenced_works":["https://openalex.org/W1994616650","https://openalex.org/W2767050701","https://openalex.org/W2951360122","https://openalex.org/W2962890638","https://openalex.org/W2997293639","https://openalex.org/W2998401161","https://openalex.org/W3045875028","https://openalex.org/W3088310808","https://openalex.org/W3091635810","https://openalex.org/W3200885897","https://openalex.org/W4242795701","https://openalex.org/W4283797804","https://openalex.org/W4309326691","https://openalex.org/W4312829939"],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,140],"(RL)":[2],"is":[3,62,93,116,188,235,259],"a":[4,32,48,107],"fundamental":[5],"and":[6,18,29,35,118,181,196,207,261,282],"pivotal":[7],"algorithm":[8],"in":[9,74,80,91,100,150,192,200,205,246,276],"the":[10,27,43,67,75,81,97,128,151,193,222,225,232,241,269],"advancement":[11],"of":[12,23,31,45,111,130,224,243,272],"autonomous":[13,101,131,273],"intelligence,":[14,274],"including":[15],"Embodied":[16],"Intelligence":[17],"Physical":[19],"Intelligence.":[20],"The":[21,88,185,228],"performance":[22],"RL":[24,46,92,112,122,254],"directly":[25],"influences":[26],"quality":[28],"efficiency":[30],"robot\u2019s":[33],"decision-making":[34],"execution":[36],"during":[37],"interactions":[38],"with":[39],"its":[40,278],"environment.":[41],"Moreover,":[42],"robustness":[44,61,123,206,255],"remains":[47],"critical":[49],"challenge":[50],"that":[51,142,165,231,252],"needs":[52],"to":[53,59,120,147,219,268,280],"be":[54],"addressed.":[55],"A":[56],"promising":[57],"approach":[58,177],"enhancing":[60,253],"adversarial":[63,139],"reinforcement":[64],"learning.":[65],"However,":[66],"existing":[68],"methods":[69],"primarily":[70],"focus":[71],"on":[72],"perturbations":[73,79,105,126,149,258],"state":[76,98],"space,":[77,153],"while":[78],"action":[82,89,152],"space":[83,90,99],"have":[84],"been":[85],"relatively":[86],"underexplored.":[87],"as":[94,96,155],"crucial":[95],"intelligence.":[102,132],"Furthermore,":[103,158],"action-space":[104,125,210,257],"provide":[106],"more":[108],"comprehensive":[109],"evaluation":[110],"robustness.":[113],"Therefore,":[114],"it":[115],"necessary":[117],"valuable":[119],"investigate":[121],"under":[124,209],"for":[127,240],"development":[129,271],"To":[133],"this":[134],"end,":[135],"we":[136,159],"propose":[137],"an":[138,161],"framework":[141],"employs":[143],"momentum-based":[144],"gradient":[145,168],"descent":[146],"model":[148],"such":[154],"actuator":[156],"disturbances.":[157],"introduce":[160],"improved":[162],"optimization":[163],"method":[164,187,245],"integrates":[166],"historical":[167],"information":[169],"into":[170],"conventional":[171],"Stochastic":[172],"Gradient":[173],"Descent":[174],"(SGD).":[175],"This":[176,249],"enhances":[178],"training":[179],"stability":[180],"improves":[182],"perturbation":[183],"efficiency.":[184],"proposed":[186,226],"evaluated":[189],"through":[190,256],"simulations":[191],"MuJoCo":[194],"environment":[195],"UAV":[197,214],"control":[198],"experiments":[199],"GymFC,":[201],"demonstrating":[202],"significant":[203],"improvements":[204],"adaptability":[208],"perturbations.":[211],"Additionally,":[212],"real-world":[213,247],"flight":[215],"tests":[216],"are":[217],"conducted":[218],"further":[220],"validate":[221],"effectiveness":[223],"framework.":[227],"results":[229],"confirm":[230],"Sim-to-Real":[233],"transfer":[234],"successful,":[236],"providing":[237],"empirical":[238],"evidence":[239],"applicability":[242],"our":[244,265],"scenarios.":[248],"study":[250],"shows":[251],"feasible":[260],"effective.":[262],"More":[263],"importantly,":[264],"findings":[266],"contribute":[267],"future":[270],"particularly":[275],"improving":[277],"resilience":[279],"uncertainties":[281],"dynamic":[283],"environments.":[284]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-11-28T00:00:00"}
