{"id":"https://openalex.org/W4416252141","doi":"https://doi.org/10.1109/ijcnn64981.2025.11228733","title":"AdaPT: Adaptive Policy Transfer for Multi-agent Reinforcement Learning with Domain Classifiers","display_name":"AdaPT: Adaptive Policy Transfer for Multi-agent Reinforcement Learning with Domain Classifiers","publication_year":2025,"publication_date":"2025-06-30","ids":{"openalex":"https://openalex.org/W4416252141","doi":"https://doi.org/10.1109/ijcnn64981.2025.11228733"},"language":null,"primary_location":{"id":"doi:10.1109/ijcnn64981.2025.11228733","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11228733","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5068063235","display_name":"Yuxiang Mai","orcid":"https://orcid.org/0000-0003-3478-0335"},"institutions":[{"id":"https://openalex.org/I4210165038","display_name":"University of Chinese Academy of Sciences","ror":"https://ror.org/05qbk4x57","country_code":"CN","type":"education","lineage":["https://openalex.org/I19820366","https://openalex.org/I4210165038"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yuxiang Mai","raw_affiliation_strings":["University of Chinese Academy of Sciences,School of Artificial Intelligence"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Chinese Academy of Sciences,School of Artificial Intelligence","institution_ids":["https://openalex.org/I4210165038"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5083652259","display_name":"Qiyue Yin","orcid":"https://orcid.org/0000-0002-3442-6275"},"institutions":[{"id":"https://openalex.org/I4210165038","display_name":"University of Chinese Academy of Sciences","ror":"https://ror.org/05qbk4x57","country_code":"CN","type":"education","lineage":["https://openalex.org/I19820366","https://openalex.org/I4210165038"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qiyue Yin","raw_affiliation_strings":["University of Chinese Academy of Sciences,School of Artificial Intelligence"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Chinese Academy of Sciences,School of Artificial Intelligence","institution_ids":["https://openalex.org/I4210165038"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5111924466","display_name":"Wancheng Ni","orcid":null},"institutions":[{"id":"https://openalex.org/I4210165038","display_name":"University of Chinese Academy of Sciences","ror":"https://ror.org/05qbk4x57","country_code":"CN","type":"education","lineage":["https://openalex.org/I19820366","https://openalex.org/I4210165038"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Wancheng Ni","raw_affiliation_strings":["University of Chinese Academy of Sciences,School of Artificial Intelligence"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Chinese Academy of Sciences,School of Artificial Intelligence","institution_ids":["https://openalex.org/I4210165038"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5089545988","display_name":"Kaiqi Huang","orcid":"https://orcid.org/0000-0001-6834-6604"},"institutions":[{"id":"https://openalex.org/I4210165038","display_name":"University of Chinese Academy of Sciences","ror":"https://ror.org/05qbk4x57","country_code":"CN","type":"education","lineage":["https://openalex.org/I19820366","https://openalex.org/I4210165038"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Kaiqi Huang","raw_affiliation_strings":["University of Chinese Academy of Sciences,School of Artificial Intelligence"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Chinese Academy of Sciences,School of Artificial Intelligence","institution_ids":["https://openalex.org/I4210165038"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I4210165038"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"8"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7978000044822693,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7978000044822693,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.10639999806880951,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12535","display_name":"Machine Learning and Data Classification","score":0.007499999832361937,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7325000166893005},{"id":"https://openalex.org/keywords/transfer-of-learning","display_name":"Transfer of learning","score":0.588100016117096},{"id":"https://openalex.org/keywords/domain","display_name":"Domain (mathematical analysis)","score":0.5320000052452087},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.512499988079071},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.510699987411499},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4431000053882599},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.42800000309944153}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7567999958992004},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7325000166893005},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6014999747276306},{"id":"https://openalex.org/C150899416","wikidata":"https://www.wikidata.org/wiki/Q1820378","display_name":"Transfer of learning","level":2,"score":0.588100016117096},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5468000173568726},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.5320000052452087},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.512499988079071},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.510699987411499},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4431000053882599},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.42800000309944153},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.39820000529289246},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.3273000121116638},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.305400013923645},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.3003999888896942},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.3003999888896942},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.2937999963760376},{"id":"https://openalex.org/C103278499","wikidata":"https://www.wikidata.org/wiki/Q254465","display_name":"Similarity (geometry)","level":3,"score":0.2782999873161316},{"id":"https://openalex.org/C2776175482","wikidata":"https://www.wikidata.org/wiki/Q1195816","display_name":"Transfer (computing)","level":2,"score":0.25}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn64981.2025.11228733","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11228733","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":20,"referenced_works":["https://openalex.org/W1457482454","https://openalex.org/W2107464055","https://openalex.org/W2145060720","https://openalex.org/W2165698076","https://openalex.org/W2292533394","https://openalex.org/W2747213132","https://openalex.org/W2921955147","https://openalex.org/W2950153167","https://openalex.org/W2965163470","https://openalex.org/W2980113592","https://openalex.org/W2997536466","https://openalex.org/W3004268170","https://openalex.org/W3188746815","https://openalex.org/W3199079601","https://openalex.org/W3200230461","https://openalex.org/W4239125046","https://openalex.org/W4312585030","https://openalex.org/W4385245566","https://openalex.org/W4385572001","https://openalex.org/W4415566408"],"related_works":[],"abstract_inverted_index":{"Transfer":[0,59],"learning":[1],"has":[2],"shown":[3],"great":[4],"potential":[5],"in":[6,61,84,90,136,147,162,230],"accelerating":[7],"Multi-Agent":[8],"Reinforcement":[9],"Learning":[10],"(MARL)":[11],"training":[12],"by":[13,106,126],"adapting":[14],"agent":[15,27],"policies":[16,32,227],"to":[17,38,42,80,112,160,185,208,226],"varying":[18,165],"input":[19],"and":[20,45,70,117,130,139,222],"output":[21],"dimensions":[22],"across":[23],"tasks":[24,35,163],"with":[25,164],"different":[26],"numbers.":[28],"However,":[29],"directly":[30,229],"applying":[31],"from":[33],"previous":[34],"often":[36],"leads":[37],"low":[39],"performance":[40,224],"due":[41],"domain":[43,68,78,87,119,150],"differences,":[44],"policy":[46,83,124,144,159,175],"fine-tuning":[47],"is":[48,206],"inefficient.":[49],"In":[50,213],"this":[51,104],"paper,":[52],"we":[53,102,169,178],"propose":[54,170],"a":[55,72,82,171,180],"novel":[56,181],"Adaptive":[57],"Policy":[58],"method":[60,217],"MARL":[62],"(AdaPT),":[63],"which":[64],"needs":[65],"the":[66,76,85,91,96,108,113,132,137,143,148,153,158,209,219,231],"source":[67,86,116,138,154],"data":[69,79],"only":[71],"small":[73],"amount":[74],"of":[75,115,167],"target":[77,92,118,140,149,232],"learn":[81],"that":[88,200],"works":[89],"domain.":[93,155,233],"Based":[94],"on":[95,194],"probabilistic":[97],"inference":[98],"view":[99],"over":[100],"trajectories,":[101],"implement":[103],"process":[105],"modifying":[107],"reward":[109],"function":[110],"according":[111],"similarity":[114],"dynamics.":[120],"Intuitively,":[121],"AdaPT":[122],"achieves":[123,223],"transfer":[125,214],"encouraging":[127],"more":[128,145],"exploration":[129],"exploiting":[131],"similar":[133],"state":[134,188],"transitions":[135,189],"domains,":[141],"making":[142],"like":[146],"rather":[151],"than":[152],"To":[156],"enable":[157],"perform":[161],"numbers":[166],"agents,":[168],"transformer-based":[172],"maximum":[173],"entropy":[174],"model.":[176],"Besides,":[177],"use":[179],"centralized":[182],"classifiers":[183],"module":[184],"discriminate":[186],"whether":[187],"are":[190],"similar.":[191],"Experimental":[192],"results":[193],"StarCraft":[195],"II":[196],"micro-management":[197],"environment":[198],"show":[199],"our":[201,216],"base":[202],"model":[203],"outperforms":[204,218],"or":[205],"comparable":[207,225],"SOTA":[210,220],"non-transfer":[211],"models.":[212],"tasks,":[215],"algorithms":[221],"trained":[228]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-11-14T00:00:00"}
