{"id":"https://openalex.org/W7136973482","doi":"https://doi.org/10.1109/jiot.2026.3674392","title":"PRIME: Policy Representation Integration With Metavalue-Modulated Evolution in Multiagent Reinforcement Learning","display_name":"PRIME: Policy Representation Integration With Metavalue-Modulated Evolution in Multiagent Reinforcement Learning","publication_year":2026,"publication_date":"2026-03-16","ids":{"openalex":"https://openalex.org/W7136973482","doi":"https://doi.org/10.1109/jiot.2026.3674392"},"language":null,"primary_location":{"id":"doi:10.1109/jiot.2026.3674392","is_oa":false,"landing_page_url":"https://doi.org/10.1109/jiot.2026.3674392","pdf_url":null,"source":{"id":"https://openalex.org/S2480266640","display_name":"IEEE Internet of Things Journal","issn_l":"2327-4662","issn":["2327-4662","2372-2541"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Internet of Things Journal","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5082343126","display_name":"Licheng Sun","orcid":"https://orcid.org/0009-0006-9309-5628"},"institutions":[{"id":"https://openalex.org/I125839683","display_name":"Beijing Institute of Technology","ror":"https://ror.org/01skt4w74","country_code":"CN","type":"education","lineage":["https://openalex.org/I125839683","https://openalex.org/I890469752"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Licheng Sun","raw_affiliation_strings":["School of Automation, Beijing Institute of Technology, Beijing, China"],"raw_orcid":"https://orcid.org/0009-0006-9309-5628","affiliations":[{"raw_affiliation_string":"School of Automation, Beijing Institute of Technology, Beijing, China","institution_ids":["https://openalex.org/I125839683"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5129585261","display_name":"Hongbin Ma","orcid":null},"institutions":[{"id":"https://openalex.org/I125839683","display_name":"Beijing Institute of Technology","ror":"https://ror.org/01skt4w74","country_code":"CN","type":"education","lineage":["https://openalex.org/I125839683","https://openalex.org/I890469752"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Hongbin Ma","raw_affiliation_strings":["School of Automation, Beijing Institute of Technology, Beijing, China"],"raw_orcid":"https://orcid.org/0000-0002-5734-3157","affiliations":[{"raw_affiliation_string":"School of Automation, Beijing Institute of Technology, Beijing, China","institution_ids":["https://openalex.org/I125839683"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I125839683"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.26908155,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"13","issue":"11","first_page":"24893","last_page":"24911"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9089999794960022,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9089999794960022,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10848","display_name":"Advanced Multi-Objective Optimization Algorithms","score":0.013100000098347664,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11413","display_name":"Risk and Portfolio Optimization","score":0.010900000110268593,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6791999936103821},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.5066999793052673},{"id":"https://openalex.org/keywords/knowledge-representation-and-reasoning","display_name":"Knowledge representation and reasoning","score":0.3228999972343445},{"id":"https://openalex.org/keywords/feature-learning","display_name":"Feature learning","score":0.2847999930381775},{"id":"https://openalex.org/keywords/variety","display_name":"Variety (cybernetics)","score":0.2621999979019165}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7745000123977661},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6791999936103821},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5673999786376953},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.5066999793052673},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.36800000071525574},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.33570000529289246},{"id":"https://openalex.org/C161301231","wikidata":"https://www.wikidata.org/wiki/Q3478658","display_name":"Knowledge representation and reasoning","level":2,"score":0.3228999972343445},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.2847999930381775},{"id":"https://openalex.org/C136197465","wikidata":"https://www.wikidata.org/wiki/Q1729295","display_name":"Variety (cybernetics)","level":2,"score":0.2621999979019165},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.2603999972343445},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2556000053882599}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/jiot.2026.3674392","is_oa":false,"landing_page_url":"https://doi.org/10.1109/jiot.2026.3674392","pdf_url":null,"source":{"id":"https://openalex.org/S2480266640","display_name":"IEEE Internet of Things Journal","issn_l":"2327-4662","issn":["2327-4662","2372-2541"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Internet of Things Journal","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/10","display_name":"Reduced inequalities","score":0.47365227341651917}],"awards":[{"id":"https://openalex.org/G2826489423","display_name":null,"funder_award_id":"62473052","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G3396717552","display_name":null,"funder_award_id":"No. 202506030077","funder_id":"https://openalex.org/F4320322725","funder_display_name":"China Scholarship Council"},{"id":"https://openalex.org/G6059269510","display_name":null,"funder_award_id":"No. 62473052","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G6439302122","display_name":null,"funder_award_id":"202506030077","funder_id":"https://openalex.org/F4320321001","funder_display_name":"National Natural Science Foundation of China"},{"id":"https://openalex.org/G8529781223","display_name":null,"funder_award_id":"241-HF-D09-01","funder_id":"https://openalex.org/F4320328373","funder_display_name":"National Key Laboratory Foundation of China"}],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"},{"id":"https://openalex.org/F4320322725","display_name":"China Scholarship Council","ror":"https://ror.org/04atp4p48"},{"id":"https://openalex.org/F4320328373","display_name":"National Key Laboratory Foundation of China","ror":null}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Multi-agent":[0],"reinforcement":[1],"learning":[2,109],"(MARL)":[3],"remains":[4],"fundamentally":[5],"challenged":[6],"by":[7],"partial":[8],"observability,":[9],"unstable":[10],"value":[11],"learning,":[12],"and":[13,22,63,90,110,118,138,152],"inefficient":[14],"exploration\u2014difficulties":[15],"that":[16,53,84,144],"intensify":[17],"in":[18,49,128],"high-dimensional":[19],"robotic":[20,88],"control":[21],"large-scale":[23,140],"coordination":[24],"scenarios.":[25],"Meanwhile,":[26],"the":[27,35,98,139],"existing":[28],"algorithms":[29],"lack":[30],"a":[31,69,79],"mechanism":[32],"to":[33],"guide":[34],"improvement":[36],"of":[37,101],"long-term":[38],"strategies.":[39],"We":[40],"propose":[41],"PRIME,":[42],"Policy":[43],"Representation":[44],"Integration":[45],"with":[46,73],"Meta-Value\u2013Modulated":[47],"Evolution":[48],"Multi-Agent":[50,133],"Reinforcement":[51],"Learning":[52],"addresses":[54],"these":[55],"limitations":[56],"through":[57],"representation-asymmetric":[58],"policy":[59,82,102,129],"parameterization,":[60],"meta-value\u2013augmented":[61],"optimization,":[62],"meta-value\u2013modulated":[64],"evolutionary":[65,115],"search.":[66],"PRIME":[67,145],"constructs":[68],"shared":[70],"nonlinear":[71],"encoder":[72],"lightweight":[74],"team-specific":[75],"linear":[76],"heads,":[77],"providing":[78],"coherent":[80],"latent":[81],"manifold":[83],"supports":[85],"both":[86,107],"fine-grained":[87],"manipulation":[89],"large-population":[91],"coordination.":[92],"A":[93],"learned":[94],"meta-value":[95],"function":[96],"estimates":[97],"long-horizon":[99],"utility":[100],"updates,":[103],"whose":[104],"gradients":[105],"shape":[106],"actor":[108],"representation":[111],"formation.":[112],"In":[113],"parallel,":[114],"operators\u2014direction-aware":[116],"crossover":[117],"meta-gradient\u2013scaled":[119],"low-rank":[120],"mutation\u2014enable":[121],"globally":[122],"diverse":[123],"yet":[124],"strategically":[125],"targeted":[126],"exploration":[127],"space.":[130],"Evaluations":[131],"on":[132],"MuJoCo,":[134],"DexHands":[135],"dexterous":[136],"manipulation,":[137],"DCA":[141],"benchmark":[142],"demonstrate":[143],"achieves":[146],"consistently":[147],"superior":[148],"performance,":[149],"faster":[150],"convergence,":[151],"stronger":[153],"robustness":[154],"than":[155],"state-of-the-art":[156],"base-lines.":[157]},"counts_by_year":[],"updated_date":"2026-05-23T06:10:36.450269","created_date":"2026-03-17T00:00:00"}
