{"id":"https://openalex.org/W2990366800","doi":"https://doi.org/10.3233/faia190143","title":"Individual Specialization in Multi-Task Environments with Multiagent Reinforcement Learners","display_name":"Individual Specialization in Multi-Task Environments with Multiagent Reinforcement Learners","publication_year":2019,"publication_date":"2019-01-01","ids":{"openalex":"https://openalex.org/W2990366800","doi":"https://doi.org/10.3233/faia190143","mag":"2990366800"},"language":"en","primary_location":{"id":"doi:10.3233/faia190143","is_oa":false,"landing_page_url":"https://doi.org/10.3233/faia190143","pdf_url":null,"source":{"id":"https://openalex.org/S4210201731","display_name":"Frontiers in artificial intelligence and applications","issn_l":"0922-6389","issn":["0922-6389","1879-8314"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Frontiers in Artificial Intelligence and Applications","raw_type":"book-chapter"},"type":"book-chapter","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5116338655","display_name":"Gasparrini Marco Jerome","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gasparrini Marco Jerome","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Sol\u00e9 Ricard","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sol\u00e9 Ricard","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"S\u00e1nchez-Fibla Mart\u00ed","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"S\u00e1nchez-Fibla Mart\u00ed","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.2252527,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8917999863624573,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8917999863624573,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11975","display_name":"Evolutionary Algorithms and Applications","score":0.8216000199317932,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11182","display_name":"Auction Theory and Applications","score":0.7634000182151794,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8237905502319336},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.671086311340332},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.6235577464103699},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.47591930627822876},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.4201938807964325},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4168490469455719},{"id":"https://openalex.org/keywords/distributed-computing","display_name":"Distributed computing","score":0.3222312033176422},{"id":"https://openalex.org/keywords/engineering","display_name":"Engineering","score":0.13481813669204712}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8237905502319336},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.671086311340332},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.6235577464103699},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.47591930627822876},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.4201938807964325},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4168490469455719},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.3222312033176422},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.13481813669204712},{"id":"https://openalex.org/C201995342","wikidata":"https://www.wikidata.org/wiki/Q682496","display_name":"Systems engineering","level":1,"score":0.0},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C50522688","wikidata":"https://www.wikidata.org/wiki/Q189833","display_name":"Economic growth","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.3233/faia190143","is_oa":false,"landing_page_url":"https://doi.org/10.3233/faia190143","pdf_url":null,"source":{"id":"https://openalex.org/S4210201731","display_name":"Frontiers in artificial intelligence and applications","issn_l":"0922-6389","issn":["0922-6389","1879-8314"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Frontiers in Artificial Intelligence and Applications","raw_type":"book-chapter"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Decent work and economic growth","id":"https://metadata.un.org/sdg/8","score":0.47999998927116394}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":["https://openalex.org/W4306904969","https://openalex.org/W2138720691","https://openalex.org/W4362501864","https://openalex.org/W4380318855","https://openalex.org/W3084456289","https://openalex.org/W2024136090","https://openalex.org/W4391331176","https://openalex.org/W2031695474","https://openalex.org/W2586732548","https://openalex.org/W2964765435"],"abstract_inverted_index":{"There":[0],"is":[1,89,99,159],"a":[2,116,146],"growing":[3],"interest":[4],"in":[5,27,31,55,74],"Multi-Agent":[6],"Reinforcement":[7],"Learning":[8],"(MARL)":[9],"as":[10],"the":[11,32,87,107,112,120,131],"first":[12],"steps":[13],"towards":[14,41],"building":[15],"general":[16],"intelligent":[17],"agents":[18,67,121,166],"that":[19,90,110,153,160],"learn":[20],"to":[21,71,126,155,169],"make":[22],"low":[23],"and":[24,47,65,123,148],"high-level":[25],"decisions":[26],"non-stationary":[28],"complex":[29],"environments":[30,57],"presence":[33],"of":[34,94,114,165],"other":[35],"agents.":[36],"Previous":[37],"results":[38],"point":[39],"us":[40],"increased":[42,163],"conditions":[43,80],"for":[44,102],"coordination,":[45],"efficiency/fairness,":[46],"common-pool":[48],"resource":[49],"sharing.":[50],"We":[51],"further":[52,157],"study":[53,88],"coordination":[54],"multi-task":[56],"where":[58],"several":[59],"rewarding":[60],"tasks":[61],"can":[62],"be":[63,156,170],"performed":[64],"thus":[66],"don't":[68],"necessarily":[69],"need":[70],"perform":[72],"well":[73],"all":[75],"tasks,":[76],"but":[77],"under":[78],"certain":[79],"may":[81],"specialize.":[82],"An":[83],"observation":[84],"derived":[85],"from":[86],"epsilon":[91,108],"greedy":[92],"exploration":[93,142],"value-based":[95],"reinforcement":[96],"learning":[97],"methods":[98,137],"not":[100],"adequate":[101],"multi-agent":[103],"independent":[104,139],"learners":[105],"because":[106],"parameter":[109],"controls":[111],"probability":[113],"selecting":[115],"random":[117],"action":[118],"synchronizes":[119],"artificially":[122],"forces":[124],"them":[125],"have":[127],"deterministic":[128],"policies":[129],"at":[130],"same":[132],"time.":[133],"By":[134],"using":[135],"policy-based":[136],"with":[138,161],"entropy":[140],"regularised":[141],"updates,":[143],"we":[144],"achieved":[145],"better":[147],"smoother":[149],"convergence.":[150],"Another":[151],"result":[152],"needs":[154],"investigated":[158],"an":[162],"number":[164],"specialization":[167],"tends":[168],"more":[171],"probable.":[172]},"counts_by_year":[],"updated_date":"2025-12-28T23:10:05.387466","created_date":"2025-10-10T00:00:00"}
