{"id":"https://openalex.org/W2138021445","doi":"https://doi.org/10.1109/iros.2007.4399294","title":"Rapid behavior learning in multi-agent environment based on state value estimation of others","display_name":"Rapid behavior learning in multi-agent environment based on state value estimation of others","publication_year":2007,"publication_date":"2007-10-01","ids":{"openalex":"https://openalex.org/W2138021445","doi":"https://doi.org/10.1109/iros.2007.4399294","mag":"2138021445"},"language":"en","primary_location":{"id":"doi:10.1109/iros.2007.4399294","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros.2007.4399294","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2007 IEEE/RSJ International Conference on Intelligent Robots and Systems","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5089803467","display_name":"Yasutake Takahashi","orcid":"https://orcid.org/0000-0001-7301-9907"},"institutions":[{"id":"https://openalex.org/I98285908","display_name":"The University of Osaka","ror":"https://ror.org/035t8zc32","country_code":"JP","type":"education","lineage":["https://openalex.org/I98285908"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Yasutake Takahashi","raw_affiliation_strings":["Department of Adaptive Machine Systems, Graduate School of Engineering, Osaka University, Suita, Osaka, Japan","Osaka University, Suita"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Adaptive Machine Systems, Graduate School of Engineering, Osaka University, Suita, Osaka, Japan","institution_ids":["https://openalex.org/I98285908"]},{"raw_affiliation_string":"Osaka University, Suita","institution_ids":["https://openalex.org/I98285908"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5027347020","display_name":"Kentaro Noma","orcid":null},"institutions":[{"id":"https://openalex.org/I98285908","display_name":"The University of Osaka","ror":"https://ror.org/035t8zc32","country_code":"JP","type":"education","lineage":["https://openalex.org/I98285908"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Kentaro Noma","raw_affiliation_strings":["Department of Adaptive Machine Systems, Graduate School of Engineering, Osaka University, Suita, Osaka, Japan","Osaka University, Suita"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Adaptive Machine Systems, Graduate School of Engineering, Osaka University, Suita, Osaka, Japan","institution_ids":["https://openalex.org/I98285908"]},{"raw_affiliation_string":"Osaka University, Suita","institution_ids":["https://openalex.org/I98285908"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5044985800","display_name":"Minoru Asada","orcid":"https://orcid.org/0000-0001-9506-6333"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Minoru Asada","raw_affiliation_strings":["JST ERATO Asada Synergistic Intelligence Project, Suita, Osaka, Japan","JST ERATO Asada Synergistic Intelligence Project Yamadaoka 2-1, Suita, Osaka, 565-0871, Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"JST ERATO Asada Synergistic Intelligence Project, Suita, Osaka, Japan","institution_ids":[]},{"raw_affiliation_string":"JST ERATO Asada Synergistic Intelligence Project Yamadaoka 2-1, Suita, Osaka, 565-0871, Japan","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":"13","issue":null,"first_page":"76","last_page":"81"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9991000294685364,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9991000294685364,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11512","display_name":"Anomaly Detection Techniques and Applications","score":0.9799000024795532,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12761","display_name":"Data Stream Mining Techniques","score":0.9761999845504761,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7994896769523621},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.6808116436004639},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6110266447067261},{"id":"https://openalex.org/keywords/modular-design","display_name":"Modular design","score":0.5824856758117676},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.557060182094574},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.5387941002845764},{"id":"https://openalex.org/keywords/teamwork","display_name":"Teamwork","score":0.5250920057296753},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.46301648020744324},{"id":"https://openalex.org/keywords/dimension","display_name":"Dimension (graph theory)","score":0.4350455701351166},{"id":"https://openalex.org/keywords/multi-agent-system","display_name":"Multi-agent system","score":0.43460214138031006},{"id":"https://openalex.org/keywords/human\u2013computer-interaction","display_name":"Human\u2013computer interaction","score":0.3231402039527893},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.3214787244796753},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.11378002166748047}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7994896769523621},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6808116436004639},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6110266447067261},{"id":"https://openalex.org/C101468663","wikidata":"https://www.wikidata.org/wiki/Q1620158","display_name":"Modular design","level":2,"score":0.5824856758117676},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.557060182094574},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.5387941002845764},{"id":"https://openalex.org/C111226992","wikidata":"https://www.wikidata.org/wiki/Q626225","display_name":"Teamwork","level":2,"score":0.5250920057296753},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.46301648020744324},{"id":"https://openalex.org/C33676613","wikidata":"https://www.wikidata.org/wiki/Q13415176","display_name":"Dimension (graph theory)","level":2,"score":0.4350455701351166},{"id":"https://openalex.org/C41550386","wikidata":"https://www.wikidata.org/wiki/Q529909","display_name":"Multi-agent system","level":2,"score":0.43460214138031006},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.3231402039527893},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3214787244796753},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.11378002166748047},{"id":"https://openalex.org/C17744445","wikidata":"https://www.wikidata.org/wiki/Q36442","display_name":"Political science","level":0,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C202444582","wikidata":"https://www.wikidata.org/wiki/Q837863","display_name":"Pure mathematics","level":1,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.0},{"id":"https://openalex.org/C199539241","wikidata":"https://www.wikidata.org/wiki/Q7748","display_name":"Law","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/iros.2007.4399294","is_oa":false,"landing_page_url":"https://doi.org/10.1109/iros.2007.4399294","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2007 IEEE/RSJ International Conference on Intelligent Robots and Systems","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.7400000095367432}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":11,"referenced_works":["https://openalex.org/W2131829828","https://openalex.org/W2141754131","https://openalex.org/W2150149497","https://openalex.org/W2150884987","https://openalex.org/W2155791599","https://openalex.org/W2160913278","https://openalex.org/W2168342951","https://openalex.org/W3092207185","https://openalex.org/W6680829273","https://openalex.org/W6683164292","https://openalex.org/W6684463560"],"related_works":["https://openalex.org/W2346864368","https://openalex.org/W2161212821","https://openalex.org/W4225571923","https://openalex.org/W3212257828","https://openalex.org/W2999580272","https://openalex.org/W4297873223","https://openalex.org/W3009457412","https://openalex.org/W2350784623","https://openalex.org/W2126211886","https://openalex.org/W1822289477"],"abstract_inverted_index":{"The":[0,77,108,176],"existing":[1],"reinforcement":[2],"learning":[3,53,61,94,192,205],"approaches":[4],"have":[5],"been":[6],"suffering":[7],"from":[8,120],"the":[9,24,60,82,100,103,112,117,121,125,132,135,140,143,166,173,191,196,211],"curse":[10],"of":[11,23,30,51,102,111,116,134,142],"dimension":[12],"problem":[13],"when":[14],"they":[15],"are":[16,84,128],"applied":[17,179],"to":[18,80,98,130,145,151,171,180],"multiagent":[19,56],"dynamic":[20],"environments.":[21],"One":[22],"typical":[25],"examples":[26],"is":[27,96,149,155,178],"a":[28,49,55,88,162],"case":[29],"RoboCup":[31],"competitions":[32],"since":[33],"other":[34,144],"agents":[35],"and":[36,42,71,105,124,159,190,200],"their":[37],"behaviors":[38,66],"easily":[39],"cause":[40],"state":[41,109,118,141,163,169],"action":[43,106,137],"space":[44,110,170],"explosion.":[45],"This":[46],"paper":[47],"presents":[48],"method":[50,177],"modular":[52],"in":[54,165],"environment":[57],"by":[58,157],"which":[59],"agent":[62,193],"can":[63],"acquire":[64],"cooperative":[65],"with":[67,92],"its":[68,75,152],"team":[69],"mates":[70],"competitive":[72],"ones":[73],"against":[74],"opponents.":[76],"key":[78],"ideas":[79],"resolve":[81],"issue":[83],"as":[85,161],"follows.":[86],"First,":[87],"two-layer":[89],"hierarchical":[90],"system":[91],"multi":[93],"modules":[95],"adopted":[97],"reduce":[99,131],"size":[101,133],"sensor":[104],"spaces.":[107],"top":[113,167],"layer":[114,168],"consists":[115],"values":[119],"lower":[122],"level,":[123],"macro":[126],"actions":[127],"used":[129,160],"physical":[136],"space.":[138],"Second,":[139],"what":[146],"extent":[147],"it":[148],"close":[150],"own":[153],"goal":[154],"estimated":[156],"observation":[158],"value":[164],"realize":[172],"cooperative/competitive":[174],"behaviors.":[175],"4":[181],"(defense":[182],"team)":[183,187],"on":[184],"5":[185],"(offense":[186],"game":[188],"task,":[189],"successfully":[194],"acquired":[195],"teamwork":[197],"plays":[198],"(pass":[199],"shoot)":[201],"within":[202],"much":[203],"shorter":[204],"time":[206],"(30":[207],"times":[208],"quicker":[209],"than":[210],"earlier":[212],"work).":[213]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
