{"id":"https://openalex.org/W3199799665","doi":"https://doi.org/10.1109/tnnls.2021.3110281","title":"Deep Reinforcement Learning With Modulated Hebbian Plus Q-Network Architecture","display_name":"Deep Reinforcement Learning With Modulated Hebbian Plus Q-Network Architecture","publication_year":2021,"publication_date":"2021-09-24","ids":{"openalex":"https://openalex.org/W3199799665","doi":"https://doi.org/10.1109/tnnls.2021.3110281","mag":"3199799665","pmid":"https://pubmed.ncbi.nlm.nih.gov/34559664"},"language":"en","primary_location":{"id":"doi:10.1109/tnnls.2021.3110281","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tnnls.2021.3110281","pdf_url":null,"source":{"id":"https://openalex.org/S4210175523","display_name":"IEEE Transactions on Neural Networks and Learning Systems","issn_l":"2162-237X","issn":["2162-237X","2162-2388"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Neural Networks and Learning Systems","raw_type":"journal-article"},"type":"article","indexed_in":["crossref","pubmed"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://figshare.com/articles/journal_contribution/Deep_reinforcement_learning_with_modulated_Hebbian_plus_Q-network_architecture/16810543","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Pawel Ladosz","orcid":"https://orcid.org/0000-0002-1154-8333"},"institutions":[{"id":"https://openalex.org/I143804889","display_name":"Loughborough University","ror":"https://ror.org/04vg4w365","country_code":"GB","type":"education","lineage":["https://openalex.org/I143804889"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Pawel Ladosz","raw_affiliation_strings":["Department of Computer Science, Loughborough University, Loughborough, U.K"],"raw_orcid":"https://orcid.org/0000-0002-1154-8333","affiliations":[{"raw_affiliation_string":"Department of Computer Science, Loughborough University, Loughborough, U.K","institution_ids":["https://openalex.org/I143804889"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Eseoghene Ben-Iwhiwhu","orcid":"https://orcid.org/0000-0002-1176-866X"},"institutions":[{"id":"https://openalex.org/I143804889","display_name":"Loughborough University","ror":"https://ror.org/04vg4w365","country_code":"GB","type":"education","lineage":["https://openalex.org/I143804889"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Eseoghene Ben-Iwhiwhu","raw_affiliation_strings":["Department of Computer Science, Loughborough University, Loughborough, U.K"],"raw_orcid":"https://orcid.org/0000-0002-1176-866X","affiliations":[{"raw_affiliation_string":"Department of Computer Science, Loughborough University, Loughborough, U.K","institution_ids":["https://openalex.org/I143804889"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Jeffery Dick","orcid":null},"institutions":[{"id":"https://openalex.org/I143804889","display_name":"Loughborough University","ror":"https://ror.org/04vg4w365","country_code":"GB","type":"education","lineage":["https://openalex.org/I143804889"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Jeffery Dick","raw_affiliation_strings":["Department of Computer Science, Loughborough University, Loughborough, U.K"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Computer Science, Loughborough University, Loughborough, U.K","institution_ids":["https://openalex.org/I143804889"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Nicholas Ketz","orcid":null},"institutions":[{"id":"https://openalex.org/I200576644","display_name":"HRL Laboratories (United States)","ror":"https://ror.org/05p7te762","country_code":"US","type":"company","lineage":["https://openalex.org/I200576644"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Nicholas Ketz","raw_affiliation_strings":["Information and Systems Sciences Laboratory, HRL Laboratories, Malibu, CA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Information and Systems Sciences Laboratory, HRL Laboratories, Malibu, CA, USA","institution_ids":["https://openalex.org/I200576644"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Soheil Kolouri","orcid":null},"institutions":[{"id":"https://openalex.org/I200576644","display_name":"HRL Laboratories (United States)","ror":"https://ror.org/05p7te762","country_code":"US","type":"company","lineage":["https://openalex.org/I200576644"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Soheil Kolouri","raw_affiliation_strings":["Information and Systems Sciences Laboratory, HRL Laboratories, Malibu, CA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Information and Systems Sciences Laboratory, HRL Laboratories, Malibu, CA, USA","institution_ids":["https://openalex.org/I200576644"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Jeffrey L. Krichmar","orcid":"https://orcid.org/0000-0003-0739-2468"},"institutions":[{"id":"https://openalex.org/I204250578","display_name":"University of California, Irvine","ror":"https://ror.org/04gyf1771","country_code":"US","type":"education","lineage":["https://openalex.org/I204250578"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Jeffrey L. Krichmar","raw_affiliation_strings":["Department of Cognitive Sciences and the Department of Computer Science, University of California at Irvine, Irvine, CA, USA"],"raw_orcid":"https://orcid.org/0000-0003-0739-2468","affiliations":[{"raw_affiliation_string":"Department of Cognitive Sciences and the Department of Computer Science, University of California at Irvine, Irvine, CA, USA","institution_ids":["https://openalex.org/I204250578"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Praveen K. Pilly","orcid":"https://orcid.org/0000-0001-9762-2882"},"institutions":[{"id":"https://openalex.org/I200576644","display_name":"HRL Laboratories (United States)","ror":"https://ror.org/05p7te762","country_code":"US","type":"company","lineage":["https://openalex.org/I200576644"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Praveen K. Pilly","raw_affiliation_strings":["Information and Systems Sciences Laboratory, HRL Laboratories, Malibu, CA, USA"],"raw_orcid":"https://orcid.org/0000-0001-9762-2882","affiliations":[{"raw_affiliation_string":"Information and Systems Sciences Laboratory, HRL Laboratories, Malibu, CA, USA","institution_ids":["https://openalex.org/I200576644"]}]},{"author_position":"last","author":{"id":null,"display_name":"Andrea Soltoggio","orcid":"https://orcid.org/0000-0002-9750-8358"},"institutions":[{"id":"https://openalex.org/I143804889","display_name":"Loughborough University","ror":"https://ror.org/04vg4w365","country_code":"GB","type":"education","lineage":["https://openalex.org/I143804889"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Andrea Soltoggio","raw_affiliation_strings":["Department of Computer Science, Loughborough University, Loughborough, U.K"],"raw_orcid":"https://orcid.org/0000-0002-9750-8358","affiliations":[{"raw_affiliation_string":"Department of Computer Science, Loughborough University, Loughborough, U.K","institution_ids":["https://openalex.org/I143804889"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":1.7743,"has_fulltext":false,"cited_by_count":20,"citation_normalized_percentile":{"value":0.87442761,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":94,"max":99},"biblio":{"volume":"33","issue":"5","first_page":"2045","last_page":"2056"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9330999851226807,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9330999851226807,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.006599999964237213,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.0034000000450760126,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/hebbian-theory","display_name":"Hebbian theory","score":0.8091999888420105},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7121999859809875},{"id":"https://openalex.org/keywords/leabra","display_name":"Leabra","score":0.6561999917030334},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.5325000286102295},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.46560001373291016},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.3889000117778778},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.3774999976158142},{"id":"https://openalex.org/keywords/synaptic-weight","display_name":"Synaptic weight","score":0.36890000104904175}],"concepts":[{"id":"https://openalex.org/C111437709","wikidata":"https://www.wikidata.org/wiki/Q1277874","display_name":"Hebbian theory","level":3,"score":0.8091999888420105},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7792999744415283},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7121999859809875},{"id":"https://openalex.org/C97108695","wikidata":"https://www.wikidata.org/wiki/Q6508265","display_name":"Leabra","level":5,"score":0.6561999917030334},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6403999924659729},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.5325000286102295},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.46560001373291016},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.46540001034736633},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.3889000117778778},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.3774999976158142},{"id":"https://openalex.org/C66949984","wikidata":"https://www.wikidata.org/wiki/Q7662043","display_name":"Synaptic weight","level":3,"score":0.36890000104904175},{"id":"https://openalex.org/C53442348","wikidata":"https://www.wikidata.org/wiki/Q745101","display_name":"Content-addressable memory","level":3,"score":0.3653999865055084},{"id":"https://openalex.org/C8521452","wikidata":"https://www.wikidata.org/wiki/Q203790","display_name":"Connectionism","level":3,"score":0.33970001339912415},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3361999988555908},{"id":"https://openalex.org/C120822770","wikidata":"https://www.wikidata.org/wiki/Q5156355","display_name":"Competitive learning","level":3,"score":0.33390000462532043},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.3003000020980835},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.2937000095844269},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.2888999879360199},{"id":"https://openalex.org/C159423971","wikidata":"https://www.wikidata.org/wiki/Q177251","display_name":"Associative property","level":2,"score":0.2838999927043915},{"id":"https://openalex.org/C118070581","wikidata":"https://www.wikidata.org/wiki/Q2060528","display_name":"Neuroevolution","level":3,"score":0.2705000042915344},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.2563999891281128},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.25609999895095825}],"mesh":[{"descriptor_ui":"D000465","descriptor_name":"Algorithms","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D000465","descriptor_name":"Algorithms","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D000465","descriptor_name":"Algorithms","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D008390","descriptor_name":"Markov Chains","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D008390","descriptor_name":"Markov Chains","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D008390","descriptor_name":"Markov Chains","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D012054","descriptor_name":"Reinforcement, Psychology","qualifier_ui":null,"qualifier_name":null,"is_major_topic":true},{"descriptor_ui":"D012054","descriptor_name":"Reinforcement, Psychology","qualifier_ui":null,"qualifier_name":null,"is_major_topic":true},{"descriptor_ui":"D012054","descriptor_name":"Reinforcement, Psychology","qualifier_ui":null,"qualifier_name":null,"is_major_topic":true},{"descriptor_ui":"D012201","descriptor_name":"Reward","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D012201","descriptor_name":"Reward","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D012201","descriptor_name":"Reward","qualifier_ui":null,"qualifier_name":null,"is_major_topic":false},{"descriptor_ui":"D016571","descriptor_name":"Neural Networks, Computer","qualifier_ui":null,"qualifier_name":null,"is_major_topic":true},{"descriptor_ui":"D016571","descriptor_name":"Neural Networks, Computer","qualifier_ui":null,"qualifier_name":null,"is_major_topic":true},{"descriptor_ui":"D016571","descriptor_name":"Neural Networks, Computer","qualifier_ui":null,"qualifier_name":null,"is_major_topic":true}],"locations_count":5,"locations":[{"id":"doi:10.1109/tnnls.2021.3110281","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tnnls.2021.3110281","pdf_url":null,"source":{"id":"https://openalex.org/S4210175523","display_name":"IEEE Transactions on Neural Networks and Learning Systems","issn_l":"2162-237X","issn":["2162-237X","2162-2388"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Neural Networks and Learning Systems","raw_type":"journal-article"},{"id":"pmid:34559664","is_oa":false,"landing_page_url":"https://pubmed.ncbi.nlm.nih.gov/34559664","pdf_url":null,"source":{"id":"https://openalex.org/S4306525036","display_name":"PubMed","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I1299303238","host_organization_name":"National Institutes of Health","host_organization_lineage":["https://openalex.org/I1299303238"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE transactions on neural networks and learning systems","raw_type":null},{"id":"pmh:oai:pure.atira.dk:openaire_cris_publications/2a98dc02-212a-4478-8e83-bc0792f6c7de","is_oa":false,"landing_page_url":"https://research.manchester.ac.uk/en/publications/2a98dc02-212a-4478-8e83-bc0792f6c7de","pdf_url":null,"source":{"id":"https://openalex.org/S4306400662","display_name":"Research Explorer (The University of Manchester)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I28407311","host_organization_name":"University of Manchester","host_organization_lineage":["https://openalex.org/I28407311"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Ladosz, P, Ben-Iwhiwhu, E, Dick, J, Ketz, N, Kolouri, S, Krichmar, J L, Pilly, P K & Soltoggio, A 2022, 'Deep Reinforcement Learning With Modulated Hebbian Plus Q-Network Architecture', IEEE Transactions on NEural Networks and Learning Systems. https://doi.org/10.1109/TNNLS.2021.3110281","raw_type":"info:eu-repo/semantics/article"},{"id":"pmh:oai:figshare.com:article/16810543","is_oa":true,"landing_page_url":null,"pdf_url":"https://figshare.com/articles/journal_contribution/Deep_reinforcement_learning_with_modulated_Hebbian_plus_Q-network_architecture/16810543","source":{"id":"https://openalex.org/S4377196282","display_name":"Figshare","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I4210132348","host_organization_name":"Figshare (United Kingdom)","host_organization_lineage":["https://openalex.org/I4210132348"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":"Text"},{"id":"pmh:oai:scholarworks.unist.ac.kr:201301/62206","is_oa":false,"landing_page_url":"https://scholarworks.unist.ac.kr/handle/201301/62206","pdf_url":null,"source":{"id":"https://openalex.org/S4306401118","display_name":"Scholarworks@UNIST (Ulsan National Institute of Science and Technology)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I48566637","host_organization_name":"Ulsan National Institute of Science and Technology","host_organization_lineage":["https://openalex.org/I48566637"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":"ARTICLE"}],"best_oa_location":{"id":"pmh:oai:figshare.com:article/16810543","is_oa":true,"landing_page_url":null,"pdf_url":"https://figshare.com/articles/journal_contribution/Deep_reinforcement_learning_with_modulated_Hebbian_plus_Q-network_architecture/16810543","source":{"id":"https://openalex.org/S4377196282","display_name":"Figshare","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I4210132348","host_organization_name":"Figshare (United Kingdom)","host_organization_lineage":["https://openalex.org/I4210132348"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"","raw_type":"Text"},"sustainable_development_goals":[],"awards":[{"id":"https://openalex.org/G5693559168","display_name":null,"funder_award_id":"2020R1A6A1A03040570","funder_id":"https://openalex.org/F4320311687","funder_display_name":"Ministry of Education"},{"id":"https://openalex.org/G5969032176","display_name":null,"funder_award_id":"FA8750-18-C-0103","funder_id":"https://openalex.org/F4320332180","funder_display_name":"Defense Advanced Research Projects Agency"}],"funders":[{"id":"https://openalex.org/F4320311687","display_name":"Ministry of Education","ror":"https://ror.org/03m01yf64"},{"id":"https://openalex.org/F4320322120","display_name":"National Research Foundation of Korea","ror":"https://ror.org/013aysd81"},{"id":"https://openalex.org/F4320332180","display_name":"Defense Advanced Research Projects Agency","ror":"https://ror.org/02caytj08"}],"has_content":{"grobid_xml":false,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W3199799665.pdf"},"referenced_works_count":31,"referenced_works":["https://openalex.org/W1662842982","https://openalex.org/W1986780765","https://openalex.org/W1992678399","https://openalex.org/W2027896245","https://openalex.org/W2103581399","https://openalex.org/W2123820663","https://openalex.org/W2137327884","https://openalex.org/W2145339207","https://openalex.org/W2154607505","https://openalex.org/W2802349643","https://openalex.org/W2963053311","https://openalex.org/W2963454359","https://openalex.org/W4214717370","https://openalex.org/W4242770316","https://openalex.org/W6634945376","https://openalex.org/W6637967152","https://openalex.org/W6677939520","https://openalex.org/W6680657880","https://openalex.org/W6692846177","https://openalex.org/W6696783566","https://openalex.org/W6715102896","https://openalex.org/W6717018068","https://openalex.org/W6731334075","https://openalex.org/W6735003056","https://openalex.org/W6737069938","https://openalex.org/W6743671064","https://openalex.org/W6749733343","https://openalex.org/W6750433857","https://openalex.org/W6751659697","https://openalex.org/W6757457622","https://openalex.org/W6771563076"],"related_works":[],"abstract_inverted_index":{"In":[0,20,108],"this":[1],"article,":[2],"we":[3,16,66],"consider":[4],"a":[5,49,56,80,143,148,159],"subclass":[6],"of":[7,23,46,155,161],"partially":[8],"observable":[9],"Markov":[10],"decision":[11],"process":[12],"(POMDP)":[13],"problems":[14,47],"which":[15,65],"termed":[17],"confounding":[18,98,213],"POMDPs.":[19],"these":[21,44],"types":[22,45],"POMDPs,":[24],"temporal":[25,91],"difference":[26],"(TD)-based":[27],"reinforcement":[28,204],"learning":[29,141,205],"(RL)":[30],"algorithms":[31,207],"struggle,":[32],"as":[33],"TD":[34,106],"error":[35],"cannot":[36],"be":[37],"easily":[38],"derived":[39],"from":[40],"observations.":[41],"We":[42],"solve":[43],"using":[48],"new":[50],"bio-inspired":[51,86],"neural":[52,87],"architecture":[53,72,134],"that":[54,169],"combines":[55,135],"modulated":[57,68],"Hebbian":[58,69,81,144],"network":[59,82,146],"(MOHN)":[60],"with":[61,83,126,138,181,188,212],"deep":[62],"Q-network":[63,71],"(DQN),":[64],"call":[67],"plus":[70],"(MOHQA).":[73],"The":[74],"key":[75],"idea":[76],"is":[77],"to":[78,89,120],"use":[79],"rarely":[84],"correlated":[85],"traces":[88],"bridge":[90],"delays":[92],"between":[93],"actions":[94],"and":[95,100,114,129,147,163,176,200,215],"rewards":[96,102,125],"when":[97],"observations":[99],"sparse":[101,216],"result":[103],"in":[104],"inaccurate":[105],"errors.":[107],"MOHQA,":[109],"DQN":[110,150,187],"learns":[111],"low-level":[112],"features":[113],"control,":[115],"while":[116],"the":[117,132,153,165,170],"MOHN":[118],"contributes":[119],"high-level":[121],"decisions":[122],"by":[123],"associating":[124],"past":[127],"states":[128],"actions.":[130],"Thus,":[131],"proposed":[133,171],"two":[136],"modules":[137],"significantly":[139],"different":[140],"algorithms,":[142],"associative":[145],"classical":[149],"pipeline,":[151],"exploiting":[152],"advantages":[154],"both.":[156],"Simulations":[157],"on":[158,164,208],"set":[160],"POMDPs":[162,211],"Malmo":[166],"environment":[167],"show":[168],"algorithm":[172],"improved":[173],"DQN's":[174],"results":[175],"even":[177],"outperformed":[178],"control":[179],"tests":[180],"advantage-actor":[182],"critic":[183],"(A2C),":[184],"quantile":[185],"regression":[186],"long":[189],"short-term":[190],"memory":[191,202],"(QRDQN":[192],"+":[193],"LSTM),":[194],"Monte":[195],"Carlo":[196],"policy":[197],"gradient":[198],"(REINFORCE),":[199],"aggregated":[201],"for":[203],"(AMRL)":[206],"most":[209],"difficult":[210],"stimuli":[214],"rewards.":[217]},"counts_by_year":[{"year":2026,"cited_by_count":1},{"year":2025,"cited_by_count":6},{"year":2024,"cited_by_count":6},{"year":2023,"cited_by_count":5},{"year":2022,"cited_by_count":2}],"updated_date":"2026-03-27T05:58:40.876381","created_date":"2021-09-27T00:00:00"}
