{"id":"https://openalex.org/W4402352133","doi":"https://doi.org/10.1109/ijcnn60899.2024.10650872","title":"Reward-Punishment Reinforcement Learning with Maximum Entropy","display_name":"Reward-Punishment Reinforcement Learning with Maximum Entropy","publication_year":2024,"publication_date":"2024-06-30","ids":{"openalex":"https://openalex.org/W4402352133","doi":"https://doi.org/10.1109/ijcnn60899.2024.10650872"},"language":"en","primary_location":{"id":"doi:10.1109/ijcnn60899.2024.10650872","is_oa":false,"landing_page_url":"http://dx.doi.org/10.1109/ijcnn60899.2024.10650872","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5100668056","display_name":"Jiexin Wang","orcid":"https://orcid.org/0009-0004-8034-9428"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiexin Wang","raw_affiliation_strings":["ATR Computational Neuroscience Laboratories,Dept. Brain Robot Interface,Kyoto,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"ATR Computational Neuroscience Laboratories,Dept. Brain Robot Interface,Kyoto,Japan","institution_ids":[]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5031054137","display_name":"Eiji Uchibe","orcid":"https://orcid.org/0000-0001-7908-0258"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Eiji Uchibe","raw_affiliation_strings":["ATR Computational Neuroscience Laboratories,Dept. Brain Robot Interface,Kyoto,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"ATR Computational Neuroscience Laboratories,Dept. Brain Robot Interface,Kyoto,Japan","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"7"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9970999956130981,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9970999956130981,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10042","display_name":"Neural and Behavioral Psychology Studies","score":0.968500018119812,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T11689","display_name":"Adversarial Robustness in Machine Learning","score":0.9217000007629395,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8346459269523621},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.6294894814491272},{"id":"https://openalex.org/keywords/punishment","display_name":"Punishment (psychology)","score":0.5381015539169312},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.5166881084442139},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.46369871497154236},{"id":"https://openalex.org/keywords/principle-of-maximum-entropy","display_name":"Principle of maximum entropy","score":0.4500444829463959},{"id":"https://openalex.org/keywords/entropy","display_name":"Entropy (arrow of time)","score":0.4341292977333069},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.3310348391532898},{"id":"https://openalex.org/keywords/psychology","display_name":"Psychology","score":0.2769075930118561},{"id":"https://openalex.org/keywords/social-psychology","display_name":"Social psychology","score":0.17122149467468262},{"id":"https://openalex.org/keywords/physics","display_name":"Physics","score":0.07659441232681274}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8346459269523621},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.6294894814491272},{"id":"https://openalex.org/C2779295839","wikidata":"https://www.wikidata.org/wiki/Q3544090","display_name":"Punishment (psychology)","level":2,"score":0.5381015539169312},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5166881084442139},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.46369871497154236},{"id":"https://openalex.org/C9679016","wikidata":"https://www.wikidata.org/wiki/Q1417473","display_name":"Principle of maximum entropy","level":2,"score":0.4500444829463959},{"id":"https://openalex.org/C106301342","wikidata":"https://www.wikidata.org/wiki/Q4117933","display_name":"Entropy (arrow of time)","level":2,"score":0.4341292977333069},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3310348391532898},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.2769075930118561},{"id":"https://openalex.org/C77805123","wikidata":"https://www.wikidata.org/wiki/Q161272","display_name":"Social psychology","level":1,"score":0.17122149467468262},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.07659441232681274},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn60899.2024.10650872","is_oa":false,"landing_page_url":"http://dx.doi.org/10.1109/ijcnn60899.2024.10650872","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"score":0.4399999976158142,"id":"https://metadata.un.org/sdg/10","display_name":"Reduced inequalities"}],"awards":[],"funders":[{"id":"https://openalex.org/F4320321034","display_name":"New Energy and Industrial Technology Development Organization","ror":"https://ror.org/0055k7a87"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":26,"referenced_works":["https://openalex.org/W1480676279","https://openalex.org/W1828803485","https://openalex.org/W2012036715","https://openalex.org/W2015051472","https://openalex.org/W2043214237","https://openalex.org/W2083058253","https://openalex.org/W2107464055","https://openalex.org/W2168342951","https://openalex.org/W2338986187","https://openalex.org/W2624731731","https://openalex.org/W2795921402","https://openalex.org/W2799151646","https://openalex.org/W2950892788","https://openalex.org/W2962244319","https://openalex.org/W2962901215","https://openalex.org/W2978853121","https://openalex.org/W3111064853","https://openalex.org/W6601003894","https://openalex.org/W6682330108","https://openalex.org/W6713603661","https://openalex.org/W6734517396","https://openalex.org/W6739455066","https://openalex.org/W6747473740","https://openalex.org/W6760625254","https://openalex.org/W6772014123","https://openalex.org/W6791623595"],"related_works":["https://openalex.org/W4310083477","https://openalex.org/W2328553770","https://openalex.org/W2920061524","https://openalex.org/W1977959518","https://openalex.org/W2038908348","https://openalex.org/W2019751999","https://openalex.org/W2006191342","https://openalex.org/W4312713068","https://openalex.org/W3041490575","https://openalex.org/W2970690932"],"abstract_inverted_index":{"We":[0,53,134],"introduce":[1],"the":[2,10,33,45,60,69,76,82,88,100,106,113,121,124,130,137,149,153,157,163,167,177,180,184,187,220],"\"soft":[3],"Deep":[4,62],"MaxPain\"":[5],"(softDMP)":[6],"algorithm,":[7],"which":[8],"integrates":[9],"optimization":[11],"of":[12,29,35,108,123,152,179,186],"long-term":[13],"policy":[14],"entropy":[15],"into":[16,99],"reward-punishment":[17],"reinforcement":[18],"learning":[19,95,112],"objectives.":[20],"Our":[21,208],"motivation":[22],"is":[23,47],"to":[24,85,116,183,196],"facilitate":[25],"a":[26,172],"smoother":[27],"variation":[28],"operators":[30],"utilized":[31],"in":[32,129,140,213],"updating":[34,201],"action":[36,78],"values":[37],"beyond":[38],"traditional":[39],"\"max\"":[40],"and":[41,51,91,156,189,203],"\"min\"":[42,83],"operators,":[43],"where":[44],"goal":[46],"enhancing":[48],"sample":[49],"efficiency":[50],"robustness.":[52],"also":[54],"address":[55],"two":[56,141],"unresolved":[57],"issues":[58],"from":[59,75,120],"previous":[61],"MaxPain":[63],"method.":[64],"Firstly,":[65],"we":[66,104,170],"investigate":[67],"how":[68,92],"negated":[70],"(\"flipped\")":[71],"pain-seeking":[72,181,188],"sub-policy,":[73],"derived":[74],"punishment":[77,89,114,204],"value,":[79],"collaborates":[80],"with":[81],"operator":[84,96],"effectively":[86],"learn":[87],"module":[90,115],"softDMP\u2019s":[93],"smooth":[94],"provides":[97],"insights":[98],"\"flipping\"":[101],"trick.":[102],"Secondly,":[103],"tackle":[105],"challenge":[107],"data":[109],"collection":[110],"for":[111,159,200],"mitigate":[117],"inconsistencies":[118],"arising":[119],"involvement":[122],"\"flipped\"":[125],"sub-policy":[126,182],"(pain-avoidance":[127],"sub-policy)":[128],"unified":[131],"behavior":[132],"policy.":[133],"empirically":[135],"explore":[136],"first":[138],"issue":[139],"discrete":[142],"Markov":[143],"Decision":[144],"Process":[145],"(MDP)":[146],"environments,":[147],"elucidating":[148],"crucial":[150],"advancements":[151],"DMP":[154],"approach":[155],"necessity":[158],"soft":[160],"treatments":[161],"on":[162,176],"hard":[164],"operators.":[165],"For":[166],"second":[168],"issue,":[169],"propose":[171],"probabilistic":[173],"classifier":[174,193],"based":[175],"ratio":[178],"sum":[185],"goalreaching":[190],"sub-policies.":[191],"This":[192],"assigns":[194],"roll-outs":[195],"separate":[197],"replay":[198],"buffers":[199],"reward":[202],"action-value":[205],"functions":[206],"respectively.":[207],"framework":[209],"demonstrates":[210],"superior":[211],"performance":[212],"Turtlebot":[214],"3\u2019s":[215],"maze":[216],"navigation":[217],"tasks":[218],"under":[219],"ROS":[221],"Gazebo":[222],"simulation.":[223]},"counts_by_year":[{"year":2026,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
