{"id":"https://openalex.org/W7116780627","doi":"https://doi.org/10.1109/tetc.2025.3644748","title":"Multi-Discounting Reinforcement Learning Based on Reward Decomposition","display_name":"Multi-Discounting Reinforcement Learning Based on Reward Decomposition","publication_year":2025,"publication_date":"2025-12-22","ids":{"openalex":"https://openalex.org/W7116780627","doi":"https://doi.org/10.1109/tetc.2025.3644748"},"language":null,"primary_location":{"id":"doi:10.1109/tetc.2025.3644748","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tetc.2025.3644748","pdf_url":null,"source":{"id":"https://openalex.org/S2496326734","display_name":"IEEE Transactions on Emerging Topics in Computing","issn_l":"2168-6750","issn":["2168-6750","2376-4562"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Emerging Topics in Computing","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5019552295","display_name":"Pengbin Chen","orcid":"https://orcid.org/0009-0007-4307-5618"},"institutions":[{"id":"https://openalex.org/I4210142539","display_name":"Guangdong Institute of Intelligent Manufacturing","ror":"https://ror.org/049jpjz09","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210142539"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Pengbin Chen","raw_affiliation_strings":["Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China"],"raw_orcid":"https://orcid.org/0009-0007-4307-5618","affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China","institution_ids":["https://openalex.org/I4210142539"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5120948997","display_name":"Qi Liu","orcid":null},"institutions":[{"id":"https://openalex.org/I4210142539","display_name":"Guangdong Institute of Intelligent Manufacturing","ror":"https://ror.org/049jpjz09","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210142539"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qi Liu","raw_affiliation_strings":["Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China"],"raw_orcid":"https://orcid.org/0000-0001-7485-6344","affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China","institution_ids":["https://openalex.org/I4210142539"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100677178","display_name":"Yanjie Li","orcid":"https://orcid.org/0000-0001-7890-9677"},"institutions":[{"id":"https://openalex.org/I4210142539","display_name":"Guangdong Institute of Intelligent Manufacturing","ror":"https://ror.org/049jpjz09","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210142539"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yanjie Li","raw_affiliation_strings":["Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China"],"raw_orcid":"https://orcid.org/0000-0001-7890-9677","affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China","institution_ids":["https://openalex.org/I4210142539"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5033363064","display_name":"Kejian Yan","orcid":"https://orcid.org/0000-0002-7767-8157"},"institutions":[{"id":"https://openalex.org/I4210142539","display_name":"Guangdong Institute of Intelligent Manufacturing","ror":"https://ror.org/049jpjz09","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210142539"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Kejian Yan","raw_affiliation_strings":["Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China","institution_ids":["https://openalex.org/I4210142539"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5120962196","display_name":"Shuangkang Ma","orcid":null},"institutions":[{"id":"https://openalex.org/I4210142539","display_name":"Guangdong Institute of Intelligent Manufacturing","ror":"https://ror.org/049jpjz09","country_code":"CN","type":"facility","lineage":["https://openalex.org/I4210142539"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Shuangkang Ma","raw_affiliation_strings":["Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen, Shenzhen, China","institution_ids":["https://openalex.org/I4210142539"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I4210142539"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.76356225,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"14","issue":"1","first_page":"94","last_page":"104"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8646000027656555,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8646000027656555,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12026","display_name":"Explainable Artificial Intelligence (XAI)","score":0.018200000748038292,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10042","display_name":"Neural and Behavioral Psychology Studies","score":0.012400000356137753,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8222000002861023},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7300999760627747},{"id":"https://openalex.org/keywords/flexibility","display_name":"Flexibility (engineering)","score":0.7128000259399414},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.5774999856948853},{"id":"https://openalex.org/keywords/decomposition","display_name":"Decomposition","score":0.4569999873638153},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4474000036716461},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.4415999948978424},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.4408000111579895},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.42419999837875366}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8222000002861023},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7875999808311462},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7300999760627747},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.7128000259399414},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.5774999856948853},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.47440001368522644},{"id":"https://openalex.org/C124681953","wikidata":"https://www.wikidata.org/wiki/Q339062","display_name":"Decomposition","level":2,"score":0.4569999873638153},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4474000036716461},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.4415999948978424},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.4408000111579895},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.42419999837875366},{"id":"https://openalex.org/C2781039887","wikidata":"https://www.wikidata.org/wiki/Q1391724","display_name":"Factor (programming language)","level":2,"score":0.42170000076293945},{"id":"https://openalex.org/C6177178","wikidata":"https://www.wikidata.org/wiki/Q10998070","display_name":"Discounting","level":2,"score":0.41290000081062317},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.41200000047683716},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.4009999930858612},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.3801000118255615},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.3765999972820282},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3614000082015991},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.3573000133037567},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.35679998993873596},{"id":"https://openalex.org/C166109690","wikidata":"https://www.wikidata.org/wiki/Q4677422","display_name":"Action selection","level":3,"score":0.3555999994277954},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.3009999990463257},{"id":"https://openalex.org/C28761237","wikidata":"https://www.wikidata.org/wiki/Q7805321","display_name":"Time horizon","level":2,"score":0.29249998927116394},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.2874000072479248},{"id":"https://openalex.org/C163836022","wikidata":"https://www.wikidata.org/wiki/Q6771326","display_name":"Markov model","level":3,"score":0.2840999960899353},{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.2806999981403351},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.2773999869823456},{"id":"https://openalex.org/C55689738","wikidata":"https://www.wikidata.org/wiki/Q15963867","display_name":"Discrete time and continuous time","level":2,"score":0.25519999861717224}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/tetc.2025.3644748","is_oa":false,"landing_page_url":"https://doi.org/10.1109/tetc.2025.3644748","pdf_url":null,"source":{"id":"https://openalex.org/S2496326734","display_name":"IEEE Transactions on Emerging Topics in Computing","issn_l":"2168-6750","issn":["2168-6750","2376-4562"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310319808","host_organization_name":"Institute of Electrical and Electronics Engineers","host_organization_lineage":["https://openalex.org/P4310319808"],"host_organization_lineage_names":["Institute of Electrical and Electronics Engineers"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Transactions on Emerging Topics in Computing","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.6824881434440613,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":20,"referenced_works":["https://openalex.org/W2065365821","https://openalex.org/W2102660061","https://openalex.org/W2134247338","https://openalex.org/W2562788852","https://openalex.org/W2754517384","https://openalex.org/W2907306720","https://openalex.org/W2911036112","https://openalex.org/W2982316857","https://openalex.org/W2984168904","https://openalex.org/W2998494185","https://openalex.org/W3153573172","https://openalex.org/W3155580983","https://openalex.org/W3204760820","https://openalex.org/W3211583675","https://openalex.org/W4210870706","https://openalex.org/W4285141068","https://openalex.org/W4285588358","https://openalex.org/W4287266177","https://openalex.org/W4404278341","https://openalex.org/W7124320264"],"related_works":[],"abstract_inverted_index":{"The":[0,24,50],"standard":[1],"paradigm":[2],"of":[3,35,46,86,115,219],"reinforcement":[4],"learning":[5],"(RL)":[6],"is":[7,29],"the":[8,20,33,47,55,59,64,69,72,81,95,98,106,136,181,205,217,220],"Markov":[9],"Decision":[10],"Process":[11],"(MDP)":[12],"in":[13,27,58,97,104,111,156,212],"which":[14,62],"an":[15,167],"agent":[16],"learns":[17],"to":[18,41,80,134,142,172,180],"maximize":[19],"cumulative":[21],"discounted":[22],"rewards.":[23],"reward":[25,37,57,76,132,149,158],"function":[26],"MDP":[28,125],"generally":[30],"defined":[31],"as":[32],"sum":[34],"multiple":[36],"components,":[38],"each":[39],"designed":[40],"encapsulate":[42],"a":[43,112,127],"specific":[44,88],"aspect":[45],"expected":[48],"policy.":[49],"discount":[51,83,145],"factor$\\gamma":[52],"\\in":[53],"[0,1)$decreases":[54],"future":[56],"present":[60],"value,":[61],"determines":[63],"effective":[65],"time":[66],"horizon":[67],"for":[68,147,188,196],"agent.":[70],"In":[71],"conventional":[73],"MDP,":[74],"all":[75],"components":[77,159],"are":[78],"subject":[79],"same":[82],"factor":[84],"regardless":[85],"their":[87],"meanings.":[89,120],"Although":[90],"this":[91,164],"convenient":[92],"configuration":[93],"simplifies":[94],"problem":[96,108],"algorithm":[99],"deployment,":[100],"it":[101,179],"sacrifices":[102],"precision":[103,211],"defining":[105],"optimization":[107],"and":[109,193,210],"results":[110,202],"temporal":[113],"mismatch":[114],"rewards":[116],"with":[117,223],"diverse":[118],"physical":[119],"This":[121,151],"paper":[122,165],"proposes":[123,166],"multi-discounting":[124,170,186,194],"(MDMDP),":[126],"novel":[128],"model":[129],"based":[130],"on":[131],"decomposition":[133],"solve":[135,173],"above":[137],"problems.":[138],"MDMDP":[139],"allows":[140],"practitioners":[141],"set":[143],"separate":[144],"factors":[146],"different":[148,161],"components.":[150],"capability":[152],"provides":[153],"great":[154],"flexibility":[155,209],"combining":[157],"at":[160],"timescales.":[162],"Furthermore,":[163],"RL":[168,183],"algorithm,":[169],"Q-learning,":[171],"finite":[174],"MDMDP.":[175],"Moreover,":[176],"we":[177],"extend":[178],"deep":[182],"version,":[184],"including":[185],"DQN":[187],"discrete":[189],"action":[190,198],"space":[191,199],"tasks":[192],"actor-critic":[195],"continuous":[197],"tasks.":[200],"Experimental":[201],"demonstrate":[203],"that":[204],"proposed":[206],"methods":[207],"improve":[208],"modeling":[213],"complex":[214],"tasks,":[215],"enhancing":[216],"alignment":[218],"agent's":[221],"policy":[222],"desired":[224],"objectives.":[225]},"counts_by_year":[],"updated_date":"2026-08-12T21:12:35.861297","created_date":"2025-12-22T00:00:00"}
