{"id":"https://openalex.org/W4415124254","doi":"https://doi.org/10.1109/icmlt65785.2025.11193222","title":"An Adaptive Policy Switching Method for Episodic Cumulative Reward in Reinforcement Learning","display_name":"An Adaptive Policy Switching Method for Episodic Cumulative Reward in Reinforcement Learning","publication_year":2025,"publication_date":"2025-05-23","ids":{"openalex":"https://openalex.org/W4415124254","doi":"https://doi.org/10.1109/icmlt65785.2025.11193222"},"language":"en","primary_location":{"id":"doi:10.1109/icmlt65785.2025.11193222","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icmlt65785.2025.11193222","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 10th International Conference on Machine Learning Technologies (ICMLT)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5048399263","display_name":"Natsuhiko Sato","orcid":null},"institutions":[{"id":"https://openalex.org/I118347220","display_name":"NEC (Japan)","ror":"https://ror.org/04jndar25","country_code":"JP","type":"company","lineage":["https://openalex.org/I118347220"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Natsuhiko Sato","raw_affiliation_strings":["NEC Corporation,Visual Intelligence Research Laboratories,Kanagawa,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"NEC Corporation,Visual Intelligence Research Laboratories,Kanagawa,Japan","institution_ids":["https://openalex.org/I118347220"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5102020371","display_name":"Hiroshi Yoshida","orcid":"https://orcid.org/0000-0001-6777-5263"},"institutions":[{"id":"https://openalex.org/I118347220","display_name":"NEC (Japan)","ror":"https://ror.org/04jndar25","country_code":"JP","type":"company","lineage":["https://openalex.org/I118347220"]}],"countries":["JP"],"is_corresponding":false,"raw_author_name":"Hiroshi Yoshida","raw_affiliation_strings":["NEC Corporation,Visual Intelligence Research Laboratories,Kanagawa,Japan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"NEC Corporation,Visual Intelligence Research Laboratories,Kanagawa,Japan","institution_ids":["https://openalex.org/I118347220"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I118347220"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.39039942,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"135","last_page":"140"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T14011","display_name":"Elevator Systems and Control","score":0.5138000249862671,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T14011","display_name":"Elevator Systems and Control","score":0.5138000249862671,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10524","display_name":"Traffic control and management","score":0.492900013923645,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10328","display_name":"Supply Chain and Inventory Management","score":0.47920000553131104,"subfield":{"id":"https://openalex.org/subfields/1404","display_name":"Management Information Systems"},"field":{"id":"https://openalex.org/fields/14","display_name":"Business, Management and Accounting"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7465999722480774},{"id":"https://openalex.org/keywords/cumulative-distribution-function","display_name":"Cumulative distribution function","score":0.5615000128746033},{"id":"https://openalex.org/keywords/probability-distribution","display_name":"Probability distribution","score":0.4284999966621399},{"id":"https://openalex.org/keywords/cumulative-effects","display_name":"Cumulative effects","score":0.41600000858306885},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.3756999969482422},{"id":"https://openalex.org/keywords/adaptive-learning","display_name":"Adaptive learning","score":0.37049999833106995},{"id":"https://openalex.org/keywords/cumulative-prospect-theory","display_name":"Cumulative prospect theory","score":0.35409998893737793}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7465999722480774},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6509000062942505},{"id":"https://openalex.org/C103784038","wikidata":"https://www.wikidata.org/wiki/Q386228","display_name":"Cumulative distribution function","level":3,"score":0.5615000128746033},{"id":"https://openalex.org/C149441793","wikidata":"https://www.wikidata.org/wiki/Q200726","display_name":"Probability distribution","level":2,"score":0.4284999966621399},{"id":"https://openalex.org/C2777230293","wikidata":"https://www.wikidata.org/wiki/Q23579818","display_name":"Cumulative effects","level":2,"score":0.41600000858306885},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4050000011920929},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.3756999969482422},{"id":"https://openalex.org/C125014702","wikidata":"https://www.wikidata.org/wiki/Q4680749","display_name":"Adaptive learning","level":2,"score":0.37049999833106995},{"id":"https://openalex.org/C2779449553","wikidata":"https://www.wikidata.org/wiki/Q5194187","display_name":"Cumulative prospect theory","level":3,"score":0.35409998893737793},{"id":"https://openalex.org/C76178495","wikidata":"https://www.wikidata.org/wiki/Q4808784","display_name":"Asset (computer security)","level":2,"score":0.3368000090122223},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.33660000562667847},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.31299999356269836},{"id":"https://openalex.org/C98385598","wikidata":"https://www.wikidata.org/wiki/Q1339385","display_name":"Empirical distribution function","level":2,"score":0.3107999861240387},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.2775000035762787},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C110121322","wikidata":"https://www.wikidata.org/wiki/Q865811","display_name":"Distribution (mathematics)","level":2,"score":0.2671999931335449},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.2671999931335449},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.26660001277923584},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.25119999051094055}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/icmlt65785.2025.11193222","is_oa":false,"landing_page_url":"https://doi.org/10.1109/icmlt65785.2025.11193222","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 10th International Conference on Machine Learning Technologies (ICMLT)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":7,"referenced_works":["https://openalex.org/W1647779468","https://openalex.org/W2963647337","https://openalex.org/W2966021938","https://openalex.org/W4287266177","https://openalex.org/W4302775018","https://openalex.org/W4389667429","https://openalex.org/W4405787902"],"related_works":[],"abstract_inverted_index":{"In":[0],"reinforcement":[1],"learning":[2],"(RL),":[3],"agents":[4],"learn":[5],"optimal":[6],"policies":[7,116],"through":[8],"interaction":[9],"with":[10,90],"an":[11],"environment.":[12],"Many":[13],"real-world":[14],"tasks,":[15],"such":[16,30],"as":[17,31],"those":[18],"in":[19],"logistics":[20],"and":[21,86,102],"finance,":[22],"require":[23],"achieving":[24,61,95],"cumulative":[25,64,103,119],"rewards":[26],"over":[27,67],"multiple":[28,74],"trials,":[29],"completing":[32],"work":[33],"within":[34],"a":[35,40,53,62],"specific":[36],"timeframe":[37],"or":[38],"exceeding":[39],"target":[41,63],"asset":[42],"value.":[43],"To":[44],"address":[45],"this,":[46],"we":[47],"propose":[48],"Adaptive":[49],"Policy":[50],"Switching":[51],"(APS),":[52],"novel":[54],"method":[55,77],"for":[56,83],"improving":[57],"the":[58,79,88,91,96,99,107],"probability":[59,93],"of":[60,94,109],"reward,":[65],"R,":[66],"N":[68],"trials":[69,101],"by":[70],"adaptively":[71,113],"switching":[72,114],"between":[73,115],"policies.":[75],"Our":[76],"maintains":[78],"empirical":[80],"reward":[81],"distribution":[82],"each":[84],"policy":[85,89],"selects":[87],"highest":[92],"target,":[97],"considering":[98],"remaining":[100],"reward.":[104],"Simulations":[105],"validate":[106],"effectiveness":[108],"APS,":[110],"demonstrating":[111],"that":[112],"efficiently":[117],"achieves":[118],"rewards.":[120]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-14T00:00:00"}
