{"id":"https://openalex.org/W7167600045","doi":"https://doi.org/10.1016/j.ipm.2026.105035","title":"Offline-to-online reinforcement learning with triple-intensity policy constraints","display_name":"Offline-to-online reinforcement learning with triple-intensity policy constraints","publication_year":2026,"publication_date":"2026-07-07","ids":{"openalex":"https://openalex.org/W7167600045","doi":"https://doi.org/10.1016/j.ipm.2026.105035"},"language":"en","primary_location":{"id":"doi:10.1016/j.ipm.2026.105035","is_oa":false,"landing_page_url":"https://doi.org/10.1016/j.ipm.2026.105035","pdf_url":null,"source":{"id":"https://openalex.org/S174847851","display_name":"Information Processing & Management","issn_l":"0020-0271","issn":["0020-0271","0306-4573","1873-5371","1878-4089"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320990","host_organization_name":"Elsevier BV","host_organization_lineage":["https://openalex.org/P4310320990"],"host_organization_lineage_names":["Elsevier BV"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Information Processing &amp; Management","raw_type":"journal-article"},"type":"article","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5101542596","display_name":"Hao Wu","orcid":"https://orcid.org/0000-0001-6993-8863"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Hao Wu","raw_affiliation_strings":[],"raw_orcid":"https://orcid.org/0009-0009-2113-6402","affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140162720","display_name":"Songlin Li","orcid":"https://orcid.org/0009-0009-6272-258X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Songlin Li","raw_affiliation_strings":[],"raw_orcid":"https://orcid.org/0009-0009-6272-258X","affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140165500","display_name":"Wei Xiao","orcid":"https://orcid.org/0009-0002-2336-4395"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wei Xiao","raw_affiliation_strings":[],"raw_orcid":"https://orcid.org/0009-0002-2336-4395","affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140189105","display_name":"Taihong Zhong","orcid":"https://orcid.org/0009-0005-3405-3340"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Taihong Zhong","raw_affiliation_strings":[],"raw_orcid":"https://orcid.org/0009-0005-3405-3340","affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5012433446","display_name":"Shuai L\u00fc","orcid":"https://orcid.org/0000-0002-8081-4498"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shuai L\u00fc","raw_affiliation_strings":[],"raw_orcid":"https://orcid.org/0000-0002-8081-4498","affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":{"value":3020,"currency":"USD","value_usd":3020},"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.83032123,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"64","issue":"1","first_page":"105035","last_page":"105035"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8205000162124634,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8205000162124634,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.07079999893903732,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.04010000079870224,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5597000122070312},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.39899998903274536},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.32589998841285706},{"id":"https://openalex.org/keywords/constraint","display_name":"Constraint (computer-aided design)","score":0.2892000079154968},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.2809999883174896},{"id":"https://openalex.org/keywords/context","display_name":"Context (archaeology)","score":0.2793999910354614}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5597000122070312},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5259000062942505},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.39899998903274536},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3684999942779541},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.32589998841285706},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.29019999504089355},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.2892000079154968},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.2809999883174896},{"id":"https://openalex.org/C2779343474","wikidata":"https://www.wikidata.org/wiki/Q3109175","display_name":"Context (archaeology)","level":2,"score":0.2793999910354614},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.26930001378059387},{"id":"https://openalex.org/C2778348673","wikidata":"https://www.wikidata.org/wiki/Q739302","display_name":"Production (economics)","level":2,"score":0.2630999982357025},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.26179999113082886},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2558000087738037},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.25540000200271606},{"id":"https://openalex.org/C61797465","wikidata":"https://www.wikidata.org/wiki/Q1188986","display_name":"Term (time)","level":2,"score":0.2522999942302704},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.2515999972820282}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1016/j.ipm.2026.105035","is_oa":false,"landing_page_url":"https://doi.org/10.1016/j.ipm.2026.105035","pdf_url":null,"source":{"id":"https://openalex.org/S174847851","display_name":"Information Processing & Management","issn_l":"0020-0271","issn":["0020-0271","0306-4573","1873-5371","1878-4089"],"is_oa":false,"is_in_doaj":false,"is_core":true,"host_organization":"https://openalex.org/P4310320990","host_organization_name":"Elsevier BV","host_organization_lineage":["https://openalex.org/P4310320990"],"host_organization_lineage_names":["Elsevier BV"],"type":"journal"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Information Processing &amp; Management","raw_type":"journal-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Climate action","id":"https://metadata.un.org/sdg/13","score":0.6417481899261475}],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":19,"referenced_works":["https://openalex.org/W2092720955","https://openalex.org/W2158782408","https://openalex.org/W2877093712","https://openalex.org/W4297838928","https://openalex.org/W4382202996","https://openalex.org/W4385626984","https://openalex.org/W4393160268","https://openalex.org/W4405862163","https://openalex.org/W4414286127","https://openalex.org/W4414871369","https://openalex.org/W4415601095","https://openalex.org/W4415795793","https://openalex.org/W7118167350","https://openalex.org/W7124265340","https://openalex.org/W7133204973","https://openalex.org/W7133210602","https://openalex.org/W7133238846","https://openalex.org/W7133242608","https://openalex.org/W7133245541"],"related_works":[],"abstract_inverted_index":null,"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-07-08T00:00:00"}
