{"id":"https://openalex.org/W7123338428","doi":"https://doi.org/10.1109/cdc57313.2025.11312789","title":"Rollout-Based Approximate Dynamic Programming for MDPs with Information-Theoretic Constraints","display_name":"Rollout-Based Approximate Dynamic Programming for MDPs with Information-Theoretic Constraints","publication_year":2025,"publication_date":"2025-12-09","ids":{"openalex":"https://openalex.org/W7123338428","doi":"https://doi.org/10.1109/cdc57313.2025.11312789"},"language":null,"primary_location":{"id":"doi:10.1109/cdc57313.2025.11312789","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cdc57313.2025.11312789","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 64th Conference on Decision and Control (CDC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Zixuan He","orcid":null},"institutions":[{"id":"https://openalex.org/I1902872","display_name":"EURECOM","ror":"https://ror.org/00sse7z02","country_code":"FR","type":"education","lineage":["https://openalex.org/I1902872","https://openalex.org/I205703379"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Zixuan He","raw_affiliation_strings":["EURECOM,Foundation and Algorithm Group,Communication Systems Department,France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"EURECOM,Foundation and Algorithm Group,Communication Systems Department,France","institution_ids":["https://openalex.org/I1902872"]}]},{"author_position":"middle","author":{"id":null,"display_name":"Charalambos D. Charalambous","orcid":null},"institutions":[{"id":"https://openalex.org/I34771391","display_name":"University of Cyprus","ror":"https://ror.org/02qjrjx09","country_code":"CY","type":"education","lineage":["https://openalex.org/I34771391"]}],"countries":["CY"],"is_corresponding":false,"raw_author_name":"Charalambos D. Charalambous","raw_affiliation_strings":["University of Cyprus,Department of Electrical and Computer Engineering,Cyprus"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Cyprus,Department of Electrical and Computer Engineering,Cyprus","institution_ids":["https://openalex.org/I34771391"]}]},{"author_position":"last","author":{"id":null,"display_name":"Photios A. Stavrou","orcid":null},"institutions":[{"id":"https://openalex.org/I1902872","display_name":"EURECOM","ror":"https://ror.org/00sse7z02","country_code":"FR","type":"education","lineage":["https://openalex.org/I1902872","https://openalex.org/I205703379"]}],"countries":["FR"],"is_corresponding":false,"raw_author_name":"Photios A. Stavrou","raw_affiliation_strings":["EURECOM,Foundation and Algorithm Group,Communication Systems Department,France"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"EURECOM,Foundation and Algorithm Group,Communication Systems Department,France","institution_ids":["https://openalex.org/I1902872"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"4497","last_page":"4502"},"is_retracted":false,"is_paratext":false,"is_xpac":true,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8206999897956848,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8206999897956848,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.11990000307559967,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.010400000028312206,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7943000197410583},{"id":"https://openalex.org/keywords/dynamic-programming","display_name":"Dynamic programming","score":0.7670999765396118},{"id":"https://openalex.org/keywords/discretization","display_name":"Discretization","score":0.631600022315979},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.5389000177383423},{"id":"https://openalex.org/keywords/optimal-control","display_name":"Optimal control","score":0.5008000135421753},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.48559999465942383},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.4796000123023987},{"id":"https://openalex.org/keywords/computational-complexity-theory","display_name":"Computational complexity theory","score":0.47850000858306885},{"id":"https://openalex.org/keywords/base","display_name":"Base (topology)","score":0.42890000343322754}],"concepts":[{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7943000197410583},{"id":"https://openalex.org/C37404715","wikidata":"https://www.wikidata.org/wiki/Q380679","display_name":"Dynamic programming","level":2,"score":0.7670999765396118},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6855999827384949},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.65420001745224},{"id":"https://openalex.org/C73000952","wikidata":"https://www.wikidata.org/wiki/Q17007827","display_name":"Discretization","level":2,"score":0.631600022315979},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.5389000177383423},{"id":"https://openalex.org/C91575142","wikidata":"https://www.wikidata.org/wiki/Q1971426","display_name":"Optimal control","level":2,"score":0.5008000135421753},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.48559999465942383},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.4796000123023987},{"id":"https://openalex.org/C179799912","wikidata":"https://www.wikidata.org/wiki/Q205084","display_name":"Computational complexity theory","level":2,"score":0.47850000858306885},{"id":"https://openalex.org/C42058472","wikidata":"https://www.wikidata.org/wiki/Q810214","display_name":"Base (topology)","level":2,"score":0.42890000343322754},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.4041000008583069},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.3971000015735626},{"id":"https://openalex.org/C148764684","wikidata":"https://www.wikidata.org/wiki/Q621751","display_name":"Approximation algorithm","level":2,"score":0.3711000084877014},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.34310001134872437},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.3174000084400177},{"id":"https://openalex.org/C311688","wikidata":"https://www.wikidata.org/wiki/Q2393193","display_name":"Time complexity","level":2,"score":0.30239999294281006},{"id":"https://openalex.org/C41045048","wikidata":"https://www.wikidata.org/wiki/Q202843","display_name":"Linear programming","level":2,"score":0.30079999566078186},{"id":"https://openalex.org/C170131372","wikidata":"https://www.wikidata.org/wiki/Q7617811","display_name":"Stochastic control","level":3,"score":0.2944999933242798},{"id":"https://openalex.org/C55689738","wikidata":"https://www.wikidata.org/wiki/Q15963867","display_name":"Discrete time and continuous time","level":2,"score":0.29260000586509705},{"id":"https://openalex.org/C137631369","wikidata":"https://www.wikidata.org/wiki/Q7617831","display_name":"Stochastic programming","level":2,"score":0.2831999957561493},{"id":"https://openalex.org/C196921405","wikidata":"https://www.wikidata.org/wiki/Q786431","display_name":"Online algorithm","level":2,"score":0.2782999873161316},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.2572999894618988},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.2524000108242035}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/cdc57313.2025.11312789","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cdc57313.2025.11312789","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 64th Conference on Decision and Control (CDC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","score":0.7710942625999451,"id":"https://metadata.un.org/sdg/16"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"This":[0],"paper":[1],"studies":[2],"a":[3,41,46,62,80,101,124,139],"finite-horizon":[4],"Markov":[5],"decision":[6],"problem":[7],"with":[8,61,123],"information-theoretic":[9],"constraints,":[10,32],"where":[11,127],"the":[12,20,25,69,74,130,134,146,152,158],"goal":[13],"is":[14,52],"to":[15,24,29,54,138],"minimize":[16],"directed":[17],"information":[18],"from":[19],"controlled":[21],"source":[22],"process":[23],"control":[26,37],"process,":[27],"subject":[28],"stage-wise":[30],"cost":[31,131],"aiming":[33],"for":[34,48,157],"an":[35,58,95,107],"optimal":[36],"policy.":[38],"We":[39,118],"propose":[40,79],"new":[42],"way":[43],"of":[44,72,92,133],"approximating":[45],"solution":[47],"this":[49],"problem,":[50],"which":[51],"known":[53],"be":[55],"formulated":[56],"as":[57],"unconstrained":[59],"MDP":[60],"continuous":[63,75],"information-state":[64,76],"using":[65],"Q-factors.":[66],"To":[67],"avoid":[68],"computational":[70,147],"complexity":[71,148],"discretizing":[73],"space,":[77],"we":[78,128],"truncated":[81],"rollout-based":[82],"backward-forward":[83],"approximate":[84],"dynamic":[85],"programming":[86],"(ADP)":[87],"framework.":[88],"Our":[89],"approach":[90],"consists":[91],"two":[93,159],"phases:":[94],"offline":[96,153],"base":[97],"policy":[98,142],"approximation":[99,143],"over":[100],"shorter":[102],"time":[103],"horizon,":[104],"followed":[105],"by":[106,114],"online":[108,155],"rollout":[109,135],"lookahead":[110],"minimization,":[111],"both":[112],"supported":[113],"provable":[115],"convergence":[116],"guarantees.":[117],"supplement":[119],"our":[120],"theoretical":[121],"results":[122],"numerical":[125],"example":[126],"demonstrate":[129],"improvement":[132],"method":[136],"compared":[137],"previously":[140],"proposed":[141],"method,":[144],"and":[145,154],"observed":[149],"in":[150],"executing":[151],"phases":[156],"methods.":[160]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-28T00:00:00"}
