{"id":"https://openalex.org/W2976161955","doi":"https://doi.org/10.1109/isit.2019.8849765","title":"Maximum Likelihood Tensor Decomposition of Markov Decision Process","display_name":"Maximum Likelihood Tensor Decomposition of Markov Decision Process","publication_year":2019,"publication_date":"2019-07-01","ids":{"openalex":"https://openalex.org/W2976161955","doi":"https://doi.org/10.1109/isit.2019.8849765","mag":"2976161955"},"language":"en","primary_location":{"id":"doi:10.1109/isit.2019.8849765","is_oa":false,"landing_page_url":"https://doi.org/10.1109/isit.2019.8849765","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2019 IEEE International Symposium on Information Theory (ISIT)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5079423586","display_name":"Chengzhuo Ni","orcid":null},"institutions":[{"id":"https://openalex.org/I20231570","display_name":"Peking University","ror":"https://ror.org/02v51f717","country_code":"CN","type":"education","lineage":["https://openalex.org/I20231570"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Chengzhuo Ni","raw_affiliation_strings":["School of Mathematical Sciences, Peking University, Beijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Mathematical Sciences, Peking University, Beijing, China","institution_ids":["https://openalex.org/I20231570"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5100707460","display_name":"Mengdi Wang","orcid":"https://orcid.org/0000-0002-2101-9507"},"institutions":[{"id":"https://openalex.org/I20231570","display_name":"Peking University","ror":"https://ror.org/02v51f717","country_code":"CN","type":"education","lineage":["https://openalex.org/I20231570"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Mengdi Wang","raw_affiliation_strings":["School of Mathematical Sciences, Peking University, Beijing, China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"School of Mathematical Sciences, Peking University, Beijing, China","institution_ids":["https://openalex.org/I20231570"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I20231570"],"apc_list":null,"apc_paid":null,"fwci":0.3889,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":{"value":0.49657534,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":93,"max":95},"biblio":{"volume":null,"issue":null,"first_page":"3062","last_page":"3066"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12303","display_name":"Tensor decomposition and applications","score":0.9984999895095825,"subfield":{"id":"https://openalex.org/subfields/2605","display_name":"Computational Mathematics"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T12303","display_name":"Tensor decomposition and applications","score":0.9984999895095825,"subfield":{"id":"https://openalex.org/subfields/2605","display_name":"Computational Mathematics"},"field":{"id":"https://openalex.org/fields/26","display_name":"Mathematics"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9879000186920166,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.9469000101089478,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/estimator","display_name":"Estimator","score":0.6590036153793335},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.5675172209739685},{"id":"https://openalex.org/keywords/rank","display_name":"Rank (graph theory)","score":0.5325751900672913},{"id":"https://openalex.org/keywords/upper-and-lower-bounds","display_name":"Upper and lower bounds","score":0.5057191848754883},{"id":"https://openalex.org/keywords/tensor","display_name":"Tensor (intrinsic definition)","score":0.4813843071460724},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.47771406173706055},{"id":"https://openalex.org/keywords/divergence","display_name":"Divergence (linguistics)","score":0.4746028780937195},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.45882606506347656},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.4438049793243408},{"id":"https://openalex.org/keywords/applied-mathematics","display_name":"Applied mathematics","score":0.4225158095359802},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.4068465828895569},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.382155179977417},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3575846254825592},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.3331793546676636},{"id":"https://openalex.org/keywords/statistics","display_name":"Statistics","score":0.23318737745285034},{"id":"https://openalex.org/keywords/combinatorics","display_name":"Combinatorics","score":0.15451720356941223}],"concepts":[{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.6590036153793335},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.5675172209739685},{"id":"https://openalex.org/C164226766","wikidata":"https://www.wikidata.org/wiki/Q7293202","display_name":"Rank (graph theory)","level":2,"score":0.5325751900672913},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.5057191848754883},{"id":"https://openalex.org/C155281189","wikidata":"https://www.wikidata.org/wiki/Q3518150","display_name":"Tensor (intrinsic definition)","level":2,"score":0.4813843071460724},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.47771406173706055},{"id":"https://openalex.org/C207390915","wikidata":"https://www.wikidata.org/wiki/Q1230525","display_name":"Divergence (linguistics)","level":2,"score":0.4746028780937195},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.45882606506347656},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.4438049793243408},{"id":"https://openalex.org/C28826006","wikidata":"https://www.wikidata.org/wiki/Q33521","display_name":"Applied mathematics","level":1,"score":0.4225158095359802},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.4068465828895569},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.382155179977417},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3575846254825592},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3331793546676636},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.23318737745285034},{"id":"https://openalex.org/C114614502","wikidata":"https://www.wikidata.org/wiki/Q76592","display_name":"Combinatorics","level":1,"score":0.15451720356941223},{"id":"https://openalex.org/C202444582","wikidata":"https://www.wikidata.org/wiki/Q837863","display_name":"Pure mathematics","level":1,"score":0.0},{"id":"https://openalex.org/C134306372","wikidata":"https://www.wikidata.org/wiki/Q7754","display_name":"Mathematical analysis","level":1,"score":0.0},{"id":"https://openalex.org/C41895202","wikidata":"https://www.wikidata.org/wiki/Q8162","display_name":"Linguistics","level":1,"score":0.0},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/isit.2019.8849765","is_oa":false,"landing_page_url":"https://doi.org/10.1109/isit.2019.8849765","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2019 IEEE International Symposium on Information Theory (ISIT)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.8199999928474426}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":28,"referenced_works":["https://openalex.org/W111328409","https://openalex.org/W1597303641","https://openalex.org/W1825640910","https://openalex.org/W2037774087","https://openalex.org/W2052898451","https://openalex.org/W2098432798","https://openalex.org/W2119567691","https://openalex.org/W2121863487","https://openalex.org/W2125510930","https://openalex.org/W2134932665","https://openalex.org/W2150844583","https://openalex.org/W2169324952","https://openalex.org/W2542665129","https://openalex.org/W2765892966","https://openalex.org/W2798543980","https://openalex.org/W2963207653","https://openalex.org/W2963254349","https://openalex.org/W2963725088","https://openalex.org/W2990161834","https://openalex.org/W4214717370","https://openalex.org/W4301099225","https://openalex.org/W6635767209","https://openalex.org/W6678900246","https://openalex.org/W6693997783","https://openalex.org/W6708142925","https://openalex.org/W6729012055","https://openalex.org/W6750356851","https://openalex.org/W6754486661"],"related_works":["https://openalex.org/W4400868993","https://openalex.org/W3096874164","https://openalex.org/W1985560493","https://openalex.org/W2937181779","https://openalex.org/W2386410636","https://openalex.org/W2357975469","https://openalex.org/W2145363145","https://openalex.org/W1626977535","https://openalex.org/W2341346307","https://openalex.org/W3168977894"],"abstract_inverted_index":{"Model":[0],"reduction":[1],"is":[2,91],"critical":[3],"to":[4,16,47],"reinforcement":[5,115],"learning":[6],"in":[7,114],"high":[8],"dimensions.":[9],"In":[10],"this":[11,54],"paper,":[12],"we":[13,56],"study":[14],"how":[15],"learn":[17],"a":[18,58,104],"reduced":[19],"model":[20,79,109],"of":[21,38,68],"an":[22,39],"unknown":[23,40],"Markov":[24],"decision":[25],"process":[26],"(MDP)":[27],"from":[28],"empirical":[29],"trajectories.":[30],"We":[31],"focus":[32],"on":[33],"estimating":[34],"the":[35,43,48,69,74,77,88,98],"tensor":[36],"decomposition":[37],"MDP,":[41],"where":[42],"factor":[44],"matrices":[45],"correspond":[46],"state":[49],"and":[50,63,73,80,94,111],"action":[51],"features.":[52],"For":[53],"purpose,":[55],"develop":[57],"tensor-rank-constrained":[59],"maximum":[60],"likelihood":[61],"estimator":[62,102],"prove":[64],"statistical":[65],"upper":[66,99],"bounds":[67],"Kullback-Leiber":[70],"divergence":[71],"error":[72,90],"\u21132error":[75],"between":[76],"estimated":[78],"true":[81],"model.":[82],"An":[83],"information-theoretic":[84],"lower":[85],"bound":[86],"for":[87,108],"estimation":[89],"also":[92],"provided":[93],"it":[95],"nearly":[96],"matches":[97],"bound.":[100],"This":[101],"provides":[103],"statistically":[105],"efficient":[106],"approach":[107],"compression":[110],"feature":[112],"extraction":[113],"learning.":[116]},"counts_by_year":[{"year":2021,"cited_by_count":2}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
