{"id":"https://openalex.org/W7161233655","doi":"https://doi.org/10.48550/arxiv.2605.14632","title":"DRL-STAF: A Deep Reinforcement Learning Framework for State-Aware Forecasting of Complex Multivariate Hidden Markov Processes","display_name":"DRL-STAF: A Deep Reinforcement Learning Framework for State-Aware Forecasting of Complex Multivariate Hidden Markov Processes","publication_year":2026,"publication_date":"2026-05-14","ids":{"openalex":"https://openalex.org/W7161233655","doi":"https://doi.org/10.48550/arxiv.2605.14632"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.14632","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.14632","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.14632","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5027111612","display_name":"Manrui Jiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiang, Manrui","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5117537434","display_name":"Jingru HUANG","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Jingru","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5136269143","display_name":"Yong Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Chen, Yong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5136198632","display_name":"Chen Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11344","display_name":"Traffic Prediction and Management Techniques","score":0.14100000262260437,"subfield":{"id":"https://openalex.org/subfields/2215","display_name":"Building and Construction"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11344","display_name":"Traffic Prediction and Management Techniques","score":0.14100000262260437,"subfield":{"id":"https://openalex.org/subfields/2215","display_name":"Building and Construction"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11918","display_name":"Forecasting Techniques and Applications","score":0.10939999669790268,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T12120","display_name":"Air Quality Monitoring and Forecasting","score":0.07119999825954437,"subfield":{"id":"https://openalex.org/subfields/2305","display_name":"Environmental Engineering"},"field":{"id":"https://openalex.org/fields/23","display_name":"Environmental Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/hidden-markov-model","display_name":"Hidden Markov model","score":0.7876999974250793},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.641700029373169},{"id":"https://openalex.org/keywords/multivariate-statistics","display_name":"Multivariate statistics","score":0.6097999811172485},{"id":"https://openalex.org/keywords/forward-algorithm","display_name":"Forward algorithm","score":0.4846000075340271},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.44850000739097595},{"id":"https://openalex.org/keywords/nonlinear-system","display_name":"Nonlinear system","score":0.42570000886917114},{"id":"https://openalex.org/keywords/markov-model","display_name":"Markov model","score":0.42089998722076416},{"id":"https://openalex.org/keywords/artificial-neural-network","display_name":"Artificial neural network","score":0.4189000129699707},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.4140999913215637}],"concepts":[{"id":"https://openalex.org/C23224414","wikidata":"https://www.wikidata.org/wiki/Q176769","display_name":"Hidden Markov model","level":2,"score":0.7876999974250793},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6969000101089478},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6675999760627747},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.641700029373169},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.6308000087738037},{"id":"https://openalex.org/C161584116","wikidata":"https://www.wikidata.org/wiki/Q1952580","display_name":"Multivariate statistics","level":2,"score":0.6097999811172485},{"id":"https://openalex.org/C196455857","wikidata":"https://www.wikidata.org/wiki/Q5473264","display_name":"Forward algorithm","level":5,"score":0.4846000075340271},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.44850000739097595},{"id":"https://openalex.org/C158622935","wikidata":"https://www.wikidata.org/wiki/Q660848","display_name":"Nonlinear system","level":2,"score":0.42570000886917114},{"id":"https://openalex.org/C163836022","wikidata":"https://www.wikidata.org/wiki/Q6771326","display_name":"Markov model","level":3,"score":0.42089998722076416},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.4189000129699707},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.4140999913215637},{"id":"https://openalex.org/C64939953","wikidata":"https://www.wikidata.org/wiki/Q3859882","display_name":"Hidden semi-Markov model","level":5,"score":0.41200000047683716},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.4036000072956085},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.3506999909877777},{"id":"https://openalex.org/C54907487","wikidata":"https://www.wikidata.org/wiki/Q7915688","display_name":"Variable-order Markov model","level":4,"score":0.34850001335144043},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.34380000829696655},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.3278999924659729},{"id":"https://openalex.org/C71983512","wikidata":"https://www.wikidata.org/wiki/Q7915687","display_name":"Variable-order Bayesian network","level":4,"score":0.3061000108718872},{"id":"https://openalex.org/C153180895","wikidata":"https://www.wikidata.org/wiki/Q7148389","display_name":"Pattern recognition (psychology)","level":2,"score":0.303600013256073},{"id":"https://openalex.org/C196956702","wikidata":"https://www.wikidata.org/wiki/Q6795829","display_name":"Maximum-entropy Markov model","level":5,"score":0.29179999232292175},{"id":"https://openalex.org/C137002209","wikidata":"https://www.wikidata.org/wiki/Q898521","display_name":"Hidden variable theory","level":3,"score":0.28220000863075256},{"id":"https://openalex.org/C51167844","wikidata":"https://www.wikidata.org/wiki/Q4422623","display_name":"Latent variable","level":2,"score":0.2745000123977661},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.27160000801086426},{"id":"https://openalex.org/C151406439","wikidata":"https://www.wikidata.org/wiki/Q186588","display_name":"Time series","level":2,"score":0.2515000104904175}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.14632","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.14632","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.14632","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.14632","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Climate action","score":0.5079041719436646,"id":"https://metadata.un.org/sdg/13"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Forecasting":[0,63],"multivariate":[1,78,125],"hidden":[2,74,79,95],"Markov":[3,35,80],"processes":[4],"is":[5],"challenging":[6],"due":[7],"to":[8,111],"nonlinear":[9,46,86],"and":[10,16,48,70,92,107,140],"nonstationary":[11],"observations,":[12],"latent":[13,40],"state":[14,31],"transitions,":[15],"cross-sequence":[17],"dependencies.":[18],"While":[19],"deep":[20,89,137],"learning":[21,138],"methods":[22],"achieve":[23],"strong":[24],"predictive":[25],"accuracy,":[26],"they":[27],"typically":[28],"lack":[29],"explicit":[30],"modeling,":[32],"whereas":[33],"Hidden":[34],"Models":[36],"(HMMs)":[37],"provide":[38],"interpretable":[39],"states":[41,75,96],"but":[42],"struggle":[43],"with":[44],"complex":[45,77,85],"emissions":[47,87],"scalability.":[49],"To":[50],"address":[51],"these":[52],"limitations,":[53],"we":[54],"propose":[55],"DRL-STAF,":[56],"a":[57],"Deep":[58],"Reinforcement":[59],"Learning":[60],"based":[61],"STate-Aware":[62],"framework":[64],"that":[65,131],"jointly":[66],"predicts":[67],"next-step":[68],"observations":[69],"estimates":[71,93],"the":[72,101,119],"corresponding":[73],"for":[76],"processes.":[81],"Specifically,":[82],"DRL-STAF":[83,117,132],"models":[84],"using":[88,97],"neural":[90],"networks":[91],"discrete":[94],"reinforcement":[98],"learning,":[99],"reducing":[100],"reliance":[102],"on":[103],"predefined":[104],"transition":[105],"structures":[106],"enabling":[108],"flexible":[109],"adaptation":[110],"diverse":[112],"temporal":[113],"dynamics.":[114],"In":[115],"particular,":[116],"mitigates":[118],"state-space":[120],"explosion":[121],"encountered":[122],"by":[123],"typical":[124],"HMM-based":[126],"methods.":[127],"Extensive":[128],"experiments":[129],"demonstrate":[130],"outperforms":[133],"HMM":[134],"variants,":[135],"standalone":[136],"models,":[139],"existing":[141],"DL-HMM":[142],"hybrids":[143],"in":[144],"most":[145],"cases,":[146],"while":[147],"also":[148],"providing":[149],"reliable":[150],"hidden-state":[151],"estimates.":[152]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-16T00:00:00"}
