{"id":"https://openalex.org/W3111597472","doi":"https://doi.org/10.1109/smc42975.2020.9282873","title":"A Probabilistic Online Policy Estimator for Autonomous Systems Planning and Decision Making","display_name":"A Probabilistic Online Policy Estimator for Autonomous Systems Planning and Decision Making","publication_year":2020,"publication_date":"2020-10-11","ids":{"openalex":"https://openalex.org/W3111597472","doi":"https://doi.org/10.1109/smc42975.2020.9282873","mag":"3111597472"},"language":"en","primary_location":{"id":"doi:10.1109/smc42975.2020.9282873","is_oa":false,"landing_page_url":"https://doi.org/10.1109/smc42975.2020.9282873","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2020 IEEE International Conference on Systems, Man, and Cybernetics (SMC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5042700188","display_name":"Parisa Pouya","orcid":"https://orcid.org/0000-0002-8055-2002"},"institutions":[{"id":"https://openalex.org/I1174212","display_name":"University of Southern California","ror":"https://ror.org/03taz7m60","country_code":"US","type":"education","lineage":["https://openalex.org/I1174212"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Parisa Pouya","raw_affiliation_strings":["University of Southern California, Los Angeles, CA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Southern California, Los Angeles, CA, USA","institution_ids":["https://openalex.org/I1174212"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5053541626","display_name":"Azad M. Madni","orcid":"https://orcid.org/0000-0001-5225-0034"},"institutions":[{"id":"https://openalex.org/I1174212","display_name":"University of Southern California","ror":"https://ror.org/03taz7m60","country_code":"US","type":"education","lineage":["https://openalex.org/I1174212"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Azad M. Madni","raw_affiliation_strings":["University of Southern California, Los Angeles, CA, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Southern California, Los Angeles, CA, USA","institution_ids":["https://openalex.org/I1174212"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I1174212"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":3,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"2933","last_page":"2938"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11303","display_name":"Bayesian Modeling and Causal Inference","score":0.9976000189781189,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11303","display_name":"Bayesian Modeling and Causal Inference","score":0.9976000189781189,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12423","display_name":"Software Reliability and Analysis Research","score":0.9943000078201294,"subfield":{"id":"https://openalex.org/subfields/1712","display_name":"Software"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.9922999739646912,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7284253835678101},{"id":"https://openalex.org/keywords/heuristics","display_name":"Heuristics","score":0.7076740264892578},{"id":"https://openalex.org/keywords/partially-observable-markov-decision-process","display_name":"Partially observable Markov decision process","score":0.6676762104034424},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.6080343723297119},{"id":"https://openalex.org/keywords/probabilistic-logic","display_name":"Probabilistic logic","score":0.5560101866722107},{"id":"https://openalex.org/keywords/executable","display_name":"Executable","score":0.5104014277458191},{"id":"https://openalex.org/keywords/estimator","display_name":"Estimator","score":0.42936745285987854},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.41537076234817505},{"id":"https://openalex.org/keywords/online-algorithm","display_name":"Online algorithm","score":0.41331595182418823},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.3945881724357605},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.39147159457206726},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.34364455938339233},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.32603901624679565},{"id":"https://openalex.org/keywords/markov-chain","display_name":"Markov chain","score":0.276816725730896},{"id":"https://openalex.org/keywords/markov-model","display_name":"Markov model","score":0.21078485250473022},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.14761406183242798}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7284253835678101},{"id":"https://openalex.org/C127705205","wikidata":"https://www.wikidata.org/wiki/Q5748245","display_name":"Heuristics","level":2,"score":0.7076740264892578},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.6676762104034424},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.6080343723297119},{"id":"https://openalex.org/C49937458","wikidata":"https://www.wikidata.org/wiki/Q2599292","display_name":"Probabilistic logic","level":2,"score":0.5560101866722107},{"id":"https://openalex.org/C160145156","wikidata":"https://www.wikidata.org/wiki/Q778586","display_name":"Executable","level":2,"score":0.5104014277458191},{"id":"https://openalex.org/C185429906","wikidata":"https://www.wikidata.org/wiki/Q1130160","display_name":"Estimator","level":2,"score":0.42936745285987854},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.41537076234817505},{"id":"https://openalex.org/C196921405","wikidata":"https://www.wikidata.org/wiki/Q786431","display_name":"Online algorithm","level":2,"score":0.41331595182418823},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3945881724357605},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.39147159457206726},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.34364455938339233},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.32603901624679565},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.276816725730896},{"id":"https://openalex.org/C163836022","wikidata":"https://www.wikidata.org/wiki/Q6771326","display_name":"Markov model","level":3,"score":0.21078485250473022},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.14761406183242798},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/smc42975.2020.9282873","is_oa":false,"landing_page_url":"https://doi.org/10.1109/smc42975.2020.9282873","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2020 IEEE International Conference on Systems, Man, and Cybernetics (SMC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.75,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W32403112","https://openalex.org/W52153049","https://openalex.org/W1498235675","https://openalex.org/W1532688806","https://openalex.org/W1581055761","https://openalex.org/W1603551967","https://openalex.org/W2012664173","https://openalex.org/W2032100464","https://openalex.org/W2061226732","https://openalex.org/W2096976789","https://openalex.org/W2101421095","https://openalex.org/W2134802714","https://openalex.org/W2144913588","https://openalex.org/W2171084228","https://openalex.org/W2770795122","https://openalex.org/W2795496197","https://openalex.org/W2886076544","https://openalex.org/W2897126250","https://openalex.org/W2950906090","https://openalex.org/W2952258289","https://openalex.org/W2953074437","https://openalex.org/W2998667194","https://openalex.org/W3003520093","https://openalex.org/W3046960330","https://openalex.org/W3098184036","https://openalex.org/W4220902314","https://openalex.org/W6629701075","https://openalex.org/W6631864160","https://openalex.org/W6674694606","https://openalex.org/W6679977494","https://openalex.org/W6684973485","https://openalex.org/W6809635482"],"related_works":["https://openalex.org/W2096013579","https://openalex.org/W52153049","https://openalex.org/W1760611253","https://openalex.org/W1589140671","https://openalex.org/W1515117609","https://openalex.org/W4323315247","https://openalex.org/W2294884454","https://openalex.org/W3169161914","https://openalex.org/W4321379664","https://openalex.org/W2211790881"],"abstract_inverted_index":{"Partially":[0],"Observable":[1],"Markov":[2],"Decision":[3],"Process":[4],"(POMDP)":[5],"models":[6,36],"are":[7,149],"a":[8,67,77,81,94,130,156],"popular":[9],"probabilistic":[10],"modeling":[11],"method":[12],"for":[13,33,144,169,216],"continuous":[14],"planning":[15],"in":[16,20,54,91,160,208],"systems":[17],"that":[18,136,185],"operate":[19],"partially":[21],"observable,":[22],"uncertain":[23],"environments.":[24],"This":[25,58],"paper":[26],"presents":[27],"an":[28],"online":[29,119,138,167],"algorithm,":[30,115],"N-Step":[31,123],"Look-Ahead,":[32],"solving":[34],"POMDP":[35,218],"with":[37,93,125],"specific":[38],"characteristics:":[39],"flexible":[40],"state-space,":[41],"dynamic":[42],"model":[43],"parameters":[44],"(e.g.":[45,51],"probability":[46],"distributions),":[47],"and":[48,75,102,177,213],"real-time":[49],"constraints":[50],"response":[52],"needed":[53],"fractions":[55],"of":[56,113,210],"seconds).":[57],"algorithm":[59,139,176],"computes":[60],"the":[61,71,111,118,137,161,188,205],"best":[62],"executable":[63],"policy":[64],"by":[65,153],"creating":[66],"belief-tree":[68],"starting":[69],"from":[70,122,184,187,200],"current":[72],"belief":[73,107,147,162,172],"state":[74],"employing":[76],"look-ahead":[78],"search":[79],"over":[80],"finite":[82],"time":[83,212],"horizon.":[84],"To":[85,109],"address":[86],"time-accuracy":[87],"trade-offs,":[88],"various":[89],"heuristics":[90,196],"combination":[92],"distance-based":[95],"clustering":[96],"technique":[97],"is":[98],"employed":[99],"to":[100,203],"expand":[101],"explore":[103],"only":[104,155],"high":[105],"value":[106],"nodes.":[108],"evaluate":[110],"accuracy":[112],"our":[114,175],"we":[116,192],"compare":[117],"policies":[120,127,143,168],"computed":[121],"Look-Ahead":[124,207],"offline":[126,189],"calculated":[128],"using":[129,174],"customized":[131],"Q-learning":[132,201],"algorithm.":[133,190],"We":[134,164],"show":[135,193],"can":[140,181,197],"compute":[141],"optimal":[142],"beliefs,":[145],"where":[146],"probabilities":[148],"not":[150],"normally":[151,170],"distributed,":[152],"looking":[154],"few":[157],"steps":[158],"ahead":[159],"tree.":[163],"discuss":[165],"computing":[166],"distributed":[171],"states":[173],"explain":[178],"why":[179],"they":[180],"be":[182,198],"different":[183],"obtained":[186],"Finally,":[191],"how":[194],"useful":[195],"developed":[199],"results":[202],"improve":[204],"N-Sep":[206],"terms":[209],"computation":[211],"accuracy,":[214],"especially":[215],"large":[217],"models.":[219]},"counts_by_year":[{"year":2022,"cited_by_count":1},{"year":2021,"cited_by_count":2}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
