{"id":"https://openalex.org/W7125918853","doi":"https://doi.org/10.1109/smc58881.2025.11342495","title":"Categorical Policies: Multimodal Policy Learning and Exploration in Continuous Control","display_name":"Categorical Policies: Multimodal Policy Learning and Exploration in Continuous Control","publication_year":2025,"publication_date":"2025-10-05","ids":{"openalex":"https://openalex.org/W7125918853","doi":"https://doi.org/10.1109/smc58881.2025.11342495"},"language":null,"primary_location":{"id":"doi:10.1109/smc58881.2025.11342495","is_oa":false,"landing_page_url":"https://doi.org/10.1109/smc58881.2025.11342495","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5124058995","display_name":"S M Mazharul Islam","orcid":null},"institutions":[{"id":"https://openalex.org/I189196454","display_name":"The University of Texas at Arlington","ror":"https://ror.org/019kgqr73","country_code":"US","type":"education","lineage":["https://openalex.org/I189196454"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"S M Mazharul Islam","raw_affiliation_strings":["University of Texas at Arlington,Department of Computer Science and Engineering,TX,USA,76019"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Texas at Arlington,Department of Computer Science and Engineering,TX,USA,76019","institution_ids":["https://openalex.org/I189196454"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5073400879","display_name":"Manfred Huber","orcid":null},"institutions":[{"id":"https://openalex.org/I189196454","display_name":"The University of Texas at Arlington","ror":"https://ror.org/019kgqr73","country_code":"US","type":"education","lineage":["https://openalex.org/I189196454"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Manfred Huber","raw_affiliation_strings":["University of Texas at Arlington,Department of Computer Science and Engineering,TX,USA,76019"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Texas at Arlington,Department of Computer Science and Engineering,TX,USA,76019","institution_ids":["https://openalex.org/I189196454"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I189196454"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"5236","last_page":"5241"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7009000182151794,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7009000182151794,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12814","display_name":"Gaussian Processes and Bayesian Inference","score":0.04800000041723251,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.038600001484155655,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/categorical-variable","display_name":"Categorical variable","score":0.8259999752044678},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6118999719619751},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.45980000495910645},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.3837999999523163},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.3698999881744385},{"id":"https://openalex.org/keywords/gaussian-process","display_name":"Gaussian process","score":0.36959999799728394},{"id":"https://openalex.org/keywords/differentiable-function","display_name":"Differentiable function","score":0.36890000104904175},{"id":"https://openalex.org/keywords/parameterized-complexity","display_name":"Parameterized complexity","score":0.3668000102043152},{"id":"https://openalex.org/keywords/gaussian","display_name":"Gaussian","score":0.3301999866962433}],"concepts":[{"id":"https://openalex.org/C5274069","wikidata":"https://www.wikidata.org/wiki/Q2285707","display_name":"Categorical variable","level":2,"score":0.8259999752044678},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6550999879837036},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6118999719619751},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5892999768257141},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5314000248908997},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.45980000495910645},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.3837999999523163},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.3698999881744385},{"id":"https://openalex.org/C61326573","wikidata":"https://www.wikidata.org/wiki/Q1496376","display_name":"Gaussian process","level":3,"score":0.36959999799728394},{"id":"https://openalex.org/C202615002","wikidata":"https://www.wikidata.org/wiki/Q783507","display_name":"Differentiable function","level":2,"score":0.36890000104904175},{"id":"https://openalex.org/C165464430","wikidata":"https://www.wikidata.org/wiki/Q1570441","display_name":"Parameterized complexity","level":2,"score":0.3668000102043152},{"id":"https://openalex.org/C163716315","wikidata":"https://www.wikidata.org/wiki/Q901177","display_name":"Gaussian","level":2,"score":0.3301999866962433},{"id":"https://openalex.org/C2780910867","wikidata":"https://www.wikidata.org/wiki/Q1952416","display_name":"Multimodality","level":2,"score":0.31679999828338623},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.3046000003814697},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.30079999566078186},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2971999943256378},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.2847000062465668},{"id":"https://openalex.org/C2779436431","wikidata":"https://www.wikidata.org/wiki/Q30672407","display_name":"Policy learning","level":2,"score":0.2808000147342682},{"id":"https://openalex.org/C86251818","wikidata":"https://www.wikidata.org/wiki/Q816754","display_name":"Benchmarking","level":2,"score":0.274399995803833},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.2721000015735626},{"id":"https://openalex.org/C2776036281","wikidata":"https://www.wikidata.org/wiki/Q48769818","display_name":"Constraint (computer-aided design)","level":2,"score":0.2685999870300293},{"id":"https://openalex.org/C8272713","wikidata":"https://www.wikidata.org/wiki/Q176737","display_name":"Stochastic process","level":2,"score":0.2671999931335449},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.2623000144958496},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.25949999690055847},{"id":"https://openalex.org/C79581498","wikidata":"https://www.wikidata.org/wiki/Q1367530","display_name":"Suite","level":2,"score":0.25540000200271606}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/smc58881.2025.11342495","is_oa":false,"landing_page_url":"https://doi.org/10.1109/smc58881.2025.11342495","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.7869541645050049}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":9,"referenced_works":["https://openalex.org/W1498436455","https://openalex.org/W2145339207","https://openalex.org/W2769883686","https://openalex.org/W2963523627","https://openalex.org/W2964227312","https://openalex.org/W2973229164","https://openalex.org/W2997902164","https://openalex.org/W4249244053","https://openalex.org/W4401109681"],"related_works":[],"abstract_inverted_index":{"A":[0],"policy":[1,37,174],"in":[2,70,79,217],"deep":[3],"reinforcement":[4],"learning":[5,49],"(RL),":[6],"either":[7,87],"deterministic":[8],"or":[9,57,93],"stochastic,":[10],"is":[11,68,124],"commonly":[12],"parameterized":[13],"as":[14,206],"a":[15,35,98,148,176,207],"Gaussian":[16,91,196],"distribution":[17,151,204],"alone,":[18],"limiting":[19],"the":[20,27,43,58,80,83,94,127,154,167,202],"learned":[21,189],"behavior":[22,111,155,215],"to":[23,47,63,108,152],"be":[24],"unimodal.":[25],"However,":[26],"nature":[28],"of":[29,42,82,97,178],"many":[30],"practical":[31],"decision-making":[32],"problems":[33],"favors":[34],"multimodal":[36,110,173,214],"that":[38,123,135,184,201],"facilitates":[39],"robust":[40],"exploration":[41,75,212],"environment":[44],"and":[45,118,193,213],"thus":[46],"address":[48],"challenges":[50],"arising":[51],"from":[52],"sparse":[53],"rewards,":[54],"complex":[55],"dynamics,":[56],"need":[59],"for":[60,210],"strategic":[61],"adaptation":[62],"varying":[64],"contexts.":[65],"This":[66],"issue":[67],"exacerbated":[69],"continuous":[71,218],"control":[72],"domains":[73],"where":[74],"usually":[76],"takes":[77],"place":[78],"vicinity":[81],"predicted":[84],"optimal":[85],"action,":[86],"through":[88,185],"an":[89,114],"additive":[90],"noise":[92],"sampling":[95,133,168],"process":[96],"stochastic":[99],"policy.":[100],"In":[101],"this":[102],"paper,":[103],"we":[104],"introduce":[105],"Categorical":[106,203],"Policies":[107],"model":[109],"modes":[112],"with":[113],"intermediate":[115],"categorical":[116,150],"distribution,":[117],"then":[119],"generate":[120],"output":[121],"action":[122],"conditioned":[125],"on":[126,175],"sampled":[128],"mode.":[129],"We":[130,170],"explore":[131],"two":[132],"schemes":[134],"ensure":[136],"differentiable":[137,165],"discrete":[138],"latent":[139,149],"structure":[140],"while":[141,162],"maintaining":[142],"efficient":[143],"gradient-based":[144],"optimization.":[145],"By":[146],"utilizing":[147],"select":[153],"mode,":[156],"our":[157,172,188],"approach":[158],"naturally":[159],"expresses":[160],"multimodality":[161],"remaining":[163],"fully":[164],"via":[166],"tricks.":[169],"evaluate":[171],"set":[177],"DeepMind":[179],"Control":[180],"Suite":[181],"environments,":[182],"demonstrating":[183],"better":[186],"exploration,":[187],"policies":[190],"converge":[191],"faster":[192],"outperform":[194],"standard":[195],"policies.":[197],"Our":[198],"results":[199],"indicate":[200],"serves":[205],"powerful":[208],"tool":[209],"structured":[211],"representation":[216],"control.":[219]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2026-01-29T00:00:00"}
