{"id":"https://openalex.org/W3210735129","doi":"https://doi.org/10.1109/ssci50451.2021.9660123","title":"Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution","display_name":"Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution","publication_year":2021,"publication_date":"2021-12-05","ids":{"openalex":"https://openalex.org/W3210735129","doi":"https://doi.org/10.1109/ssci50451.2021.9660123","mag":"3210735129"},"language":"en","primary_location":{"id":"doi:10.1109/ssci50451.2021.9660123","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ssci50451.2021.9660123","pdf_url":null,"source":{"id":"https://openalex.org/S4363604921","display_name":"2021 IEEE Symposium Series on Computational Intelligence (SSCI)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2021 IEEE Symposium Series on Computational Intelligence (SSCI)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5038364076","display_name":"Irving G. B. Petrazzini","orcid":null},"institutions":[{"id":"https://openalex.org/I4104125","display_name":"Universidade Federal de Santa Catarina","ror":"https://ror.org/041akq887","country_code":"BR","type":"education","lineage":["https://openalex.org/I4104125"]}],"countries":["BR"],"is_corresponding":false,"raw_author_name":"Irving G. B. Petrazzini","raw_affiliation_strings":["Automation and Systems Engineering, Federal University of Santa Catarina, Florian\u00f3polis, Santa Catarina"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Automation and Systems Engineering, Federal University of Santa Catarina, Florian\u00f3polis, Santa Catarina","institution_ids":["https://openalex.org/I4104125"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5053429698","display_name":"Eric Aislan Antonelo","orcid":"https://orcid.org/0000-0002-7285-0974"},"institutions":[{"id":"https://openalex.org/I4104125","display_name":"Universidade Federal de Santa Catarina","ror":"https://ror.org/041akq887","country_code":"BR","type":"education","lineage":["https://openalex.org/I4104125"]}],"countries":["BR"],"is_corresponding":false,"raw_author_name":"Eric A. Antonelo","raw_affiliation_strings":["Automation and Systems Engineering, Federal University of Santa Catarina, Florian\u00f3polis, Santa Catarina"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Automation and Systems Engineering, Federal University of Santa Catarina, Florian\u00f3polis, Santa Catarina","institution_ids":["https://openalex.org/I4104125"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I4104125"],"apc_list":null,"apc_paid":null,"fwci":1.4653,"has_fulltext":false,"cited_by_count":20,"citation_normalized_percentile":{"value":0.85643792,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":99},"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"8"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10036","display_name":"Advanced Neural Network Applications","score":0.9980000257492065,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.9968000054359436,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.6535845994949341},{"id":"https://openalex.org/keywords/gaussian-process","display_name":"Gaussian process","score":0.6468622088432312},{"id":"https://openalex.org/keywords/bounded-function","display_name":"Bounded function","score":0.5680093765258789},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.5640764236450195},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.5545531511306763},{"id":"https://openalex.org/keywords/gaussian","display_name":"Gaussian","score":0.5532233715057373},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.47964054346084595},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.43973255157470703},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.43609312176704407},{"id":"https://openalex.org/keywords/distribution","display_name":"Distribution (mathematics)","score":0.4352743327617645},{"id":"https://openalex.org/keywords/beta-distribution","display_name":"Beta distribution","score":0.4338460862636566},{"id":"https://openalex.org/keywords/space","display_name":"Space (punctuation)","score":0.42530637979507446},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.3552456796169281},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.32271939516067505},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.28723156452178955},{"id":"https://openalex.org/keywords/statistics","display_name":"Statistics","score":0.12016385793685913},{"id":"https://openalex.org/keywords/mathematical-analysis","display_name":"Mathematical analysis","score":0.0821295976638794}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.6535845994949341},{"id":"https://openalex.org/C61326573","wikidata":"https://www.wikidata.org/wiki/Q1496376","display_name":"Gaussian process","level":3,"score":0.6468622088432312},{"id":"https://openalex.org/C34388435","wikidata":"https://www.wikidata.org/wiki/Q2267362","display_name":"Bounded function","level":2,"score":0.5680093765258789},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.5640764236450195},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.5545531511306763},{"id":"https://openalex.org/C163716315","wikidata":"https://www.wikidata.org/wiki/Q901177","display_name":"Gaussian","level":2,"score":0.5532233715057373},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.47964054346084595},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.43973255157470703},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.43609312176704407},{"id":"https://openalex.org/C110121322","wikidata":"https://www.wikidata.org/wiki/Q865811","display_name":"Distribution (mathematics)","level":2,"score":0.4352743327617645},{"id":"https://openalex.org/C21621910","wikidata":"https://www.wikidata.org/wiki/Q756254","display_name":"Beta distribution","level":2,"score":0.4338460862636566},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.42530637979507446},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3552456796169281},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.32271939516067505},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.28723156452178955},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.12016385793685913},{"id":"https://openalex.org/C134306372","wikidata":"https://www.wikidata.org/wiki/Q7754","display_name":"Mathematical analysis","level":1,"score":0.0821295976638794},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C50522688","wikidata":"https://www.wikidata.org/wiki/Q189833","display_name":"Economic growth","level":1,"score":0.0},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ssci50451.2021.9660123","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ssci50451.2021.9660123","pdf_url":null,"source":{"id":"https://openalex.org/S4363604921","display_name":"2021 IEEE Symposium Series on Computational Intelligence (SSCI)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2021 IEEE Symposium Series on Computational Intelligence (SSCI)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321091","display_name":"Coordena\u00e7\u00e3o de Aperfei\u00e7oamento de Pessoal de N\u00edvel Superior","ror":"https://ror.org/00x0ma614"}],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W1191599655","https://openalex.org/W1522301498","https://openalex.org/W1771410628","https://openalex.org/W2145339207","https://openalex.org/W2155027007","https://openalex.org/W2556958149","https://openalex.org/W2736601468","https://openalex.org/W2740828027","https://openalex.org/W2766447205","https://openalex.org/W2890208753","https://openalex.org/W2919115771","https://openalex.org/W2953072278","https://openalex.org/W2953319219","https://openalex.org/W2954989419","https://openalex.org/W2963095800","https://openalex.org/W2964043796","https://openalex.org/W2964121744","https://openalex.org/W3033375418","https://openalex.org/W3037207827","https://openalex.org/W3118619025","https://openalex.org/W4287902386","https://openalex.org/W4288333794","https://openalex.org/W6627932998","https://openalex.org/W6631190155","https://openalex.org/W6638018090","https://openalex.org/W6683204974","https://openalex.org/W6692846177","https://openalex.org/W6730111887","https://openalex.org/W6741002519","https://openalex.org/W6741471465","https://openalex.org/W6764965709","https://openalex.org/W6778961322"],"related_works":["https://openalex.org/W4362501864","https://openalex.org/W4306904969","https://openalex.org/W2138720691","https://openalex.org/W4380318855","https://openalex.org/W2031695474","https://openalex.org/W2586732548","https://openalex.org/W3049728571","https://openalex.org/W20361778","https://openalex.org/W2169866437","https://openalex.org/W1964286703"],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"methods":[2,18],"for":[3,26,65],"continuous":[4,98],"control":[5,99],"tasks":[6,100],"have":[7,44],"evolved":[8],"in":[9,116],"recent":[10],"years":[11],"generating":[12],"a":[13,23,28,45,72],"family":[14],"of":[15,118,130],"policy":[16,67,83,109,115],"gradient":[17],"that":[19,55],"rely":[20],"primarily":[21],"on":[22,96],"Gaussian":[24,33,114,152],"distribution":[25,34,62],"modeling":[27],"stochastic":[29],"policy.":[30,153],"However,":[31],"the":[32,60,66,90,107,113,131,135,142,151],"has":[35],"an":[36,52],"infinite":[37],"support,":[38],"whereas":[39],"real":[40],"world":[41],"applications":[42],"usually":[43],"bounded":[46],"action":[47],"space.":[48],"This":[49],"dissonance":[50],"causes":[51],"estimation":[53],"bias":[54],"can":[56],"be":[57],"eliminated":[58],"if":[59],"Beta":[61,82,108],"is":[63,87,110],"used":[64],"instead,":[68],"as":[69],"it":[70,86],"presents":[71],"finite":[73],"support.":[74],"In":[75],"this":[76,81],"work,":[77],"we":[78],"investigate":[79],"how":[80],"performs":[84],"when":[85],"trained":[88],"by":[89,148],"Proximal":[91],"Policy":[92],"Optimization":[93],"(PPO)":[94],"algorithm":[95],"two":[97],"from":[101],"OpenAI":[102],"gym.":[103],"For":[104,134],"both":[105],"tasks,":[106],"superior":[111],"to":[112],"terms":[117],"agent's":[119,143],"final":[120],"expected":[121],"reward,":[122],"also":[123],"showing":[124],"more":[125],"stability":[126],"and":[127],"faster":[128],"convergence":[129],"training":[132],"process.":[133],"CarRacing":[136],"environment":[137],"with":[138],"high-dimensional":[139],"image":[140],"input,":[141],"success":[144],"rate":[145],"was":[146],"improved":[147],"63%":[149],"over":[150]},"counts_by_year":[{"year":2026,"cited_by_count":4},{"year":2025,"cited_by_count":6},{"year":2024,"cited_by_count":6},{"year":2023,"cited_by_count":3},{"year":2022,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
