{"id":"https://openalex.org/W7124148314","doi":"https://doi.org/10.1109/codit66093.2025.11321834","title":"Benchmarking Model-Free Reinforcement Learning Algorithms for Robotic Manipulation","display_name":"Benchmarking Model-Free Reinforcement Learning Algorithms for Robotic Manipulation","publication_year":2025,"publication_date":"2025-07-15","ids":{"openalex":"https://openalex.org/W7124148314","doi":"https://doi.org/10.1109/codit66093.2025.11321834"},"language":null,"primary_location":{"id":"doi:10.1109/codit66093.2025.11321834","is_oa":false,"landing_page_url":"https://doi.org/10.1109/codit66093.2025.11321834","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 11th International Conference on Control, Decision and Information Technologies (CoDIT)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5123021672","display_name":"Ngoc Quoc Huy Hoang","orcid":null},"institutions":[{"id":"https://openalex.org/I83041830","display_name":"Deggendorf Institute of Technology","ror":"https://ror.org/02kw5st29","country_code":"DE","type":"education","lineage":["https://openalex.org/I83041830"]}],"countries":["DE"],"is_corresponding":false,"raw_author_name":"Ngoc Quoc Huy Hoang","raw_affiliation_strings":["Deggendorf Institute of Technology, Technology Campus Cham,Cham,Germany,93413"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Deggendorf Institute of Technology, Technology Campus Cham,Cham,Germany,93413","institution_ids":["https://openalex.org/I83041830"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5123010053","display_name":"Yasaman Mohammadidargah","orcid":null},"institutions":[{"id":"https://openalex.org/I83041830","display_name":"Deggendorf Institute of Technology","ror":"https://ror.org/02kw5st29","country_code":"DE","type":"education","lineage":["https://openalex.org/I83041830"]}],"countries":["DE"],"is_corresponding":false,"raw_author_name":"Yasaman Mohammadidargah","raw_affiliation_strings":["Deggendorf Institute of Technology, Technology Campus Cham,Cham,Germany,93413"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Deggendorf Institute of Technology, Technology Campus Cham,Cham,Germany,93413","institution_ids":["https://openalex.org/I83041830"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5051035411","display_name":"Dmitrii Dobriborsci","orcid":"https://orcid.org/0000-0002-1091-7459"},"institutions":[{"id":"https://openalex.org/I83041830","display_name":"Deggendorf Institute of Technology","ror":"https://ror.org/02kw5st29","country_code":"DE","type":"education","lineage":["https://openalex.org/I83041830"]}],"countries":["DE"],"is_corresponding":false,"raw_author_name":"Dmitrii Dobriborsci","raw_affiliation_strings":["Deggendorf Institute of Technology, Technology Campus Cham,Cham,Germany,93413"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Deggendorf Institute of Technology, Technology Campus Cham,Cham,Germany,93413","institution_ids":["https://openalex.org/I83041830"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I83041830"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.62899337,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"5"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.590399980545044,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.590399980545044,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.3465999960899353,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10982","display_name":"Motor Control and Adaptation","score":0.016599999740719795,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/benchmarking","display_name":"Benchmarking","score":0.8129000067710876},{"id":"https://openalex.org/keywords/benchmark","display_name":"Benchmark (surveying)","score":0.7538999915122986},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7483999729156494},{"id":"https://openalex.org/keywords/robotics","display_name":"Robotics","score":0.47110000252723694},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.38749998807907104},{"id":"https://openalex.org/keywords/action-selection","display_name":"Action selection","score":0.3871999979019165}],"concepts":[{"id":"https://openalex.org/C86251818","wikidata":"https://www.wikidata.org/wiki/Q816754","display_name":"Benchmarking","level":2,"score":0.8129000067710876},{"id":"https://openalex.org/C185798385","wikidata":"https://www.wikidata.org/wiki/Q1161707","display_name":"Benchmark (surveying)","level":2,"score":0.7538999915122986},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7483999729156494},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6474000215530396},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6129000186920166},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5424000024795532},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.47110000252723694},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.38749998807907104},{"id":"https://openalex.org/C166109690","wikidata":"https://www.wikidata.org/wiki/Q4677422","display_name":"Action selection","level":3,"score":0.3871999979019165},{"id":"https://openalex.org/C81917197","wikidata":"https://www.wikidata.org/wiki/Q628760","display_name":"Selection (genetic algorithm)","level":2,"score":0.3596999943256378},{"id":"https://openalex.org/C150415221","wikidata":"https://www.wikidata.org/wiki/Q40687","display_name":"Robotic arm","level":2,"score":0.34220001101493835},{"id":"https://openalex.org/C34585555","wikidata":"https://www.wikidata.org/wiki/Q1368723","display_name":"Learning curve","level":2,"score":0.34150001406669617},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.3066999912261963},{"id":"https://openalex.org/C18762648","wikidata":"https://www.wikidata.org/wiki/Q42213","display_name":"Work (physics)","level":2,"score":0.29499998688697815},{"id":"https://openalex.org/C2985527887","wikidata":"https://www.wikidata.org/wiki/Q1587588","display_name":"Robot manipulator","level":3,"score":0.27900001406669617}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/codit66093.2025.11321834","is_oa":false,"landing_page_url":"https://doi.org/10.1109/codit66093.2025.11321834","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 11th International Conference on Control, Decision and Information Technologies (CoDIT)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":2,"referenced_works":["https://openalex.org/W1977655452","https://openalex.org/W2949676527"],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"Learning":[1],"(RL)":[2],"is":[3],"increasingly":[4],"transitioning":[5],"from":[6],"controlled":[7],"simulation":[8],"environments":[9],"to":[10,29,126],"real-world":[11],"robotic":[12,31,53,77],"applications.":[13],"However,":[14],"this":[15,39],"shift":[16],"presents":[17],"a":[18,75,144],"major":[19],"challenge:":[20],"designing":[21],"effective":[22],"reward":[23,47,88,118],"functions":[24],"and":[25,35,49,61,72,86,90,97,112,133,139],"training":[26,95],"procedures":[27],"tailored":[28],"specific":[30],"tasks":[32,129],"remains":[33],"time-consuming":[34],"largely":[36],"empirical.":[37],"In":[38],"work-in-progress":[40],"study,":[41],"we":[42],"investigate":[43],"the":[44,80,104,114,124],"impact":[45],"of":[46,106,116],"shaping":[48],"algorithm":[50],"selection":[51],"on":[52,56,94,143],"manipulation,":[54],"focusing":[55],"two":[57],"foundational":[58],"skills:":[59],"reaching":[60],"pushing.":[62],"We":[63,83],"benchmark":[64,125],"five":[65],"RL":[66],"algorithms":[67],"PPO,":[68],"SAC,":[69],"SAC-HER,":[70],"DDPG,":[71],"DDPG-HER":[73],"using":[74],"UR10":[76,146],"arm":[78],"in":[79,109],"PyBullet":[81],"simulator.":[82],"compare":[84],"sparse":[85],"dense":[87],"formulations":[89],"analyze":[91],"their":[92],"influence":[93],"dynamics":[96],"preliminary":[98],"success":[99],"rates.":[100],"Our":[101],"results":[102],"demonstrate":[103],"effectiveness":[105],"hindsight-based":[107],"approaches":[108],"sparse-reward":[110],"scenarios":[111],"highlight":[113],"importance":[115],"proper":[117],"design.":[119],"Ongoing":[120],"work":[121],"includes":[122],"extending":[123],"more":[127],"complex":[128],"such":[130],"as":[131],"sliding":[132],"pick-and-move,":[134],"exploring":[135],"hierarchical":[136],"learning":[137],"methods,":[138],"validating":[140],"sim-toreal":[141],"transfer":[142],"physical":[145],"platform.":[147]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-01-15T00:00:00"}
