{"id":"https://openalex.org/W1972854615","doi":"https://doi.org/10.1109/coase.2014.6899476","title":"Adaptive reinforcement learning in box-pushing robots","display_name":"Adaptive reinforcement learning in box-pushing robots","publication_year":2014,"publication_date":"2014-08-01","ids":{"openalex":"https://openalex.org/W1972854615","doi":"https://doi.org/10.1109/coase.2014.6899476","mag":"1972854615"},"language":"en","primary_location":{"id":"doi:10.1109/coase.2014.6899476","is_oa":false,"landing_page_url":"https://doi.org/10.1109/coase.2014.6899476","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2014 IEEE International Conference on Automation Science and Engineering (CASE)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5061189209","display_name":"Kao\u2010Shing Hwang","orcid":"https://orcid.org/0000-0001-9234-4836"},"institutions":[{"id":"https://openalex.org/I142974352","display_name":"National Sun Yat-sen University","ror":"https://ror.org/00mjawt10","country_code":"TW","type":"education","lineage":["https://openalex.org/I142974352"]}],"countries":["TW"],"is_corresponding":false,"raw_author_name":"K. S. Hwang","raw_affiliation_strings":["Department of Electrical Engineering, National Sun Yat-sen University, Kaoshiung, Taiwan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Electrical Engineering, National Sun Yat-sen University, Kaoshiung, Taiwan","institution_ids":["https://openalex.org/I142974352"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5017255446","display_name":"Jiahao Ling","orcid":null},"institutions":[{"id":"https://openalex.org/I68348662","display_name":"Shih Hsin University","ror":"https://ror.org/03ynprv96","country_code":"TW","type":"education","lineage":["https://openalex.org/I68348662"]}],"countries":["TW"],"is_corresponding":false,"raw_author_name":"J. L. Ling","raw_affiliation_strings":["Department of Information Management, Shih Hsin University, Taipei, Taiwan","Department of Information Management, Shih Hsin University, Taipei 11678, Taiwan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Information Management, Shih Hsin University, Taipei, Taiwan","institution_ids":["https://openalex.org/I68348662"]},{"raw_affiliation_string":"Department of Information Management, Shih Hsin University, Taipei 11678, Taiwan","institution_ids":["https://openalex.org/I68348662"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5026962086","display_name":"Wei-Han Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wei-Han Wang","raw_affiliation_strings":["Precision Machinery Research & Development Center, Taiwan"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Precision Machinery Research & Development Center, Taiwan","institution_ids":[]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.2068,"has_fulltext":false,"cited_by_count":8,"citation_normalized_percentile":{"value":0.43323925,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":89,"max":97},"biblio":{"volume":"19","issue":null,"first_page":"1182","last_page":"1187"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9983999729156494,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9983999729156494,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10879","display_name":"Robotic Locomotion and Control","score":0.9958999752998352,"subfield":{"id":"https://openalex.org/subfields/2204","display_name":"Biomedical Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11663","display_name":"Viral Infectious Diseases and Gene Expression in Insects","score":0.9902999997138977,"subfield":{"id":"https://openalex.org/subfields/1312","display_name":"Molecular Biology"},"field":{"id":"https://openalex.org/fields/13","display_name":"Biochemistry, Genetics and Molecular Biology"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8839305639266968},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.737520694732666},{"id":"https://openalex.org/keywords/humanoid-robot","display_name":"Humanoid robot","score":0.6557434797286987},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.638856828212738},{"id":"https://openalex.org/keywords/robot-learning","display_name":"Robot learning","score":0.5402389168739319},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.534065306186676},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.4617166221141815},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.43354111909866333},{"id":"https://openalex.org/keywords/q-learning","display_name":"Q-learning","score":0.4315512180328369},{"id":"https://openalex.org/keywords/mobile-robot","display_name":"Mobile robot","score":0.28477993607521057},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.1737266480922699},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.15825462341308594}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8839305639266968},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.737520694732666},{"id":"https://openalex.org/C60692881","wikidata":"https://www.wikidata.org/wiki/Q584529","display_name":"Humanoid robot","level":3,"score":0.6557434797286987},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.638856828212738},{"id":"https://openalex.org/C188888258","wikidata":"https://www.wikidata.org/wiki/Q7353390","display_name":"Robot learning","level":4,"score":0.5402389168739319},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.534065306186676},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.4617166221141815},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.43354111909866333},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.4315512180328369},{"id":"https://openalex.org/C19966478","wikidata":"https://www.wikidata.org/wiki/Q4810574","display_name":"Mobile robot","level":3,"score":0.28477993607521057},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.1737266480922699},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.15825462341308594},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/coase.2014.6899476","is_oa":false,"landing_page_url":"https://doi.org/10.1109/coase.2014.6899476","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2014 IEEE International Conference on Automation Science and Engineering (CASE)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Partnerships for the goals","id":"https://metadata.un.org/sdg/17","score":0.47999998927116394}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":22,"referenced_works":["https://openalex.org/W1552830313","https://openalex.org/W1640646391","https://openalex.org/W1783866091","https://openalex.org/W1822203717","https://openalex.org/W2021254611","https://openalex.org/W2072931156","https://openalex.org/W2073320424","https://openalex.org/W2075754841","https://openalex.org/W2097082695","https://openalex.org/W2103902778","https://openalex.org/W2107726111","https://openalex.org/W2121863487","https://openalex.org/W2124175081","https://openalex.org/W2124491905","https://openalex.org/W2134879823","https://openalex.org/W2155027007","https://openalex.org/W2914656440","https://openalex.org/W4214717370","https://openalex.org/W6636932949","https://openalex.org/W6638076483","https://openalex.org/W6678114464","https://openalex.org/W6683204974"],"related_works":["https://openalex.org/W2808418668","https://openalex.org/W4287865573","https://openalex.org/W2807018115","https://openalex.org/W2051622126","https://openalex.org/W2025663273","https://openalex.org/W3007324819","https://openalex.org/W1987864653","https://openalex.org/W2752941321","https://openalex.org/W1574958246","https://openalex.org/W2104958792"],"abstract_inverted_index":{"In":[0],"this":[1],"paper,":[2],"an":[3],"adaptive":[4,66,164],"state":[5,42,67],"aggregation":[6],"Q-Learning":[7,161],"method,":[8],"with":[9,113],"the":[10,19,41,71,85,100,109,114,116,121,125,127,142,145,149,152,160],"capability":[11],"of":[12,21,73,87,102],"multi-agent":[13],"cooperation,":[14],"was":[15,37,81,97],"proposed":[16,82,153],"to":[17,27,39,45,83,130,133,144],"enhance":[18],"efficiency":[20,86,158],"reinforcement":[22,49,88],"learning":[23,89,157],"(RL)":[24],"and":[25,120,140],"applied":[26,38],"box-pushing":[28],"tasks":[29],"for":[30],"humanoid":[31,92],"robots.":[32],"First,":[33],"a":[34,53,62,91,95,103,106],"decision":[35],"tree":[36],"partition":[40],"space":[43],"according":[44],"temporary":[46],"differences":[47],"in":[48],"learning,":[50],"so":[51],"that":[52],"real":[54],"valued":[55],"action":[56],"domain":[57],"could":[58],"be":[59],"represented":[60],"by":[61,76],"discrete":[63],"space.":[64],"Furthermore,":[65],"Q-Learning,":[68],"which":[69],"is":[70],"modification":[72],"estimating":[74],"Q-value":[75],"tabular":[77],"or":[78],"function":[79],"approximation,":[80],"demonstrate":[84],"when":[90],"robot":[93,104,117,128],"pushing":[94,105,122],"box":[96,110,143],"simulated.":[98],"During":[99],"process":[101],"box,":[107,126],"because":[108],"moves":[111],"along":[112],"direction":[115],"asserts":[118],"force":[119],"point":[123],"on":[124],"needs":[129],"learn":[131],"how":[132],"adjust":[134],"angles,":[135],"avoid":[136],"obstacles,":[137],"keep":[138],"gravity,":[139],"push":[141],"target":[146],"point.":[147],"From":[148],"simulation":[150],"results,":[151],"method":[154],"shows":[155],"its":[156],"outperforms":[159],"without":[162],"using":[163],"states.":[165]},"counts_by_year":[{"year":2025,"cited_by_count":1},{"year":2024,"cited_by_count":1},{"year":2022,"cited_by_count":1},{"year":2021,"cited_by_count":1},{"year":2018,"cited_by_count":3},{"year":2016,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
