{"id":"https://openalex.org/W2785314333","doi":"https://doi.org/10.1109/ascc.2017.8287315","title":"Vision-based deep reinforcement learning to control a manipulator","display_name":"Vision-based deep reinforcement learning to control a manipulator","publication_year":2017,"publication_date":"2017-12-01","ids":{"openalex":"https://openalex.org/W2785314333","doi":"https://doi.org/10.1109/ascc.2017.8287315","mag":"2785314333"},"language":"en","primary_location":{"id":"doi:10.1109/ascc.2017.8287315","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ascc.2017.8287315","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2017 11th Asian Control Conference (ASCC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5088068728","display_name":"Wonchul Kim","orcid":"https://orcid.org/0000-0003-2476-1827"},"institutions":[{"id":"https://openalex.org/I139264467","display_name":"Seoul National University","ror":"https://ror.org/04h9pn542","country_code":"KR","type":"education","lineage":["https://openalex.org/I139264467"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Wonchul Kim","raw_affiliation_strings":["Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea","institution_ids":["https://openalex.org/I139264467"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100329542","display_name":"Taewan Kim","orcid":"https://orcid.org/0000-0003-3319-7797"},"institutions":[{"id":"https://openalex.org/I139264467","display_name":"Seoul National University","ror":"https://ror.org/04h9pn542","country_code":"KR","type":"education","lineage":["https://openalex.org/I139264467"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Taewan Kim","raw_affiliation_strings":["Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea","institution_ids":["https://openalex.org/I139264467"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5103221001","display_name":"Jong-Gu Lee","orcid":"https://orcid.org/0000-0002-1894-4582"},"institutions":[{"id":"https://openalex.org/I139264467","display_name":"Seoul National University","ror":"https://ror.org/04h9pn542","country_code":"KR","type":"education","lineage":["https://openalex.org/I139264467"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"Jonggu Lee","raw_affiliation_strings":["Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea","institution_ids":["https://openalex.org/I139264467"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5011256194","display_name":"Han-Byeol Kim","orcid":null},"institutions":[{"id":"https://openalex.org/I139264467","display_name":"Seoul National University","ror":"https://ror.org/04h9pn542","country_code":"KR","type":"education","lineage":["https://openalex.org/I139264467"]}],"countries":["KR"],"is_corresponding":false,"raw_author_name":"H. Jin Kim","raw_affiliation_strings":["Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Mechanical and Aerospace Engineering, Seoul National University, Seoul, Korea","institution_ids":["https://openalex.org/I139264467"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I139264467"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":4,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1046","last_page":"1050"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9998000264167786,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12794","display_name":"Adaptive Dynamic Programming Control","score":0.9739000201225281,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10586","display_name":"Robotic Path Planning Algorithms","score":0.9697999954223633,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/autoencoder","display_name":"Autoencoder","score":0.7929303050041199},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7883127927780151},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7126924991607666},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.6512194871902466},{"id":"https://openalex.org/keywords/dimension","display_name":"Dimension (graph theory)","score":0.5195937156677246},{"id":"https://openalex.org/keywords/convolutional-neural-network","display_name":"Convolutional neural network","score":0.5020487308502197},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.42773306369781494},{"id":"https://openalex.org/keywords/robot-end-effector","display_name":"Robot end effector","score":0.4242510199546814},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.41920000314712524},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.4143255054950714},{"id":"https://openalex.org/keywords/robotics","display_name":"Robotics","score":0.41392752528190613},{"id":"https://openalex.org/keywords/robot","display_name":"Robot","score":0.40889620780944824},{"id":"https://openalex.org/keywords/computer-vision","display_name":"Computer vision","score":0.35919928550720215},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.35403430461883545},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.2724854350090027},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.22800889611244202},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.12642553448677063}],"concepts":[{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.7929303050041199},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7883127927780151},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7126924991607666},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6512194871902466},{"id":"https://openalex.org/C33676613","wikidata":"https://www.wikidata.org/wiki/Q13415176","display_name":"Dimension (graph theory)","level":2,"score":0.5195937156677246},{"id":"https://openalex.org/C81363708","wikidata":"https://www.wikidata.org/wiki/Q17084460","display_name":"Convolutional neural network","level":2,"score":0.5020487308502197},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.42773306369781494},{"id":"https://openalex.org/C8652668","wikidata":"https://www.wikidata.org/wiki/Q1340324","display_name":"Robot end effector","level":3,"score":0.4242510199546814},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.41920000314712524},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.4143255054950714},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.41392752528190613},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.40889620780944824},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.35919928550720215},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.35403430461883545},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2724854350090027},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.22800889611244202},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.12642553448677063},{"id":"https://openalex.org/C202444582","wikidata":"https://www.wikidata.org/wiki/Q837863","display_name":"Pure mathematics","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ascc.2017.8287315","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ascc.2017.8287315","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2017 11th Asian Control Conference (ASCC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","score":0.8199999928474426,"display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":10,"referenced_works":["https://openalex.org/W1977655452","https://openalex.org/W2121615981","https://openalex.org/W2145339207","https://openalex.org/W2173248099","https://openalex.org/W2312609093","https://openalex.org/W2443711627","https://openalex.org/W2521863123","https://openalex.org/W2963864421","https://openalex.org/W2964161785","https://openalex.org/W4214717370"],"related_works":["https://openalex.org/W3013693939","https://openalex.org/W2159052453","https://openalex.org/W2566616303","https://openalex.org/W3131327266","https://openalex.org/W2734887215","https://openalex.org/W4225571923","https://openalex.org/W3212257828","https://openalex.org/W4297873223","https://openalex.org/W2350784623","https://openalex.org/W2126211886"],"abstract_inverted_index":{"In":[0,39,134],"this":[1,135],"paper,":[2],"we":[3,137,203],"apply":[4],"Reinforcement":[5],"Learning":[6],"(RL)":[7],"to":[8,21,41,63,115,144,196],"control":[9,42,197],"a":[10,33,43,66,130,139,146,151,155,205,212],"manipulator":[11,55,192,210,222],"using":[12,82,104,154],"camera":[13,175],"images.":[14,119],"Basically,":[15],"RL":[16],"algorithm":[17],"helps":[18],"the":[19,37,45,54,57,124,142,170,174,180,183,188,191,201,216,221,225],"agent":[20,46],"choose":[22],"actions":[23],"under":[24],"some":[25],"specific":[26],"policies,":[27],"which":[28,159],"maximize":[29],"rewards":[30],"accumulated":[31],"from":[32,118],"sequential":[34],"result":[35],"of":[36,53,94,182,208,211],"actions.":[38],"order":[40],"manipulator,":[44],"generally":[47],"considers":[48],"joint":[49],"angles":[50],"or":[51,113],"torques":[52],"as":[56,79,85,108,179],"states.":[58,80],"Deep":[59],"learning":[60],"has":[61,100,160],"enabled":[62],"deal":[64],"with":[65],"very":[67],"high":[68,96],"dimensional":[69],"state":[70,86],"space":[71],"so":[72,98],"that":[73,220],"raw":[74,83],"images":[75,84],"can":[76,88,164,193],"be":[77,165],"considered":[78],"However,":[81],"spaces":[87],"require":[89],"extensive":[90],"computational":[91,125],"resources":[92],"because":[93],"their":[95],"dimension,":[97],"there":[99],"been":[101],"much":[102],"research":[103],"additory":[105],"algorithms":[106,122],"such":[107],"Convolutional":[109],"Neural":[110],"Network":[111],"(CNN)":[112],"autoencoder":[114],"extract":[116],"features":[117],"While":[120],"those":[121],"reduce":[123],"load,":[126],"it":[127],"is":[128],"still":[129],"quite":[131],"complicated":[132],"process.":[133],"paper":[136],"consider":[138],"task":[140],"for":[141],"end-effector":[143],"reach":[145],"random":[147],"target":[148],"and":[149,163,176,215],"propose":[150],"new":[152],"approach":[153],"vision-based":[156],"direction":[157,171,189],"vector,":[158],"low":[161],"dimension":[162],"simply":[166],"implemented.":[167],"We":[168],"calculate":[169],"vectors":[172],"via":[173],"exploit":[177],"them":[178],"states":[181],"policy.":[184],"Then,":[185],"based":[186],"on":[187],"vectors,":[190],"learn":[194],"how":[195],"each":[198],"joint.":[199],"For":[200],"simulation,":[202],"demonstrate":[204],"multiple":[206],"degree":[207],"freedom(dof)":[209],"commercial":[213],"robot,":[214],"simulation":[217],"results":[218],"show":[219],"successfully":[223],"tracks":[224],"target.":[226]},"counts_by_year":[{"year":2025,"cited_by_count":1},{"year":2024,"cited_by_count":1},{"year":2022,"cited_by_count":1},{"year":2018,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
