{"id":"https://openalex.org/W4401110405","doi":"https://doi.org/10.1109/cai59869.2024.00118","title":"Local Optima Networks for Reinforcement Learning - A Case Study: Coupled Inverted Pendulum Task","display_name":"Local Optima Networks for Reinforcement Learning - A Case Study: Coupled Inverted Pendulum Task","publication_year":2024,"publication_date":"2024-06-25","ids":{"openalex":"https://openalex.org/W4401110405","doi":"https://doi.org/10.1109/cai59869.2024.00118"},"language":"en","primary_location":{"id":"doi:10.1109/cai59869.2024.00118","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cai59869.2024.00118","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 IEEE Conference on Artificial Intelligence (CAI)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5018877295","display_name":"Yuyang Zhou","orcid":"https://orcid.org/0000-0002-2188-2781"},"institutions":[{"id":"https://openalex.org/I13591777","display_name":"University of Nottingham Ningbo China","ror":"https://ror.org/03y4dt428","country_code":"CN","type":"education","lineage":["https://openalex.org/I13591777","https://openalex.org/I142263535"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yuyang Zhou","raw_affiliation_strings":["University of Nottingham Ningbo China,School of Computer Science,Ningbo,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Nottingham Ningbo China,School of Computer Science,Ningbo,China","institution_ids":["https://openalex.org/I13591777"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5015463842","display_name":"Alexander P. Turner","orcid":"https://orcid.org/0000-0002-2392-6549"},"institutions":[{"id":"https://openalex.org/I142263535","display_name":"University of Nottingham","ror":"https://ror.org/01ee9ar58","country_code":"GB","type":"education","lineage":["https://openalex.org/I142263535"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Alexander Turner","raw_affiliation_strings":["University of Nottingham,School of Computer Science,Nottingham,United Kingdom"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Nottingham,School of Computer Science,Nottingham,United Kingdom","institution_ids":["https://openalex.org/I142263535"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5063214931","display_name":"Ferrante Neri","orcid":"https://orcid.org/0000-0002-6100-6532"},"institutions":[{"id":"https://openalex.org/I28290843","display_name":"University of Surrey","ror":"https://ror.org/00ks66431","country_code":"GB","type":"education","lineage":["https://openalex.org/I28290843"]}],"countries":["GB"],"is_corresponding":false,"raw_author_name":"Ferrante Neri","raw_affiliation_strings":["University of Surrey,School of Computer Science and Electronic Engineering,Guildford,United Kingdom"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"University of Surrey,School of Computer Science and Electronic Engineering,Guildford,United Kingdom","institution_ids":["https://openalex.org/I28290843"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.3556,"has_fulltext":false,"cited_by_count":1,"citation_normalized_percentile":{"value":0.52128098,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":{"min":91,"max":95},"biblio":{"volume":null,"issue":null,"first_page":"865","last_page":"870"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9243999719619751,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9243999719619751,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8175169229507446},{"id":"https://openalex.org/keywords/inverted-pendulum","display_name":"Inverted pendulum","score":0.7398277521133423},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.659975528717041},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.653100311756134},{"id":"https://openalex.org/keywords/local-optimum","display_name":"Local optimum","score":0.6479385495185852},{"id":"https://openalex.org/keywords/double-inverted-pendulum","display_name":"Double inverted pendulum","score":0.5655909776687622},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.4290097653865814},{"id":"https://openalex.org/keywords/control-theory","display_name":"Control theory (sociology)","score":0.3749690353870392},{"id":"https://openalex.org/keywords/engineering","display_name":"Engineering","score":0.16589626669883728},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.10575446486473083},{"id":"https://openalex.org/keywords/physics","display_name":"Physics","score":0.09811127185821533},{"id":"https://openalex.org/keywords/nonlinear-system","display_name":"Nonlinear system","score":0.07018554210662842}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8175169229507446},{"id":"https://openalex.org/C192921069","wikidata":"https://www.wikidata.org/wiki/Q550134","display_name":"Inverted pendulum","level":3,"score":0.7398277521133423},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.659975528717041},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.653100311756134},{"id":"https://openalex.org/C141934464","wikidata":"https://www.wikidata.org/wiki/Q3305386","display_name":"Local optimum","level":2,"score":0.6479385495185852},{"id":"https://openalex.org/C102540577","wikidata":"https://www.wikidata.org/wiki/Q5300047","display_name":"Double inverted pendulum","level":4,"score":0.5655909776687622},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4290097653865814},{"id":"https://openalex.org/C47446073","wikidata":"https://www.wikidata.org/wiki/Q5165890","display_name":"Control theory (sociology)","level":3,"score":0.3749690353870392},{"id":"https://openalex.org/C127413603","wikidata":"https://www.wikidata.org/wiki/Q11023","display_name":"Engineering","level":0,"score":0.16589626669883728},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.10575446486473083},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.09811127185821533},{"id":"https://openalex.org/C158622935","wikidata":"https://www.wikidata.org/wiki/Q660848","display_name":"Nonlinear system","level":2,"score":0.07018554210662842},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C201995342","wikidata":"https://www.wikidata.org/wiki/Q682496","display_name":"Systems engineering","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/cai59869.2024.00118","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cai59869.2024.00118","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2024 IEEE Conference on Artificial Intelligence (CAI)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":25,"referenced_works":["https://openalex.org/W165613958","https://openalex.org/W1557517019","https://openalex.org/W1977655452","https://openalex.org/W1986144944","https://openalex.org/W1986602910","https://openalex.org/W2028186927","https://openalex.org/W2030258362","https://openalex.org/W2044400415","https://openalex.org/W2093083775","https://openalex.org/W2098677716","https://openalex.org/W2116495883","https://openalex.org/W2161032864","https://openalex.org/W2531857112","https://openalex.org/W2919115771","https://openalex.org/W2959993166","https://openalex.org/W3181655383","https://openalex.org/W4200185618","https://openalex.org/W4214717370","https://openalex.org/W4252223054","https://openalex.org/W4285033151","https://openalex.org/W4298857966","https://openalex.org/W4312322700","https://openalex.org/W4362725002","https://openalex.org/W6637967152","https://openalex.org/W6684921986"],"related_works":["https://openalex.org/W2024927487","https://openalex.org/W1492838287","https://openalex.org/W2034778971","https://openalex.org/W2349578589","https://openalex.org/W2893549521","https://openalex.org/W2204278379","https://openalex.org/W2381121570","https://openalex.org/W2379721524","https://openalex.org/W2341932412","https://openalex.org/W2376869628"],"abstract_inverted_index":{"Reinforcement":[0],"Learning":[1],"(RL)":[2],"refers":[3],"to":[4,38,41,51,108,140],"a":[5,19,136,163,172,195],"set":[6],"of":[7,21,90,103,124,144,162,194,222],"methods":[8],"where":[9],"the":[10,22,26,61,91,101,110,118,122,125,142,145,151,160,166,178,199,206,215],"agent":[11,27],"learns":[12,37],"directly":[13],"from":[14,171],"interactions":[15],"without":[16],"explicitly":[17],"constructing":[18],"model":[20],"environment.":[23],"In":[24],"RL,":[25],"interacts":[28],"with":[29,114],"an":[30,53,70,88],"environment,":[31],"takes":[32],"actions,":[33],"receives":[34],"feedback,":[35],"and":[36,116,158,174,185],"make":[39],"decisions":[40],"maximize":[42],"cumulative":[43],"rewards":[44],"over":[45],"time.":[46],"The":[47,209],"primary":[48],"goal":[49],"is":[50,74],"find":[52],"optimal":[54],"policy":[55],"or":[56,77],"value":[57],"function":[58],"that":[59],"guides":[60],"agent\u2019s":[62],"decision-making.":[63],"Although":[64],"RL":[65,115],"can":[66],"be":[67],"formulated":[68],"as":[69,135],"optimisation":[71,86],"problem,":[72],"it":[73],"rarely":[75],"analysed":[76],"studied":[78],"in":[79,155],"depth.":[80],"Conversely,":[81],"just":[82],"like":[83],"any":[84],"other":[85],"task,":[87,219],"understanding":[89],"problem":[92,168],"might":[93],"help":[94],"detect":[95],"high-quality":[96],"policies.":[97],"This":[98],"study":[99,164],"employs":[100],"use":[102],"Local":[104],"Optima":[105],"Networks":[106],"(LONs)":[107],"analyse":[109],"fitness":[111,146,207],"landscape":[112],"associated":[113],"modify":[117],"sampling":[119],"method":[120],"for":[121,214],"case":[123],"coupled":[126,216],"inverted":[127,217],"pendulum":[128,153,218],"tasks.":[129],"Deep":[130],"Deterministic":[131],"Policy":[132],"Gradient":[133],"serves":[134],"local":[137,188],"search":[138],"algorithm":[139],"refine":[141],"characterization":[143],"landscape.":[147,208],"Experimental":[148],"results":[149],"on":[150,165],"two":[152],"tasks":[154],"part":[156],"confirm":[157],"extend":[159],"conclusions":[161],"same":[167],"carried":[169],"out":[170],"robotics":[173],"engineering":[175],"standpoint.":[176],"However,":[177],"proposed":[179],"approach":[180],"uniquely":[181],"identifies":[182],"both":[183],"known":[184],"previously":[186],"unknown":[187],"optima":[189],"solutions.":[190],"A":[191],"sensitivity":[192],"analysis":[193],"key":[196],"LON":[197,211],"parameter,":[198],"perturbation":[200],"strength,":[201],"offers":[202],"deeper":[203],"insights":[204],"into":[205],"constructed":[210],"indicates":[212],"that,":[213],"some":[220],"basins":[221],"attraction":[223],"are":[224],"much":[225],"stronger":[226],"than":[227],"others.":[228]},"counts_by_year":[{"year":2025,"cited_by_count":1}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
