{"id":"https://openalex.org/W2963190533","doi":"https://doi.org/10.23919/acc.2018.8431181","title":"A Policy Search Method For Temporal Logic Specified Reinforcement Learning Tasks","display_name":"A Policy Search Method For Temporal Logic Specified Reinforcement Learning Tasks","publication_year":2018,"publication_date":"2018-06-01","ids":{"openalex":"https://openalex.org/W2963190533","doi":"https://doi.org/10.23919/acc.2018.8431181","mag":"2963190533"},"language":"en","primary_location":{"id":"doi:10.23919/acc.2018.8431181","is_oa":false,"landing_page_url":"https://doi.org/10.23919/acc.2018.8431181","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 Annual American Control Conference (ACC)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5100654890","display_name":"Xiao Li","orcid":"https://orcid.org/0000-0003-0756-7483"},"institutions":[{"id":"https://openalex.org/I11880225","display_name":"National Institute of Technology Karnataka","ror":"https://ror.org/01hz4v948","country_code":"IN","type":"education","lineage":["https://openalex.org/I11880225"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Xiao Li","raw_affiliation_strings":["Department of Information Technology, National Institute of Technology Karnataka, Mangalore, India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Information Technology, National Institute of Technology Karnataka, Mangalore, India","institution_ids":["https://openalex.org/I11880225"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101568942","display_name":"Yao Ma","orcid":"https://orcid.org/0000-0002-4985-8724"},"institutions":[{"id":"https://openalex.org/I11880225","display_name":"National Institute of Technology Karnataka","ror":"https://ror.org/01hz4v948","country_code":"IN","type":"education","lineage":["https://openalex.org/I11880225"]}],"countries":["IN"],"is_corresponding":false,"raw_author_name":"Yao Ma","raw_affiliation_strings":["Department of Information Technology, National Institute of Technology Karnataka, Mangalore, India"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Information Technology, National Institute of Technology Karnataka, Mangalore, India","institution_ids":["https://openalex.org/I11880225"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5086742095","display_name":"C\u0103lin Belta","orcid":"https://orcid.org/0000-0002-7141-2657"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Calin Belta","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":3.5086,"has_fulltext":false,"cited_by_count":51,"citation_normalized_percentile":{"value":0.94919719,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":94,"max":99},"biblio":{"volume":null,"issue":null,"first_page":"240","last_page":"245"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9965999722480774,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9965999722480774,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11975","display_name":"Evolutionary Algorithms and Applications","score":0.9948999881744385,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10848","display_name":"Advanced Multi-Objective Optimization Algorithms","score":0.9725000262260437,"subfield":{"id":"https://openalex.org/subfields/1703","display_name":"Computational Theory and Mathematics"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.9084968566894531},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.746835470199585},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.6605740785598755},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.6218874454498291},{"id":"https://openalex.org/keywords/temporal-logic","display_name":"Temporal logic","score":0.6169759631156921},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.6156911849975586},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5732776522636414},{"id":"https://openalex.org/keywords/outcome","display_name":"Outcome (game theory)","score":0.5363439917564392},{"id":"https://openalex.org/keywords/temporal-difference-learning","display_name":"Temporal difference learning","score":0.5190011262893677},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.4208436608314514},{"id":"https://openalex.org/keywords/theoretical-computer-science","display_name":"Theoretical computer science","score":0.21135833859443665},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.11882302165031433}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.9084968566894531},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.746835470199585},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.6605740785598755},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.6218874454498291},{"id":"https://openalex.org/C25016198","wikidata":"https://www.wikidata.org/wiki/Q781833","display_name":"Temporal logic","level":2,"score":0.6169759631156921},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.6156911849975586},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5732776522636414},{"id":"https://openalex.org/C148220186","wikidata":"https://www.wikidata.org/wiki/Q7111912","display_name":"Outcome (game theory)","level":2,"score":0.5363439917564392},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.5190011262893677},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4208436608314514},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.21135833859443665},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.11882302165031433},{"id":"https://openalex.org/C1276947","wikidata":"https://www.wikidata.org/wiki/Q333","display_name":"Astronomy","level":1,"score":0.0},{"id":"https://openalex.org/C144237770","wikidata":"https://www.wikidata.org/wiki/Q747534","display_name":"Mathematical economics","level":1,"score":0.0},{"id":"https://openalex.org/C86803240","wikidata":"https://www.wikidata.org/wiki/Q420","display_name":"Biology","level":0,"score":0.0},{"id":"https://openalex.org/C78458016","wikidata":"https://www.wikidata.org/wiki/Q840400","display_name":"Evolutionary biology","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.23919/acc.2018.8431181","is_oa":false,"landing_page_url":"https://doi.org/10.23919/acc.2018.8431181","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2018 Annual American Control Conference (ACC)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":19,"referenced_works":["https://openalex.org/W2007748737","https://openalex.org/W2012587148","https://openalex.org/W2098524868","https://openalex.org/W2145339207","https://openalex.org/W2155007355","https://openalex.org/W2226453522","https://openalex.org/W2257979135","https://openalex.org/W2260421414","https://openalex.org/W2462906003","https://openalex.org/W2524638160","https://openalex.org/W2529601334","https://openalex.org/W2567705466","https://openalex.org/W2962736495","https://openalex.org/W2963630259","https://openalex.org/W2964161785","https://openalex.org/W3104654558","https://openalex.org/W4205513846","https://openalex.org/W6674872077","https://openalex.org/W6765478815"],"related_works":["https://openalex.org/W2145363145","https://openalex.org/W2341346307","https://openalex.org/W2154399718","https://openalex.org/W4321463377","https://openalex.org/W2768629321","https://openalex.org/W2130711276","https://openalex.org/W4308828368","https://openalex.org/W1528400370","https://openalex.org/W3038962357","https://openalex.org/W2189613824"],"abstract_inverted_index":{"Reward":[0],"engineering":[1],"is":[2],"an":[3],"important":[4],"aspect":[5],"of":[6,69,92,100,125],"reinforcement":[7,77],"learning.":[8,78],"Whether":[9],"or":[10],"not":[11],"the":[12,20,26,44,59,67,120,132],"users'":[13],"intentions":[14],"can":[15,23,49,81],"be":[16,50,82],"correctly":[17],"encapsulated":[18],"in":[19,76],"reward":[21,35],"function":[22,87,102],"significantly":[24],"impact":[25],"learning":[27,112],"outcome.":[28],"Current":[29],"methods":[30],"rely":[31],"on":[32],"manually":[33],"crafted":[34],"functions":[36],"that":[37,88,114,118],"often":[38],"requires":[39,54],"parameter":[40],"tuning":[41],"to":[42,56,73,84,130],"obtain":[43],"desired":[45],"behavior.":[46],"This":[47],"operation":[48],"expensive":[51],"when":[52],"exploration":[53],"systems":[55],"interact":[57],"with":[58],"physical":[60],"world.":[61],"In":[62],"this":[63,101],"paper,":[64],"we":[65],"explore":[66],"use":[68],"temporal":[70,105],"logic":[71,106],"(TL)":[72],"specify":[74],"tasks":[75],"TL":[79,121],"formula":[80],"translated":[83],"a":[85,95,110,116],"real-valued":[86],"measures":[89],"its":[90],"level":[91],"satisfaction":[93],"against":[94],"trajectory.":[96],"We":[97],"take":[98],"advantage":[99],"and":[103],"propose":[104],"policy":[107,117],"search":[108],"(TLPS),":[109],"model-free":[111],"technique":[113],"finds":[115],"satisfies":[119],"specification.":[122],"A":[123],"set":[124],"simulated":[126],"experiments":[127],"are":[128],"conducted":[129],"evaluate":[131],"proposed":[133],"approach.":[134]},"counts_by_year":[{"year":2025,"cited_by_count":2},{"year":2024,"cited_by_count":5},{"year":2023,"cited_by_count":6},{"year":2022,"cited_by_count":7},{"year":2021,"cited_by_count":9},{"year":2020,"cited_by_count":11},{"year":2019,"cited_by_count":9},{"year":2018,"cited_by_count":2}],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
