{"id":"https://openalex.org/W2024877309","doi":"https://doi.org/10.1109/cdc.2011.6160834","title":"Mission planning in unstructured environments: A reinforcement learning approach","display_name":"Mission planning in unstructured environments: A reinforcement learning approach","publication_year":2011,"publication_date":"2011-12-01","ids":{"openalex":"https://openalex.org/W2024877309","doi":"https://doi.org/10.1109/cdc.2011.6160834","mag":"2024877309"},"language":"en","primary_location":{"id":"doi:10.1109/cdc.2011.6160834","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cdc.2011.6160834","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Conference on Decision and Control and European Control Conference","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5086688579","display_name":"Brandon Basso","orcid":null},"institutions":[{"id":"https://openalex.org/I175003984","display_name":"Office of Naval Research","ror":"https://ror.org/00rk2pe57","country_code":"US","type":"government","lineage":["https://openalex.org/I1330347796","https://openalex.org/I175003984","https://openalex.org/I3130687028"]},{"id":"https://openalex.org/I95457486","display_name":"University of California, Berkeley","ror":"https://ror.org/01an7q238","country_code":"US","type":"education","lineage":["https://openalex.org/I95457486"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Brandon Basso","raw_affiliation_strings":["Australian Centre for Field Robotics, (ACFR) and funded by the Office of Naval Research (ONR), University of California, Berkeley, USA","UC Berkeley, USA#TAB#"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Australian Centre for Field Robotics, (ACFR) and funded by the Office of Naval Research (ONR), University of California, Berkeley, USA","institution_ids":["https://openalex.org/I175003984","https://openalex.org/I95457486"]},{"raw_affiliation_string":"UC Berkeley, USA#TAB#","institution_ids":["https://openalex.org/I95457486"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5113671184","display_name":"Hugh Durrant\u2010Whyte","orcid":null},"institutions":[{"id":"https://openalex.org/I129604602","display_name":"The University of Sydney","ror":"https://ror.org/0384j8v12","country_code":"AU","type":"education","lineage":["https://openalex.org/I129604602"]},{"id":"https://openalex.org/I175003984","display_name":"Office of Naval Research","ror":"https://ror.org/00rk2pe57","country_code":"US","type":"government","lineage":["https://openalex.org/I1330347796","https://openalex.org/I175003984","https://openalex.org/I3130687028"]},{"id":"https://openalex.org/I95457486","display_name":"University of California, Berkeley","ror":"https://ror.org/01an7q238","country_code":"US","type":"education","lineage":["https://openalex.org/I95457486"]}],"countries":["AU","US"],"is_corresponding":false,"raw_author_name":"Hugh Durrant-Whyte","raw_affiliation_strings":["Australian Centre for Field Robotics, (ACFR) and funded by the Office of Naval Research (ONR), University of California, Berkeley, USA","University of Sydney\u2028Australia"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Australian Centre for Field Robotics, (ACFR) and funded by the Office of Naval Research (ONR), University of California, Berkeley, USA","institution_ids":["https://openalex.org/I175003984","https://openalex.org/I95457486"]},{"raw_affiliation_string":"University of Sydney\u2028Australia","institution_ids":["https://openalex.org/I129604602"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5083232991","display_name":"J. Karl Hedrick","orcid":null},"institutions":[{"id":"https://openalex.org/I175003984","display_name":"Office of Naval Research","ror":"https://ror.org/00rk2pe57","country_code":"US","type":"government","lineage":["https://openalex.org/I1330347796","https://openalex.org/I175003984","https://openalex.org/I3130687028"]},{"id":"https://openalex.org/I95457486","display_name":"University of California, Berkeley","ror":"https://ror.org/01an7q238","country_code":"US","type":"education","lineage":["https://openalex.org/I95457486"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"J. Karl Hedrick","raw_affiliation_strings":["Australian Centre for Field Robotics, (ACFR) and funded by the Office of Naval Research (ONR), University of California, Berkeley, USA","\u2021University of California at Berkeley, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Australian Centre for Field Robotics, (ACFR) and funded by the Office of Naval Research (ONR), University of California, Berkeley, USA","institution_ids":["https://openalex.org/I175003984","https://openalex.org/I95457486"]},{"raw_affiliation_string":"\u2021University of California at Berkeley, USA","institution_ids":["https://openalex.org/I95457486"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":3,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.11570639,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"578","last_page":"583"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9995999932289124,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.9995999932289124,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12288","display_name":"Optimization and Search Problems","score":0.9965999722480774,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10249","display_name":"Distributed Control Multi-Agent Systems","score":0.9962999820709229,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8875519037246704},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7367787957191467},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.6377828121185303},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.6148843765258789},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.5937884449958801},{"id":"https://openalex.org/keywords/task","display_name":"Task (project management)","score":0.5589628219604492},{"id":"https://openalex.org/keywords/bellman-equation","display_name":"Bellman equation","score":0.5556549429893494},{"id":"https://openalex.org/keywords/q-learning","display_name":"Q-learning","score":0.49931979179382324},{"id":"https://openalex.org/keywords/set","display_name":"Set (abstract data type)","score":0.44786542654037476},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.4436004161834717},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.4412784278392792},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.41442573070526123},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.3052366375923157},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.1875430941581726},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.10856619477272034}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8875519037246704},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7367787957191467},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.6377828121185303},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.6148843765258789},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5937884449958801},{"id":"https://openalex.org/C2780451532","wikidata":"https://www.wikidata.org/wiki/Q759676","display_name":"Task (project management)","level":2,"score":0.5589628219604492},{"id":"https://openalex.org/C14646407","wikidata":"https://www.wikidata.org/wiki/Q1430750","display_name":"Bellman equation","level":2,"score":0.5556549429893494},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.49931979179382324},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.44786542654037476},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.4436004161834717},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4412784278392792},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.41442573070526123},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.3052366375923157},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.1875430941581726},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.10856619477272034},{"id":"https://openalex.org/C199539241","wikidata":"https://www.wikidata.org/wiki/Q7748","display_name":"Law","level":1,"score":0.0},{"id":"https://openalex.org/C162324750","wikidata":"https://www.wikidata.org/wiki/Q8134","display_name":"Economics","level":0,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0},{"id":"https://openalex.org/C187736073","wikidata":"https://www.wikidata.org/wiki/Q2920921","display_name":"Management","level":1,"score":0.0},{"id":"https://openalex.org/C94625758","wikidata":"https://www.wikidata.org/wiki/Q7163","display_name":"Politics","level":2,"score":0.0},{"id":"https://openalex.org/C17744445","wikidata":"https://www.wikidata.org/wiki/Q36442","display_name":"Political science","level":0,"score":0.0},{"id":"https://openalex.org/C77088390","wikidata":"https://www.wikidata.org/wiki/Q8513","display_name":"Database","level":1,"score":0.0}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/cdc.2011.6160834","is_oa":false,"landing_page_url":"https://doi.org/10.1109/cdc.2011.6160834","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"IEEE Conference on Decision and Control and European Control Conference","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[{"display_name":"Peace, Justice and strong institutions","id":"https://metadata.un.org/sdg/16","score":0.7400000095367432}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":19,"referenced_works":["https://openalex.org/W18074934","https://openalex.org/W59787217","https://openalex.org/W170770739","https://openalex.org/W1601649239","https://openalex.org/W1777239053","https://openalex.org/W1994083592","https://openalex.org/W2053767219","https://openalex.org/W2106720687","https://openalex.org/W2109798495","https://openalex.org/W2111563176","https://openalex.org/W2114907801","https://openalex.org/W2134491302","https://openalex.org/W2134779831","https://openalex.org/W2168945108","https://openalex.org/W2222512263","https://openalex.org/W3103882218","https://openalex.org/W4242417466","https://openalex.org/W6638088447","https://openalex.org/W6684839497"],"related_works":["https://openalex.org/W2386410636","https://openalex.org/W3096874164","https://openalex.org/W2357975469","https://openalex.org/W2937181779","https://openalex.org/W2808418668","https://openalex.org/W2025663273","https://openalex.org/W2145363145","https://openalex.org/W2807018115","https://openalex.org/W3168977894","https://openalex.org/W1574958246"],"abstract_inverted_index":{"Mission":[0],"planning":[1],"scenarios":[2],"in":[3],"robotics":[4],"typically":[5],"involve":[6],"one":[7],"or":[8,32,43],"more":[9],"semi-autonomous":[10],"agents":[11,26,209],"and":[12,55,94,149,172,216],"a":[13,66,87,98,112,117,162,192],"human":[14],"operator.":[15],"The":[16,69,105,141,201],"high-level":[17,57],"goal":[18,58],"is":[19,74,124,144,153,204,217],"to":[20,27,115,191,206,210,219,222],"find":[21],"an":[22,147,150],"optimal":[23,151],"allocation":[24],"of":[25,34,47,59,71,90,111,130,137,168,181,199],"tasks.":[28,200],"Each":[29,46],"individual":[30],"task":[31,60],"collection":[33],"tasks":[35,211],"may":[36],"have":[37],"subgoals,":[38],"such":[39],"as":[40,65,146,225,227],"search,":[41],"localization,":[42],"information":[44],"gathering.":[45],"these":[48],"lower-level":[49],"goals":[50],"are":[51,83,159],"their":[52],"own":[53],"topics,":[54],"the":[56,109,131,138,169,179,182,188],"accomplishment":[61],"can":[62],"be":[63],"categorized":[64],"decision":[67,77,142],"problem.":[68],"focus":[70],"this":[72],"work":[73],"on":[75],"solving":[76],"problems":[78],"through":[79],"reinforcement":[80],"learning.":[81],"Tasks":[82],"completely":[84,107],"parameterized":[85],"by":[86,134],"minimal":[88,213],"set":[89],"basis":[91],"constraints\u2014spatial,":[92],"temporal,":[93],"(agent-task)":[95],"coupling\u2014which":[96],"produces":[97],"single":[99],"cost":[100,106],"for":[101,161,196],"each":[102],"agent-task":[103],"pairing.":[104],"captures":[108],"ability":[110],"specific":[113,118],"agent":[114,223,229],"perform":[116],"task.":[119],"A":[120],"novel":[121],"state":[122,132],"representation":[123],"presented":[125,160],"that":[126],"mitigates":[127],"exponential":[128],"growth":[129],"space":[133],"scaling":[135],"independently":[136],"spatial":[139],"dimension.":[140],"problem":[143],"cast":[145],"MDP":[148],"policy":[152,190,195,203],"found":[154],"using":[155],"Q-learning.":[156],"Simulation":[157],"results":[158],"two-agent":[163],"two-task":[164],"example,":[165],"showing":[166],"convergence":[167],"value":[170],"function":[171],"improved":[173],"learning":[174,183],"over":[175],"time.":[176],"To":[177],"highlight":[178],"scalability":[180],"algorithm,":[184],"additional":[185],"simulations":[186],"compare":[187],"learned":[189,202],"hand-coded":[193],"greedy":[194],"varying":[197],"number":[198],"shown":[205],"reliably":[207],"allocate":[208],"with":[212],"parameter":[214],"tuning":[215],"robust":[218],"low-level":[220],"changes":[221],"dynamics":[224],"well":[226],"random":[228],"motion.":[230]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-10-10T00:00:00"}
