{"id":"https://openalex.org/W7167518904","doi":"https://doi.org/10.5555/3709347.3743626","title":"Tackling Sparsity in Designated Driver Dispatch with Multi-Agent Reinforcement Learning","display_name":"Tackling Sparsity in Designated Driver Dispatch with Multi-Agent Reinforcement Learning","publication_year":2025,"publication_date":"2025-01-01","ids":{"openalex":"https://openalex.org/W7167518904","doi":"https://doi.org/10.5555/3709347.3743626"},"language":"en","primary_location":{"id":"pmh:oai:repository.hkust.edu.hk:1783.1-158641","is_oa":false,"landing_page_url":"http://repository.hkust.edu.hk/ir/Record/1783.1-158641","pdf_url":null,"source":{"id":"https://openalex.org/S4306401796","display_name":"Rare & Special e-Zone (The Hong Kong University of Science and Technology)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I200769079","host_organization_name":"Hong Kong University of Science and Technology","host_organization_lineage":["https://openalex.org/I200769079"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Conference paper"},"type":"conference-paper","indexed_in":[],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5140108781","display_name":"Jiaxuan Jiang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiang, Jiaxuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140134817","display_name":"Ling Pan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pan, Ling","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5140101932","display_name":"Lin Zhou","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhou, Lin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082905458","display_name":"Longbo Huang","orcid":"https://orcid.org/0000-0002-7341-447X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Longbo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5010064740","display_name":"Zhixuan Fang","orcid":"https://orcid.org/0000-0001-7979-4269"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fang, Zhixuan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":null,"topics":[],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8956999778747559},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7522000074386597},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.6110000014305115},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.5454000234603882},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.48410001397132874},{"id":"https://openalex.org/keywords/q-learning","display_name":"Q-learning","score":0.45489999651908875},{"id":"https://openalex.org/keywords/markov-chain","display_name":"Markov chain","score":0.40709999203681946}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8956999778747559},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7522000074386597},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.651199996471405},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.6110000014305115},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.5454000234603882},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.48410001397132874},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.46070000529289246},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.45489999651908875},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.40709999203681946},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.37790000438690186},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3440000116825104},{"id":"https://openalex.org/C2780378061","wikidata":"https://www.wikidata.org/wiki/Q25351891","display_name":"Service (business)","level":2,"score":0.32429999113082886},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2815999984741211},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.27799999713897705},{"id":"https://openalex.org/C106516650","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm design","level":2,"score":0.2768000066280365},{"id":"https://openalex.org/C42475967","wikidata":"https://www.wikidata.org/wiki/Q194292","display_name":"Operations research","level":1,"score":0.27250000834465027},{"id":"https://openalex.org/C2984634286","wikidata":"https://www.wikidata.org/wiki/Q1331926","display_name":"Decision process","level":2,"score":0.2596000134944916}],"mesh":[],"locations_count":1,"locations":[{"id":"pmh:oai:repository.hkust.edu.hk:1783.1-158641","is_oa":false,"landing_page_url":"http://repository.hkust.edu.hk/ir/Record/1783.1-158641","pdf_url":null,"source":{"id":"https://openalex.org/S4306401796","display_name":"Rare & Special e-Zone (The Hong Kong University of Science and Technology)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I200769079","host_organization_name":"Hong Kong University of Science and Technology","host_organization_lineage":["https://openalex.org/I200769079"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Conference paper"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Designated":[0,65],"driving":[1],"service":[2],"is":[3,41],"a":[4,69,99,119],"fast-growing":[5],"market":[6],"that":[7,133],"provides":[8],"drivers":[9,37,48],"to":[10,32,97,121,140],"transport":[11],"customers":[12],"in":[13,21,25],"their":[14],"own":[15],"cars.":[16],"The":[17],"key":[18],"technical":[19],"challenge":[20],"this":[22,59],"business":[23],"lies":[24],"the":[26,33,50,77],"design":[27],"of":[28,47,53],"driver":[29],"repositioning":[30],"due":[31],"far":[34],"distances":[35],"between":[36,101],"and":[38,49,90,103,123,146],"orders,":[39],"which":[40],"caused":[42],"by":[43],"complex":[44],"moving":[45],"constraints":[46],"\u201chub-and-spoke\"":[51],"structure":[52],"orders.":[54],"To":[55],"address":[56],"these":[57],"challenges,":[58],"paper":[60],"proposes":[61],"Reinforcement":[62,71,143],"Learning":[63,72,144],"for":[64],"Driver":[66],"Dispatch":[67],"(RLD3),":[68],"Multi-Agent":[70],"(MARL)":[73],"algorithm":[74,86,107,126,135],"based":[75],"on":[76],"Partially":[78],"Observed":[79],"Markov":[80],"Decision":[81],"Process":[82],"(POMDP)":[83],"formulation.":[84],"Our":[85],"considers":[87],"group-sharing":[88],"structures":[89],"frequent":[91],"potential":[92],"rewards":[93],"with":[94],"heterogeneous":[95],"costs":[96],"achieve":[98],"trade-off":[100],"heterogeneity":[102],"sparsity.":[104],"Additionally,":[105],"our":[106,125,134],"addresses":[108],"long-term":[109],"agent":[110],"cross-effects":[111],"through":[112],"window-lasting":[113],"policy":[114],"ensembles.":[115],"We":[116],"also":[117],"implement":[118],"simulator":[120],"train":[122],"evaluate":[124],"using":[127],"real-world":[128],"data.":[129],"Extensive":[130],"experiments":[131],"demonstrate":[132],"achieves":[136],"superior":[137],"performance":[138],"compared":[139],"existing":[141],"Deep":[142],"(DRL)":[145],"taxi-reposition":[147],"methods.":[148]},"counts_by_year":[],"updated_date":"2026-07-07T06:19:30.733796","created_date":"2026-07-07T00:00:00"}
