{"id":"https://openalex.org/W7159619652","doi":"https://doi.org/10.48550/arxiv.2604.27162","title":"A High-Throughput Compute-Efficient POMDP Hide-And-Seek-Engine (HASE) for Multi-Agent Operations","display_name":"A High-Throughput Compute-Efficient POMDP Hide-And-Seek-Engine (HASE) for Multi-Agent Operations","publication_year":2026,"publication_date":"2026-04-29","ids":{"openalex":"https://openalex.org/W7159619652","doi":"https://doi.org/10.48550/arxiv.2604.27162"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2604.27162","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.27162","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2604.27162","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5024533412","display_name":"Timothy Flavin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Flavin, Timothy","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5134984164","display_name":"Sandip Sen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sen, Sandip","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8704000115394592,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.8704000115394592,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10639","display_name":"Advanced Software Engineering Methodologies","score":0.007400000002235174,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10933","display_name":"Real-Time Systems Scheduling","score":0.007300000172108412,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/partially-observable-markov-decision-process","display_name":"Partially observable Markov decision process","score":0.7279999852180481},{"id":"https://openalex.org/keywords/thread","display_name":"Thread (computing)","score":0.5774999856948853},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5665000081062317},{"id":"https://openalex.org/keywords/multithreading","display_name":"Multithreading","score":0.5091000199317932},{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.4957999885082245},{"id":"https://openalex.org/keywords/markov-chain","display_name":"Markov chain","score":0.4584999978542328},{"id":"https://openalex.org/keywords/throughput","display_name":"Throughput","score":0.45260000228881836},{"id":"https://openalex.org/keywords/train","display_name":"Train","score":0.4401000142097473}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.798799991607666},{"id":"https://openalex.org/C17098449","wikidata":"https://www.wikidata.org/wiki/Q176814","display_name":"Partially observable Markov decision process","level":4,"score":0.7279999852180481},{"id":"https://openalex.org/C138101251","wikidata":"https://www.wikidata.org/wiki/Q213092","display_name":"Thread (computing)","level":2,"score":0.5774999856948853},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5665000081062317},{"id":"https://openalex.org/C201410400","wikidata":"https://www.wikidata.org/wiki/Q1064412","display_name":"Multithreading","level":3,"score":0.5091000199317932},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.4957999885082245},{"id":"https://openalex.org/C98763669","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov chain","level":2,"score":0.4584999978542328},{"id":"https://openalex.org/C157764524","wikidata":"https://www.wikidata.org/wiki/Q1383412","display_name":"Throughput","level":3,"score":0.45260000228881836},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.44519999623298645},{"id":"https://openalex.org/C190839683","wikidata":"https://www.wikidata.org/wiki/Q2448197","display_name":"Train","level":2,"score":0.4401000142097473},{"id":"https://openalex.org/C101722063","wikidata":"https://www.wikidata.org/wiki/Q218825","display_name":"Random access","level":2,"score":0.4092000126838684},{"id":"https://openalex.org/C100776233","wikidata":"https://www.wikidata.org/wiki/Q2532492","display_name":"Bridge (graph theory)","level":2,"score":0.3946000039577484},{"id":"https://openalex.org/C68339613","wikidata":"https://www.wikidata.org/wiki/Q1549489","display_name":"Speedup","level":2,"score":0.38690000772476196},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.3659000098705292},{"id":"https://openalex.org/C198531522","wikidata":"https://www.wikidata.org/wiki/Q485146","display_name":"Sample (material)","level":2,"score":0.35499998927116394},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.35409998893737793},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.3208000063896179},{"id":"https://openalex.org/C32848918","wikidata":"https://www.wikidata.org/wiki/Q845789","display_name":"Observable","level":2,"score":0.3127000033855438},{"id":"https://openalex.org/C46686674","wikidata":"https://www.wikidata.org/wiki/Q466303","display_name":"Boosting (machine learning)","level":2,"score":0.30550000071525574},{"id":"https://openalex.org/C79403827","wikidata":"https://www.wikidata.org/wiki/Q3988","display_name":"Real-time computing","level":1,"score":0.3018999993801117},{"id":"https://openalex.org/C97854310","wikidata":"https://www.wikidata.org/wiki/Q19541","display_name":"Search engine","level":2,"score":0.2703999876976013},{"id":"https://openalex.org/C2994168587","wikidata":"https://www.wikidata.org/wiki/Q5295","display_name":"Random access memory","level":2,"score":0.2639000117778778},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.25929999351501465},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.2578999996185303},{"id":"https://openalex.org/C2989134064","wikidata":"https://www.wikidata.org/wiki/Q288510","display_name":"Execution time","level":2,"score":0.25110000371932983}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2604.27162","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.27162","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2604.27162","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2604.27162","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.42409127950668335}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"Learning":[1],"(RL)":[2],"algorithms":[3],"exhibit":[4],"high":[5],"sample":[6],"complexity,":[7],"particularly":[8],"when":[9],"applied":[10],"to":[11,48,90,114,137],"Decentralized":[12],"Partially":[13],"Observable":[14],"Markov":[15],"Decision":[16],"Processes":[17],"(Dec-POMDPs).":[18],"As":[19],"a":[20,70,95,121,154],"response,":[21],"projects":[22],"such":[23,36],"as":[24,37],"SampleFactory,":[25],"EnvPool,":[26],"Brax,":[27],"and":[28,39,94,103,168,177,185],"IsaacLab":[29],"migrate":[30],"parallel":[31],"execution":[32],"of":[33,53,63,112,157],"classic":[34],"environments":[35],"MuJoCo":[38],"Atari":[40],"into":[41],"C++":[42,77],"thread":[43],"pools":[44],"or":[45],"the":[46,50,61,146,161],"GPU":[47],"decrease":[49],"computational":[51],"cost":[52],"environment":[54],"steps.":[55],"We":[56],"are":[57],"interested":[58],"in":[59,76,120,179],"optimizing":[60],"decision-level":[62],"human-AI":[64],"joint":[65],"operations,":[66],"so":[67],"we":[68],"introduce":[69],"compute-efficient":[71],"Dec-POMDP":[72],"engine":[73,109,152],"natively":[74],"architected":[75],"called":[78],"Hide-And-Seek-Engine.":[79],"By":[80],"employing":[81],"Data-Oriented":[82],"Design":[83],"(DOD)":[84],"principles,":[85],"explicit":[86],"64-byte":[87],"cache-line":[88],"alignment":[89],"remove":[91],"false":[92],"sharing,":[93],"zero-copy":[96],"PyTorch":[97],"memory":[98,102],"bridge":[99],"using":[100],"pinned":[101],"Direct":[104],"Memory":[105],"Access":[106],"(DMA),":[107],"our":[108],"sustains":[110],"throughput":[111,155],"up":[113],"33,000,000":[115],"steps":[116],"per":[117],"second":[118],"(SPS)":[119],"single-agent,":[122],"1024-environment,":[123],"decentralized":[124],"observations":[125],"on":[126],"an":[127],"AMD":[128],"Ryzen":[129],"9950X":[130],"(16":[131],"cores).":[132],"Ten":[133],"agents":[134],"reduces":[135],"FPS":[136],"7M":[138],"SPS":[139],"with":[140],"generating":[141],"random":[142],"actions":[143],"contributing":[144],"1/3rd":[145],"total":[147],"runtime":[148],"for":[149],"reference.":[150],"The":[151],"achieves":[153],"increase":[156],"approximately":[158],"3,500$\\times$":[159],"over":[160],"baseline":[162],"single":[163],"threaded":[164],"vectorized":[165],"NumPy":[166],"implementation":[167],"successfully":[169],"trains":[170],"cooperative":[171],"multi-agent":[172],"policies":[173],"via":[174],"PPO,":[175],"DQN,":[176],"SAC":[178],"minutes,":[180],"validating":[181],"both":[182],"its":[183],"performance":[184],"generality.":[186]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-02T00:00:00"}
