{"id":"https://openalex.org/W7127188914","doi":"https://doi.org/10.1109/trustcom66490.2025.00360","title":"A Real-Time Defense Framework Using PPPO in Deep Reinforcement Learning for CyberBattleSim","display_name":"A Real-Time Defense Framework Using PPPO in Deep Reinforcement Learning for CyberBattleSim","publication_year":2025,"publication_date":"2025-11-14","ids":{"openalex":"https://openalex.org/W7127188914","doi":"https://doi.org/10.1109/trustcom66490.2025.00360"},"language":null,"primary_location":{"id":"doi:10.1109/trustcom66490.2025.00360","is_oa":false,"landing_page_url":"https://doi.org/10.1109/trustcom66490.2025.00360","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 24th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5124808559","display_name":"Yixuan Cao","orcid":null},"institutions":[{"id":"https://openalex.org/I154130895","display_name":"University of Auckland","ror":"https://ror.org/03b94tp07","country_code":"NZ","type":"education","lineage":["https://openalex.org/I154130895"]}],"countries":["NZ"],"is_corresponding":false,"raw_author_name":"Yixuan Cao","raw_affiliation_strings":["The University of Auckland,School of Computer Science,Auckland,New Zealand"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"The University of Auckland,School of Computer Science,Auckland,New Zealand","institution_ids":["https://openalex.org/I154130895"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5046437897","display_name":"Aniket Mahanti","orcid":"https://orcid.org/0000-0002-6545-3073"},"institutions":[{"id":"https://openalex.org/I154130895","display_name":"University of Auckland","ror":"https://ror.org/03b94tp07","country_code":"NZ","type":"education","lineage":["https://openalex.org/I154130895"]}],"countries":["NZ"],"is_corresponding":false,"raw_author_name":"Aniket Mahanti","raw_affiliation_strings":["The University of Auckland,School of Computer Science,Auckland,New Zealand"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"The University of Auckland,School of Computer Science,Auckland,New Zealand","institution_ids":["https://openalex.org/I154130895"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5054337099","display_name":"Ranesh Kumar Naha","orcid":"https://orcid.org/0000-0003-4165-9349"},"institutions":[{"id":"https://openalex.org/I160993911","display_name":"Queensland University of Technology","ror":"https://ror.org/03pnv4752","country_code":"AU","type":"education","lineage":["https://openalex.org/I160993911"]}],"countries":["AU"],"is_corresponding":false,"raw_author_name":"Ranesh Naha","raw_affiliation_strings":["Queensland University of Technology,School of Information Systems,Brisbane,Australia"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Queensland University of Technology,School of Information Systems,Brisbane,Australia","institution_ids":["https://openalex.org/I160993911"]}]}],"institutions":[],"countries_distinct_count":2,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.63256816,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"3024","last_page":"3031"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10714","display_name":"Software-Defined Networks and 5G","score":0.5372999906539917,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10714","display_name":"Software-Defined Networks and 5G","score":0.5372999906539917,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10734","display_name":"Information and Cyber Security","score":0.14509999752044678,"subfield":{"id":"https://openalex.org/subfields/1710","display_name":"Information Systems"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10917","display_name":"Smart Grid Security and Resilience","score":0.06509999930858612,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8391000032424927},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.6931999921798706},{"id":"https://openalex.org/keywords/asynchronous-communication","display_name":"Asynchronous communication","score":0.6818000078201294},{"id":"https://openalex.org/keywords/latency","display_name":"Latency (audio)","score":0.4702000021934509},{"id":"https://openalex.org/keywords/deep-learning","display_name":"Deep learning","score":0.4699999988079071},{"id":"https://openalex.org/keywords/adaptation","display_name":"Adaptation (eye)","score":0.459199994802475},{"id":"https://openalex.org/keywords/baseline","display_name":"Baseline (sea)","score":0.45649999380111694}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8391000032424927},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7756999731063843},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.6931999921798706},{"id":"https://openalex.org/C151319957","wikidata":"https://www.wikidata.org/wiki/Q752739","display_name":"Asynchronous communication","level":2,"score":0.6818000078201294},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.4887000024318695},{"id":"https://openalex.org/C82876162","wikidata":"https://www.wikidata.org/wiki/Q17096504","display_name":"Latency (audio)","level":2,"score":0.4702000021934509},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.4699999988079071},{"id":"https://openalex.org/C139807058","wikidata":"https://www.wikidata.org/wiki/Q352374","display_name":"Adaptation (eye)","level":2,"score":0.459199994802475},{"id":"https://openalex.org/C12725497","wikidata":"https://www.wikidata.org/wiki/Q810247","display_name":"Baseline (sea)","level":2,"score":0.45649999380111694},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.448199987411499},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.42100000381469727},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3221000134944916},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.31619998812675476},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.30169999599456787},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2971000075340271},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.25589999556541443},{"id":"https://openalex.org/C175154964","wikidata":"https://www.wikidata.org/wiki/Q380077","display_name":"Task analysis","level":3,"score":0.25220000743865967}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/trustcom66490.2025.00360","is_oa":false,"landing_page_url":"https://doi.org/10.1109/trustcom66490.2025.00360","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 IEEE 24th International Conference on Trust, Security and Privacy in Computing and Communications (TrustCom)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":20,"referenced_works":["https://openalex.org/W2991435551","https://openalex.org/W3046697349","https://openalex.org/W3126468572","https://openalex.org/W3133743901","https://openalex.org/W4283217515","https://openalex.org/W4294811629","https://openalex.org/W4312058654","https://openalex.org/W4323342342","https://openalex.org/W4360615678","https://openalex.org/W4361292119","https://openalex.org/W4382793227","https://openalex.org/W4386159217","https://openalex.org/W4386349792","https://openalex.org/W4386503406","https://openalex.org/W4391221083","https://openalex.org/W4391450389","https://openalex.org/W4396700106","https://openalex.org/W4400489908","https://openalex.org/W4400772545","https://openalex.org/W4402159482"],"related_works":[],"abstract_inverted_index":{"As":[0],"networks":[1],"become":[2],"more":[3,9],"complex":[4,21,202],"and":[5,41,61,107,115,165,190,198],"interconnected,":[6],"they":[7],"grow":[8],"vulnerable":[10],"to":[11,70,89,93,178],"sophisticated":[12],"cyberattacks.":[13],"CyberBattleSim":[14],"provides":[15],"a":[16,27,131,188],"simulation":[17],"platform":[18],"for":[19],"modeling":[20],"attack-defense":[22],"interactions.":[23],"This":[24,175],"paper":[25],"presents":[26],"real-time":[28,191],"defense":[29,173,192],"framework":[30,80],"based":[31],"on":[32,52],"deep":[33,180],"reinforcement":[34,181],"learning,":[35],"integrating":[36],"Proximal":[37,76],"Policy":[38,77],"Optimization":[39,78],"(PPO)":[40],"Asynchronous":[42],"Advantage":[43],"Actor-Critic":[44],"(A3C).":[45],"While":[46],"prior":[47],"research":[48],"has":[49],"primarily":[50],"focused":[51],"improving":[53],"attacker":[54,126],"strategies":[55],"such":[56],"as":[57],"Rapid":[58],"ActorCritic":[59],"(RAC)":[60],"Double":[62],"Deep":[63,105],"Q-Learning":[64,106],"(DDQL),":[65],"this":[66],"work":[67],"shifts":[68],"attention":[69],"defender":[71],"adaptability.":[72],"The":[73],"proposed":[74],"Parallel":[75],"(PPPO)":[79],"combines":[81],"PPO\u2019s":[82],"policy":[83],"stability":[84],"with":[85],"A3C\u2019s":[86],"asynchronous":[87],"parallelism":[88],"enable":[90],"rapid":[91],"adaptation":[92],"evolving":[94],"threats.":[95],"Simulation":[96],"results":[97],"demonstrate":[98],"that":[99],"PPPO":[100,119,168],"outperforms":[101],"baseline":[102],"approaches,":[103],"including":[104],"random":[108],"policies":[109],"in":[110,169,184,201],"terms":[111],"of":[112,135,149,167,195],"cumulative":[113],"rewards":[114],"network":[116,203],"availability.":[117],"Notably,":[118],"maintains":[120],"high":[121],"availability":[122],"even":[123],"under":[124],"multiple":[125],"scenarios.":[127],"Real-time":[128],"evaluations":[129],"reveal":[130],"peak":[132],"response":[133],"latency":[134],"0.005":[136],"seconds":[137],"when":[138],"utilizing":[139],"five":[140],"parallel":[141],"agents.":[142],"Comparative":[143],"experiments":[144],"further":[145],"highlight":[146],"the":[147,163],"efficiency":[148],"GPU-based":[150],"implementations,":[151],"which":[152],"achieve":[153],"significantly":[154],"faster":[155],"training":[156],"than":[157],"CPU-based":[158],"versions.":[159],"These":[160],"findings":[161],"underscore":[162],"effectiveness":[164],"scalability":[166],"enabling":[170],"adaptive,":[171],"autonomous":[172],"mechanisms.":[174],"study":[176],"contributes":[177],"advancing":[179],"learning":[182],"applications":[183],"cybersecurity":[185],"by":[186],"providing":[187],"robust":[189],"strategy":[193],"capable":[194],"mitigating":[196],"unknown":[197],"dynamic":[199],"attacks":[200],"environments.":[204]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-02-03T00:00:00"}
