{"id":"https://openalex.org/W4416251296","doi":"https://doi.org/10.1109/ijcnn64981.2025.11227788","title":"A2CHoldem: An Intelligent Agent for Texas Hold\u2019em Based on Deep Reinforcement Learning","display_name":"A2CHoldem: An Intelligent Agent for Texas Hold\u2019em Based on Deep Reinforcement Learning","publication_year":2025,"publication_date":"2025-06-30","ids":{"openalex":"https://openalex.org/W4416251296","doi":"https://doi.org/10.1109/ijcnn64981.2025.11227788"},"language":null,"primary_location":{"id":"doi:10.1109/ijcnn64981.2025.11227788","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11227788","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5038792040","display_name":"Qilong Guo","orcid":"https://orcid.org/0000-0003-3357-5970"},"institutions":[{"id":"https://openalex.org/I125904092","display_name":"Shenyang Aerospace University","ror":"https://ror.org/02423gm04","country_code":"CN","type":"education","lineage":["https://openalex.org/I125904092"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Qilong Guo","raw_affiliation_strings":["Shenyang Aerospace University,College of Computer Science,Shenyang,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Shenyang Aerospace University,College of Computer Science,Shenyang,China","institution_ids":["https://openalex.org/I125904092"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100455413","display_name":"Yajie Wang","orcid":"https://orcid.org/0000-0002-0962-4464"},"institutions":[{"id":"https://openalex.org/I125904092","display_name":"Shenyang Aerospace University","ror":"https://ror.org/02423gm04","country_code":"CN","type":"education","lineage":["https://openalex.org/I125904092"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Yajie Wang","raw_affiliation_strings":["Shenyang Aerospace University,College of Computer Science,Shenyang,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Shenyang Aerospace University,College of Computer Science,Shenyang,China","institution_ids":["https://openalex.org/I125904092"]}]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101824702","display_name":"Shipeng Wang","orcid":"https://orcid.org/0000-0003-4586-8287"},"institutions":[{"id":"https://openalex.org/I125904092","display_name":"Shenyang Aerospace University","ror":"https://ror.org/02423gm04","country_code":"CN","type":"education","lineage":["https://openalex.org/I125904092"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Shipeng Wang","raw_affiliation_strings":["Shenyang Aerospace University,College of Computer Science,Shenyang,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Shenyang Aerospace University,College of Computer Science,Shenyang,China","institution_ids":["https://openalex.org/I125904092"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5101622809","display_name":"Tianyu Zhao","orcid":"https://orcid.org/0000-0002-5225-1763"},"institutions":[{"id":"https://openalex.org/I125904092","display_name":"Shenyang Aerospace University","ror":"https://ror.org/02423gm04","country_code":"CN","type":"education","lineage":["https://openalex.org/I125904092"]}],"countries":["CN"],"is_corresponding":false,"raw_author_name":"Tianyu Zhao","raw_affiliation_strings":["Shenyang Aerospace University,College of Computer Science,Shenyang,China"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Shenyang Aerospace University,College of Computer Science,Shenyang,China","institution_ids":["https://openalex.org/I125904092"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I125904092"],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.32381583,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1","last_page":"8"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11574","display_name":"Artificial Intelligence in Games","score":0.6614000201225281,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11574","display_name":"Artificial Intelligence in Games","score":0.6614000201225281,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.13670000433921814,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11241","display_name":"Advanced Malware Detection Techniques","score":0.024800000712275505,"subfield":{"id":"https://openalex.org/subfields/1711","display_name":"Signal Processing"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.8741000294685364},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.5629000067710876},{"id":"https://openalex.org/keywords/representation","display_name":"Representation (politics)","score":0.5447999835014343},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.5435000061988831},{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.49160000681877136},{"id":"https://openalex.org/keywords/imperfect","display_name":"Imperfect","score":0.49000000953674316},{"id":"https://openalex.org/keywords/state","display_name":"State (computer science)","score":0.4399000108242035},{"id":"https://openalex.org/keywords/acceleration","display_name":"Acceleration","score":0.41589999198913574}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.8741000294685364},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7124000191688538},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6919000148773193},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.5629000067710876},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.5605999827384949},{"id":"https://openalex.org/C2776359362","wikidata":"https://www.wikidata.org/wiki/Q2145286","display_name":"Representation (politics)","level":3,"score":0.5447999835014343},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.5435000061988831},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.49160000681877136},{"id":"https://openalex.org/C2780310539","wikidata":"https://www.wikidata.org/wiki/Q12547192","display_name":"Imperfect","level":2,"score":0.49000000953674316},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.4399000108242035},{"id":"https://openalex.org/C117896860","wikidata":"https://www.wikidata.org/wiki/Q11376","display_name":"Acceleration","level":2,"score":0.41589999198913574},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.35740000009536743},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.3237999975681305},{"id":"https://openalex.org/C196340769","wikidata":"https://www.wikidata.org/wiki/Q7698910","display_name":"Temporal difference learning","level":3,"score":0.3165999948978424},{"id":"https://openalex.org/C123676819","wikidata":"https://www.wikidata.org/wiki/Q1074338","display_name":"Perfect information","level":2,"score":0.3061999976634979},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.3003000020980835},{"id":"https://openalex.org/C74072328","wikidata":"https://www.wikidata.org/wiki/Q1142726","display_name":"Intelligent agent","level":2,"score":0.2842999994754791},{"id":"https://openalex.org/C59659247","wikidata":"https://www.wikidata.org/wiki/Q11990","display_name":"Reproduction","level":2,"score":0.27709999680519104},{"id":"https://openalex.org/C188116033","wikidata":"https://www.wikidata.org/wiki/Q2664563","display_name":"Q-learning","level":3,"score":0.2727000117301941},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.2632000148296356},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.25839999318122864}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1109/ijcnn64981.2025.11227788","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ijcnn64981.2025.11227788","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"2025 International Joint Conference on Neural Networks (IJCNN)","raw_type":"proceedings-article"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":20,"referenced_works":["https://openalex.org/W1490324987","https://openalex.org/W2006791053","https://openalex.org/W2064675550","https://openalex.org/W2114793692","https://openalex.org/W2194775991","https://openalex.org/W2537003064","https://openalex.org/W2562576832","https://openalex.org/W2574978968","https://openalex.org/W2761873684","https://openalex.org/W2773381986","https://openalex.org/W2960876848","https://openalex.org/W2966397236","https://openalex.org/W2989847975","https://openalex.org/W3100789280","https://openalex.org/W3151130473","https://openalex.org/W4283815845","https://openalex.org/W4312783956","https://openalex.org/W4319165238","https://openalex.org/W4388711601","https://openalex.org/W6922480057"],"related_works":[],"abstract_inverted_index":{"Heads-up":[0],"no-limit":[1],"Texas":[2],"Hold\u2019em":[3],"presents":[4],"significant":[5],"challenges":[6],"in":[7,45,152],"AI":[8],"due":[9],"to":[10,66,109],"its":[11],"imperfect":[12],"information":[13],"and":[14,84,92,113,133],"sparse":[15],"reward":[16,87],"system,":[17],"with":[18,80,89],"feedback":[19],"provided":[20],"only":[21],"at":[22],"the":[23,26,61,103],"end":[24],"of":[25,36,105,131,140,154],"game.":[27],"While":[28],"previous":[29],"research":[30],"has":[31],"achieved":[32],"notable":[33],"successes,":[34],"many":[35],"these":[37,68],"approaches":[38],"are":[39],"computationally":[40],"intensive,":[41],"limiting":[42],"their":[43],"practicality":[44],"broader":[46],"applications.":[47],"In":[48],"this":[49],"work,":[50],"we":[51,96],"introduce":[52],"A2CHoldem,":[53],"a":[54,85],"deep":[55],"reinforcement":[56],"learning":[57,107],"model":[58],"based":[59],"on":[60],"advantage":[62],"actor-critic":[63],"algorithm,":[64],"designed":[65],"address":[67],"challenges.":[69],"A2CHoldem":[70,119,146],"integrates":[71],"several":[72],"innovative":[73],"strategies,":[74],"including":[75],"an":[76],"enhanced":[77],"state":[78],"representation":[79],"continuous":[81],"chip":[82],"handling,":[83],"custom":[86],"function":[88],"intermediate":[90],"rewards":[91],"penalties.":[93],"During":[94],"training,":[95],"applied":[97],"various":[98],"acceleration":[99],"techniques,":[100],"among":[101],"them":[102],"incorporation":[104],"supervised":[106],"approaches,":[108],"enhance":[110],"convergence":[111],"speed":[112],"stability.":[114],"Experimental":[115],"results":[116,143],"indicate":[117],"that":[118,145],"achieves":[120],"132.5":[121],"mbb/h":[122,126,135],"against":[123,127,136],"Slumbot,":[124],"58.2":[125],"OpenDeepStack":[128],"(our":[129,138],"reproduction":[130,139],"DeepStack),":[132],"26.8":[134],"OpenAlphaHoldem":[137],"AlphaHoldem).":[141],"These":[142],"demonstrate":[144],"significantly":[147],"outperforms":[148],"all":[149],"three":[150],"models":[151],"terms":[153],"performance.":[155],"Additionally,":[156],"A2CHoldem\u2019s":[157],"single":[158],"decision":[159],"time":[160],"is":[161,167],"less":[162],"than":[163,170],"0.1":[164],"seconds,":[165],"which":[166],"substantially":[168],"faster":[169],"OpenDeepStack.":[171]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2025-11-14T00:00:00"}
