{"id":"https://openalex.org/W2067412374","doi":"https://doi.org/10.1145/1082473.1082483","title":"Efficient learning of multi-step best response","display_name":"Efficient learning of multi-step best response","publication_year":2005,"publication_date":"2005-07-25","ids":{"openalex":"https://openalex.org/W2067412374","doi":"https://doi.org/10.1145/1082473.1082483","mag":"2067412374"},"language":"en","primary_location":{"id":"doi:10.1145/1082473.1082483","is_oa":false,"landing_page_url":"https://doi.org/10.1145/1082473.1082483","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the fourth international joint conference on Autonomous agents and multiagent systems","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5025954824","display_name":"Bikramjit Banerjee","orcid":"https://orcid.org/0000-0001-7999-0307"},"institutions":[{"id":"https://openalex.org/I114832834","display_name":"Tulane University","ror":"https://ror.org/04vmvtb21","country_code":"US","type":"education","lineage":["https://openalex.org/I114832834"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Bikramjit Banerjee","raw_affiliation_strings":["Tulane University, New Orleans, LA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Tulane University, New Orleans, LA","institution_ids":["https://openalex.org/I114832834"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5072128915","display_name":"Jing Peng","orcid":"https://orcid.org/0000-0001-5490-6228"},"institutions":[{"id":"https://openalex.org/I114832834","display_name":"Tulane University","ror":"https://ror.org/04vmvtb21","country_code":"US","type":"education","lineage":["https://openalex.org/I114832834"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Jing Peng","raw_affiliation_strings":["Tulane University, New Orleans, LA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Tulane University, New Orleans, LA","institution_ids":["https://openalex.org/I114832834"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":1,"corresponding_author_ids":[],"corresponding_institution_ids":["https://openalex.org/I114832834"],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":18,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"60","last_page":"66"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10646","display_name":"Experimental Behavioral Economics Studies","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/3311","display_name":"Safety Research"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T10646","display_name":"Experimental Behavioral Economics Studies","score":0.9991999864578247,"subfield":{"id":"https://openalex.org/subfields/3311","display_name":"Safety Research"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11252","display_name":"Evolutionary Game Theory and Cooperation","score":0.9977999925613403,"subfield":{"id":"https://openalex.org/subfields/3312","display_name":"Sociology and Political Science"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11031","display_name":"Game Theory and Applications","score":0.9976000189781189,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/markov-decision-process","display_name":"Markov decision process","score":0.7945244908332825},{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.7464513778686523},{"id":"https://openalex.org/keywords/adversary","display_name":"Adversary","score":0.6313596963882446},{"id":"https://openalex.org/keywords/domain","display_name":"Domain (mathematical analysis)","score":0.5234631896018982},{"id":"https://openalex.org/keywords/game-theory","display_name":"Game theory","score":0.5228703022003174},{"id":"https://openalex.org/keywords/simple","display_name":"Simple (philosophy)","score":0.5115047693252563},{"id":"https://openalex.org/keywords/focus","display_name":"Focus (optics)","score":0.49726155400276184},{"id":"https://openalex.org/keywords/mathematical-optimization","display_name":"Mathematical optimization","score":0.49566519260406494},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.4805077314376831},{"id":"https://openalex.org/keywords/dilemma","display_name":"Dilemma","score":0.47757771611213684},{"id":"https://openalex.org/keywords/repeated-game","display_name":"Repeated game","score":0.4561573266983032},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.45602649450302124},{"id":"https://openalex.org/keywords/artificial-intelligence","display_name":"Artificial intelligence","score":0.44938012957572937},{"id":"https://openalex.org/keywords/markov-process","display_name":"Markov process","score":0.44742539525032043},{"id":"https://openalex.org/keywords/best-response","display_name":"Best response","score":0.440624862909317},{"id":"https://openalex.org/keywords/machine-learning","display_name":"Machine learning","score":0.349903404712677},{"id":"https://openalex.org/keywords/nash-equilibrium","display_name":"Nash equilibrium","score":0.2173652946949005},{"id":"https://openalex.org/keywords/mathematical-economics","display_name":"Mathematical economics","score":0.18733790516853333},{"id":"https://openalex.org/keywords/mathematics","display_name":"Mathematics","score":0.15535342693328857},{"id":"https://openalex.org/keywords/computer-security","display_name":"Computer security","score":0.10659217834472656}],"concepts":[{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.7945244908332825},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7464513778686523},{"id":"https://openalex.org/C41065033","wikidata":"https://www.wikidata.org/wiki/Q2825412","display_name":"Adversary","level":2,"score":0.6313596963882446},{"id":"https://openalex.org/C36503486","wikidata":"https://www.wikidata.org/wiki/Q11235244","display_name":"Domain (mathematical analysis)","level":2,"score":0.5234631896018982},{"id":"https://openalex.org/C177142836","wikidata":"https://www.wikidata.org/wiki/Q44455","display_name":"Game theory","level":2,"score":0.5228703022003174},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.5115047693252563},{"id":"https://openalex.org/C192209626","wikidata":"https://www.wikidata.org/wiki/Q190909","display_name":"Focus (optics)","level":2,"score":0.49726155400276184},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.49566519260406494},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.4805077314376831},{"id":"https://openalex.org/C2778496695","wikidata":"https://www.wikidata.org/wiki/Q254128","display_name":"Dilemma","level":2,"score":0.47757771611213684},{"id":"https://openalex.org/C202556891","wikidata":"https://www.wikidata.org/wiki/Q1584646","display_name":"Repeated game","level":3,"score":0.4561573266983032},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.45602649450302124},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.44938012957572937},{"id":"https://openalex.org/C159886148","wikidata":"https://www.wikidata.org/wiki/Q176645","display_name":"Markov process","level":2,"score":0.44742539525032043},{"id":"https://openalex.org/C32407928","wikidata":"https://www.wikidata.org/wiki/Q2733833","display_name":"Best response","level":3,"score":0.440624862909317},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.349903404712677},{"id":"https://openalex.org/C46814582","wikidata":"https://www.wikidata.org/wiki/Q23389","display_name":"Nash equilibrium","level":2,"score":0.2173652946949005},{"id":"https://openalex.org/C144237770","wikidata":"https://www.wikidata.org/wiki/Q747534","display_name":"Mathematical economics","level":1,"score":0.18733790516853333},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.15535342693328857},{"id":"https://openalex.org/C38652104","wikidata":"https://www.wikidata.org/wiki/Q3510521","display_name":"Computer security","level":1,"score":0.10659217834472656},{"id":"https://openalex.org/C138885662","wikidata":"https://www.wikidata.org/wiki/Q5891","display_name":"Philosophy","level":0,"score":0.0},{"id":"https://openalex.org/C2524010","wikidata":"https://www.wikidata.org/wiki/Q8087","display_name":"Geometry","level":1,"score":0.0},{"id":"https://openalex.org/C105795698","wikidata":"https://www.wikidata.org/wiki/Q12483","display_name":"Statistics","level":1,"score":0.0},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.0},{"id":"https://openalex.org/C120665830","wikidata":"https://www.wikidata.org/wiki/Q14620","display_name":"Optics","level":1,"score":0.0},{"id":"https://openalex.org/C111472728","wikidata":"https://www.wikidata.org/wiki/Q9471","display_name":"Epistemology","level":1,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C134306372","wikidata":"https://www.wikidata.org/wiki/Q7754","display_name":"Mathematical analysis","level":1,"score":0.0}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.1145/1082473.1082483","is_oa":false,"landing_page_url":"https://doi.org/10.1145/1082473.1082483","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the fourth international joint conference on Autonomous agents and multiagent systems","raw_type":"proceedings-article"},{"id":"pmh:oai:CiteSeerX.psu:10.1.1.103.7979","is_oa":false,"landing_page_url":"http://citeseerx.ist.psu.edu/viewdoc/summary?doi=10.1.1.103.7979","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"http://www.cs.usm.edu/~banerjee/papers/p621-Banerjee.pdf","raw_type":"text"}],"best_oa_location":null,"sustainable_development_goals":[{"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions","score":0.800000011920929}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":32,"referenced_works":["https://openalex.org/W107583932","https://openalex.org/W1481781224","https://openalex.org/W1505937442","https://openalex.org/W1508634047","https://openalex.org/W1544193923","https://openalex.org/W1583837637","https://openalex.org/W1607392272","https://openalex.org/W1991548885","https://openalex.org/W2006198267","https://openalex.org/W2062663664","https://openalex.org/W2077400689","https://openalex.org/W2083143894","https://openalex.org/W2097498347","https://openalex.org/W2098432798","https://openalex.org/W2103437045","https://openalex.org/W2109223704","https://openalex.org/W2120327309","https://openalex.org/W2153866264","https://openalex.org/W2161521419","https://openalex.org/W2165421048","https://openalex.org/W2167448192","https://openalex.org/W2492794003","https://openalex.org/W2612972698","https://openalex.org/W2613328405","https://openalex.org/W2951054971","https://openalex.org/W2999905431","https://openalex.org/W3023407077","https://openalex.org/W4243845907","https://openalex.org/W4285719527","https://openalex.org/W6665817581","https://openalex.org/W6674995601","https://openalex.org/W6684096483"],"related_works":["https://openalex.org/W2276575217","https://openalex.org/W190963404","https://openalex.org/W2141950114","https://openalex.org/W4372324527","https://openalex.org/W2134321370","https://openalex.org/W2071306797","https://openalex.org/W1548919438","https://openalex.org/W4365460918","https://openalex.org/W4226246080","https://openalex.org/W3210899448"],"abstract_inverted_index":{"We":[0,27,59],"provide":[1],"a":[2,8,23,40,72,95],"uniform":[3],"framework":[4],"for":[5,52],"learning":[6,30,53],"against":[7,77],"recent":[9],"history":[10],"adversary":[11],"in":[12,35,56,80,98],"arbitrary":[13],"repeated":[14],"bimatrix":[15],"games,":[16],"by":[17],"modeling":[18],"such":[19,36,57],"an":[20,31,37,45],"agent":[21],"as":[22],"Markov":[24],"Decision":[25],"Process.":[26],"focus":[28],"on":[29],"optimal":[32,54],"non-stationary":[33],"policy":[34],"MDP":[38],"over":[39],"finite":[41],"horizon":[42],"and":[43],"adapt":[44],"existing":[46],"efficient":[47,64,75],"Monte":[48],"Carlo":[49],"based":[50],"algorithm":[51,65,76],"policies":[55],"MDPs.":[58],"show":[60],"that":[61,104,112],"this":[62,85],"new":[63],"can":[66,123],"obtain":[67],"higher":[68],"average":[69],"rewards":[70],"than":[71],"previously":[73],"known":[74],"some":[78],"opponents":[79],"the":[81,89,99,113,121],"contract":[82],"game.":[83],"Though":[84],"improvement":[86],"comes":[87],"at":[88],"cost":[90],"of":[91],"increased":[92],"domain":[93,109],"knowledge,":[94],"simple":[96],"experiment":[97],"Prisoner's":[100],"Dilemma":[101],"game":[102],"shows":[103],"even":[105],"when":[106],"no":[107],"extra":[108],"knowledge":[110],"(besides":[111],"opponent's":[114],"memory":[115],"size":[116],"is":[117,119],"known)":[118],"assumed,":[120],"error":[122],"still":[124],"be":[125],"small.":[126]},"counts_by_year":[{"year":2021,"cited_by_count":1},{"year":2019,"cited_by_count":2},{"year":2017,"cited_by_count":1},{"year":2016,"cited_by_count":3},{"year":2015,"cited_by_count":1},{"year":2014,"cited_by_count":1},{"year":2012,"cited_by_count":1}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
