{"id":"https://openalex.org/W7133813781","doi":"https://doi.org/10.48550/arxiv.2603.03778","title":"Inverse Contextual Bandits without Rewards: Learning from a Non-Stationary Learner via Suffix Imitation","display_name":"Inverse Contextual Bandits without Rewards: Learning from a Non-Stationary Learner via Suffix Imitation","publication_year":2026,"publication_date":"2026-03-04","ids":{"openalex":"https://openalex.org/W7133813781","doi":"https://doi.org/10.48550/arxiv.2603.03778"},"language":null,"primary_location":{"id":"pmh:doi:10.48550/arxiv.2603.03778","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"type":"article","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":null,"any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5039495377","display_name":"Yuqi Kong","orcid":"https://orcid.org/0009-0001-9439-3188"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kong, Yuqi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5128202135","display_name":"Xiao Zhang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhang, Xiao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5128213024","display_name":"Weiran Shen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shen, Weiran","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.2296695,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.6545000076293945,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T12101","display_name":"Advanced Bandit Algorithms Research","score":0.6545000076293945,"subfield":{"id":"https://openalex.org/subfields/1803","display_name":"Management Science and Operations Research"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.20739999413490295,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12072","display_name":"Machine Learning and Algorithms","score":0.049400001764297485,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/suffix","display_name":"Suffix","score":0.5368000268936157},{"id":"https://openalex.org/keywords/imitation","display_name":"Imitation","score":0.49970000982284546},{"id":"https://openalex.org/keywords/observer","display_name":"Observer (physics)","score":0.4634000062942505},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.46299999952316284},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.43939998745918274},{"id":"https://openalex.org/keywords/minification","display_name":"Minification","score":0.42080000042915344},{"id":"https://openalex.org/keywords/convergence","display_name":"Convergence (economics)","score":0.40860000252723694},{"id":"https://openalex.org/keywords/simple","display_name":"Simple (philosophy)","score":0.39899998903274536},{"id":"https://openalex.org/keywords/inverse","display_name":"Inverse","score":0.3808000087738037}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6963000297546387},{"id":"https://openalex.org/C2779804580","wikidata":"https://www.wikidata.org/wiki/Q102047","display_name":"Suffix","level":2,"score":0.5368000268936157},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5198000073432922},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.49970000982284546},{"id":"https://openalex.org/C2780704645","wikidata":"https://www.wikidata.org/wiki/Q9251458","display_name":"Observer (physics)","level":2,"score":0.4634000062942505},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.46299999952316284},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4519999921321869},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.43939998745918274},{"id":"https://openalex.org/C147764199","wikidata":"https://www.wikidata.org/wiki/Q6865248","display_name":"Minification","level":2,"score":0.42080000042915344},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.40860000252723694},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.39899998903274536},{"id":"https://openalex.org/C207467116","wikidata":"https://www.wikidata.org/wiki/Q4385666","display_name":"Inverse","level":2,"score":0.3808000087738037},{"id":"https://openalex.org/C107321475","wikidata":"https://www.wikidata.org/wiki/Q5374254","display_name":"Empirical risk minimization","level":2,"score":0.3458000123500824},{"id":"https://openalex.org/C108154423","wikidata":"https://www.wikidata.org/wiki/Q1469792","display_name":"Salience (neuroscience)","level":2,"score":0.31310001015663147},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.2890999913215637},{"id":"https://openalex.org/C75553542","wikidata":"https://www.wikidata.org/wiki/Q178161","display_name":"A priori and a posteriori","level":2,"score":0.28200000524520874},{"id":"https://openalex.org/C80444323","wikidata":"https://www.wikidata.org/wiki/Q2878974","display_name":"Theoretical computer science","level":1,"score":0.2815999984741211},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.2815000116825104},{"id":"https://openalex.org/C77553402","wikidata":"https://www.wikidata.org/wiki/Q13222579","display_name":"Upper and lower bounds","level":2,"score":0.27219998836517334},{"id":"https://openalex.org/C57869625","wikidata":"https://www.wikidata.org/wiki/Q1783502","display_name":"Rate of convergence","level":3,"score":0.2700999975204468},{"id":"https://openalex.org/C2776135515","wikidata":"https://www.wikidata.org/wiki/Q17143721","display_name":"Regularization (linguistics)","level":2,"score":0.25540000200271606},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.2547999918460846},{"id":"https://openalex.org/C2986087404","wikidata":"https://www.wikidata.org/wiki/Q15946010","display_name":"Online learning","level":2,"score":0.2542000114917755},{"id":"https://openalex.org/C66746571","wikidata":"https://www.wikidata.org/wiki/Q1134833","display_name":"ENCODE","level":3,"score":0.2540999948978424},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.25029999017715454}],"mesh":[],"locations_count":2,"locations":[{"id":"pmh:doi:10.48550/arxiv.2603.03778","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},{"id":"doi:10.48550/arxiv.2603.03778","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.03778","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"pmh:doi:10.48550/arxiv.2603.03778","is_oa":true,"landing_page_url":null,"pdf_url":null,"source":{"id":"https://openalex.org/S4406922384","display_name":"Open MIND","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":null,"host_organization_name":null,"host_organization_lineage":[],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Article"},"sustainable_development_goals":[{"score":0.6273552775382996,"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"We":[0,99],"study":[1],"the":[2,23,33,38,41,60,109,114,120,139,157,169],"Inverse":[3],"Contextual":[4],"Bandit":[5],"(ICB)":[6],"problem,":[7],"in":[8,51],"which":[9],"a":[10,15,68,95,101,127,132,143,151],"learner":[11,170],"seeks":[12],"to":[13,31,48,166],"optimize":[14],"policy":[16,159],"while":[17],"an":[18,82],"observer,":[19],"who":[20],"cannot":[21],"access":[22],"learner's":[24,42],"rewards":[25],"and":[26,70,86],"only":[27,92],"observes":[28],"actions,":[29],"aims":[30],"recover":[32],"underlying":[34],"problem":[35],"parameters.":[36],"During":[37],"learning":[39],"process,":[40],"behavior":[43],"naturally":[44],"transitions":[45],"from":[46,81,94,160],"exploration":[47],"exploitation,":[49],"resulting":[50],"non-stationary":[52],"action":[53],"data":[54,80,93],"that":[55,106,126,150,167],"poses":[56],"significant":[57],"challenges":[58],"for":[59],"observer.":[61],"To":[62],"address":[63],"this":[64],"issue,":[65],"we":[66,124],"propose":[67],"simple":[69],"effective":[71],"framework":[72,78],"called":[73],"Two-Phase":[74],"Suffix":[75],"Imitation.":[76],"The":[77],"discards":[79],"initial":[83],"burn-in":[84,117],"phase":[85],"performs":[87],"empirical":[88],"risk":[89],"minimization":[90],"using":[91],"subsequent":[96],"imitation":[97],"phase.":[98],"derive":[100],"predictive":[102],"decision":[103],"loss":[104],"bound":[105],"explicitly":[107],"characterizes":[108],"bias-variance":[110],"trade-off":[111],"induced":[112],"by":[113],"choice":[115],"of":[116,135,142,168],"length.":[118],"Despite":[119],"severe":[121],"information":[122],"deficit,":[123],"show":[125],"reward-free":[128],"observer":[129,153],"can":[130,154],"achieve":[131],"convergence":[133],"rate":[134],"$\\tilde":[136],"O(1/\\sqrt{N})$,":[137],"matching":[138],"asymptotic":[140],"efficiency":[141],"fully":[144],"reward-aware":[145],"learner.":[146],"This":[147],"result":[148],"demonstrates":[149],"passive":[152],"effectively":[155],"uncover":[156],"optimal":[158],"actions":[161],"alone,":[162],"attaining":[163],"performance":[164],"comparable":[165],"itself.":[171]},"counts_by_year":[],"updated_date":"2026-07-15T18:14:33.161393","created_date":"2026-03-06T00:00:00"}
