{"id":"https://openalex.org/W7172299738","doi":"https://doi.org/10.48550/arxiv.2607.29617","title":"When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning","display_name":"When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning","publication_year":2026,"publication_date":"2026-07-31","ids":{"openalex":"https://openalex.org/W7172299738","doi":"https://doi.org/10.48550/arxiv.2607.29617"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2607.29617","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.29617","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2607.29617","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5144276066","display_name":"Luca Viano","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Viano, Luca","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5144291389","display_name":"Antoine Moulin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Moulin, Antoine","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5144290701","display_name":"Audrey Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Huang, Audrey","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5144293038","display_name":"Volkan Cevher","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cevher, Volkan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5051361569","display_name":"Philip Amortila","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Amortila, Philip","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5075069827","display_name":"Dylan J. Foster","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Foster, Dylan J.","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7135000228881836,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7135000228881836,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.09130000323057175,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.05510000139474869,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/function","display_name":"Function (biology)","score":0.5432000160217285},{"id":"https://openalex.org/keywords/value","display_name":"Value (mathematics)","score":0.4932999908924103},{"id":"https://openalex.org/keywords/interpretability","display_name":"Interpretability","score":0.4927999973297119},{"id":"https://openalex.org/keywords/complement","display_name":"Complement (music)","score":0.47780001163482666},{"id":"https://openalex.org/keywords/maximization","display_name":"Maximization","score":0.42080000042915344},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.37220001220703125},{"id":"https://openalex.org/keywords/imitation","display_name":"Imitation","score":0.351500004529953}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7389000058174133},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6572999954223633},{"id":"https://openalex.org/C14036430","wikidata":"https://www.wikidata.org/wiki/Q3736076","display_name":"Function (biology)","level":2,"score":0.5432000160217285},{"id":"https://openalex.org/C2776291640","wikidata":"https://www.wikidata.org/wiki/Q2912517","display_name":"Value (mathematics)","level":2,"score":0.4932999908924103},{"id":"https://openalex.org/C2781067378","wikidata":"https://www.wikidata.org/wiki/Q17027399","display_name":"Interpretability","level":2,"score":0.4927999973297119},{"id":"https://openalex.org/C112313634","wikidata":"https://www.wikidata.org/wiki/Q7886648","display_name":"Complement (music)","level":5,"score":0.47780001163482666},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.4724000096321106},{"id":"https://openalex.org/C2776330181","wikidata":"https://www.wikidata.org/wiki/Q18358244","display_name":"Maximization","level":2,"score":0.42080000042915344},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.37220001220703125},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.351500004529953},{"id":"https://openalex.org/C2780598303","wikidata":"https://www.wikidata.org/wiki/Q65921492","display_name":"Flexibility (engineering)","level":2,"score":0.3506999909877777},{"id":"https://openalex.org/C2776378722","wikidata":"https://www.wikidata.org/wiki/Q3454417","display_name":"Realizability","level":2,"score":0.34850001335144043},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.2953999936580658},{"id":"https://openalex.org/C2778220771","wikidata":"https://www.wikidata.org/wiki/Q1522579","display_name":"Substitution (logic)","level":2,"score":0.288100004196167},{"id":"https://openalex.org/C90509273","wikidata":"https://www.wikidata.org/wiki/Q11012","display_name":"Robot","level":2,"score":0.2797999978065491},{"id":"https://openalex.org/C2781162219","wikidata":"https://www.wikidata.org/wiki/Q26250693","display_name":"Replicate","level":2,"score":0.27480000257492065},{"id":"https://openalex.org/C77618280","wikidata":"https://www.wikidata.org/wiki/Q1155772","display_name":"Scheme (mathematics)","level":2,"score":0.26460000872612},{"id":"https://openalex.org/C34413123","wikidata":"https://www.wikidata.org/wiki/Q170978","display_name":"Robotics","level":3,"score":0.2614000141620636},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.2549000084400177}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2607.29617","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.29617","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2607.29617","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2607.29617","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Imitation":[0],"learning":[1],"(IL)---training":[2],"an":[3,142],"agent":[4],"to":[5,14,27,57,76,165],"replicate":[6],"expert":[7,62,106,201],"behavior":[8],"from":[9,12,29],"demonstrations---underpins":[10],"applications":[11],"robotics":[13],"language":[15],"model":[16,119],"training.":[17],"Standard":[18],"approaches":[19],"such":[20],"as":[21],"Behavior":[22],"Cloning":[23],"(BC)":[24],"are":[25,53],"known":[26],"suffer":[28],"compounding":[30],"errors":[31],"and":[32,69,96,160,217],"performance":[33],"plateaus,":[34],"particularly":[35],"when":[36,226],"the":[37,42,61,65,84,91,109,113,123,128,134,152,156,197,200,223,227,235],"learner":[38,153,228],"cannot":[39],"perfectly":[40],"represent":[41,155],"expert's":[43,85,124,135,157],"policy":[44,79,136,202],"(as":[45],"is":[46,104,148,180,230],"typical,":[47],"e.g.,":[48],"in":[49],"distillation).":[50],"Two":[51],"interventions":[52],"widely":[54],"understood":[55],"empirically":[56],"improve":[58],"performance:":[59],"querying":[60],"interactively":[63],"along":[64],"learner's":[66],"own":[67],"trajectories,":[68],"using":[70],"value":[71,125,158],"function":[72,159],"estimation":[73],"en":[74],"route":[75],"generating":[77],"a":[78,118,166,174],"rather":[80],"than":[81,234],"directly":[82],"fitting":[83],"full":[86],"action":[87],"distribution.":[88],"We":[89,170],"investigate":[90],"nature":[92],"of":[93,121,132,199],"these":[94],"improvements":[95],"their":[97],"potentially":[98],"surprising":[99],"interplay.":[100],"Our":[101,204],"main":[102],"finding":[103],"that":[105,147,178],"interaction":[107,179],"relaxes":[108],"representational":[110],"demands":[111],"on":[112],"learner:":[114],"one":[115],"only":[116],"needs":[117],"capable":[120],"realizing":[122,133],"function,":[126],"bypassing":[127],"(often":[129],"stricter)":[130],"requirement":[131],"itself.":[137],"Concretely,":[138],"we":[139],"introduce":[140],"OVI,":[141],"interactive":[143,214],"on-policy":[144],"IL":[145,192,220],"algorithm":[146,193],"statistically":[149],"efficient":[150,162],"whenever":[151],"can":[154],"computationally":[161],"given":[163],"access":[164],"linear":[167],"maximization":[168],"oracle.":[169],"complement":[171],"this":[172],"with":[173,196,222],"negative":[175],"result":[176],"showing":[177],"necessary.":[181],"Namely,":[182],"without":[183],"stronger":[184],"assumptions":[185],"beyond":[186],"expert-value":[187],"realizability":[188],"alone,":[189],"any":[190],"offline":[191,211,218],"must":[194],"scale":[195],"complexity":[198],"class.":[203],"findings":[205],"bear":[206],"out":[207],"empirically.":[208],"OVI":[209],"outperforms":[210],"policy-based":[212,215],"(BC),":[213],"(DAgger),":[216],"value-based":[219],"methods,":[221],"largest":[224],"gains":[225],"network":[229],"substantially":[231],"less":[232],"expressive":[233],"expert's.":[236]},"counts_by_year":[],"updated_date":"2026-08-04T08:18:43.703281","created_date":"2026-08-04T00:00:00"}
