{"id":"https://openalex.org/W7162693348","doi":"https://doi.org/10.48550/arxiv.2605.28372","title":"Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning","display_name":"Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning","publication_year":2026,"publication_date":"2026-05-27","ids":{"openalex":"https://openalex.org/W7162693348","doi":"https://doi.org/10.48550/arxiv.2605.28372"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2605.28372","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.28372","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2605.28372","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5102632766","display_name":"Meraj Mammadov","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mammadov, Meraj","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5137284460","display_name":"Pedro Zuidberg Dos Martires","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Martires, Pedro Zuidberg Dos","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5023785357","display_name":"Johannes A. Stork","orcid":"https://orcid.org/0000-0003-3958-6179"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Stork, Johannes Andreas","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7523999810218811,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.7523999810218811,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10653","display_name":"Robot Manipulation and Learning","score":0.12600000202655792,"subfield":{"id":"https://openalex.org/subfields/2207","display_name":"Control and Systems Engineering"},"field":{"id":"https://openalex.org/fields/22","display_name":"Engineering"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.01269999984651804,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7512000203132629},{"id":"https://openalex.org/keywords/imitation","display_name":"Imitation","score":0.7289999723434448},{"id":"https://openalex.org/keywords/embedding","display_name":"Embedding","score":0.6410999894142151},{"id":"https://openalex.org/keywords/curse-of-dimensionality","display_name":"Curse of dimensionality","score":0.5426999926567078},{"id":"https://openalex.org/keywords/limiting","display_name":"Limiting","score":0.5327000021934509},{"id":"https://openalex.org/keywords/space","display_name":"Space (punctuation)","score":0.510699987411499},{"id":"https://openalex.org/keywords/state-space","display_name":"State space","score":0.44530001282691956},{"id":"https://openalex.org/keywords/train","display_name":"Train","score":0.4424999952316284}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7512000203132629},{"id":"https://openalex.org/C126388530","wikidata":"https://www.wikidata.org/wiki/Q1131737","display_name":"Imitation","level":2,"score":0.7289999723434448},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6730999946594238},{"id":"https://openalex.org/C41608201","wikidata":"https://www.wikidata.org/wiki/Q980509","display_name":"Embedding","level":2,"score":0.6410999894142151},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.560699999332428},{"id":"https://openalex.org/C111030470","wikidata":"https://www.wikidata.org/wiki/Q1430460","display_name":"Curse of dimensionality","level":2,"score":0.5426999926567078},{"id":"https://openalex.org/C188198153","wikidata":"https://www.wikidata.org/wiki/Q1613840","display_name":"Limiting","level":2,"score":0.5327000021934509},{"id":"https://openalex.org/C2778572836","wikidata":"https://www.wikidata.org/wiki/Q380933","display_name":"Space (punctuation)","level":2,"score":0.510699987411499},{"id":"https://openalex.org/C72434380","wikidata":"https://www.wikidata.org/wiki/Q230930","display_name":"State space","level":2,"score":0.44530001282691956},{"id":"https://openalex.org/C190839683","wikidata":"https://www.wikidata.org/wiki/Q2448197","display_name":"Train","level":2,"score":0.4424999952316284},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.4325999915599823},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.40720000863075256},{"id":"https://openalex.org/C48103436","wikidata":"https://www.wikidata.org/wiki/Q599031","display_name":"State (computer science)","level":2,"score":0.3693000078201294},{"id":"https://openalex.org/C125411270","wikidata":"https://www.wikidata.org/wiki/Q18653","display_name":"Encoding (memory)","level":2,"score":0.33180001378059387},{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.30640000104904175},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.27399998903274536},{"id":"https://openalex.org/C33676613","wikidata":"https://www.wikidata.org/wiki/Q13415176","display_name":"Dimension (graph theory)","level":2,"score":0.2680000066757202},{"id":"https://openalex.org/C2780273121","wikidata":"https://www.wikidata.org/wiki/Q109411","display_name":"Curse","level":2,"score":0.2660999894142151},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.26489999890327454},{"id":"https://openalex.org/C88626702","wikidata":"https://www.wikidata.org/wiki/Q1128903","display_name":"Continuation","level":2,"score":0.25}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2605.28372","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.28372","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2605.28372","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2605.28372","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.5954425930976868,"id":"https://metadata.un.org/sdg/1","display_name":"No poverty"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Imitation":[0],"learning":[1,7,118],"(IL)":[2],"from":[3,64,128,136],"a":[4,11,81,88,93],"state-based":[5],"reinforcement":[6],"(RL)":[8],"policy":[9,49,124],"is":[10],"common":[12],"approach":[13],"to":[14,53,121,150],"overcome":[15],"the":[16,32,47,51,60,111,122,138],"curse":[17],"of":[18,68],"dimensionality":[19],"in":[20,27,44,119],"complex":[21],"and":[22,40,46,101,125,148],"high-dimensional":[23],"observation":[24],"spaces":[25],"prevalent":[26],"robotics.":[28],"This":[29],"paper":[30],"addresses":[31],"irreducible":[33],"imitation":[34,164],"gap":[35],"that":[36,59,97,154],"emerges":[37],"when":[38],"teacher":[39,48,105,123],"student":[41,61,71,159],"are":[42],"learned":[43],"isolation,":[45],"has":[50],"liberty":[52],"rely":[54],"on":[55,144],"privileged":[56],"state":[57],"information":[58,131],"cannot":[62],"infer":[63],"its":[65,134],"observations.":[66],"Instead":[67],"improving":[69],"poor":[70],"performance":[72,160],"with":[73,115,161],"RL":[74],"finetuning":[75],"after":[76],"IL,":[77],"which":[78,91],"often":[79],"requires":[80],"whole":[82],"new":[83],"training":[84],"setup,":[85],"we":[86],"propose":[87],"novel":[89],"algorithm":[90,156],"learns":[92],"shared":[94,112],"embedding":[95,113],"space":[96,114],"hides":[98],"agent-specific":[99],"observations":[100],"thus":[102],"trains":[103],"imitable":[104],"policies":[106],"by":[107,132],"construction.":[108],"We":[109,141],"train":[110],"self-supervised":[116],"contrastive":[117],"parallel":[120],"prevent":[126],"it":[127],"extracting":[129],"private":[130],"limiting":[133],"gradients":[135],"updating":[137],"encoder":[139],"networks.":[140],"perform":[142],"evaluations":[143],"several":[145],"example":[146],"domains":[147],"compare":[149],"state-of-the-art":[151],"baselines":[152],"showing":[153],"our":[155],"enables":[157],"higher":[158],"substantially":[162],"reduced":[163],"gap.":[165]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-05-29T00:00:00"}
