{"id":"https://openalex.org/W7101820877","doi":"https://doi.org/10.48550/arxiv.2510.23148","title":"Adapting Interleaved Encoders with PPO for Language-Guided Reinforcement Learning in BabyAI","display_name":"Adapting Interleaved Encoders with PPO for Language-Guided Reinforcement Learning in BabyAI","publication_year":2025,"publication_date":"2025-10-27","ids":{"openalex":"https://openalex.org/W7101820877","doi":"https://doi.org/10.48550/arxiv.2510.23148"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2510.23148","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2510.23148","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2510.23148","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Mathur, Aryan","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Mathur, Aryan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":null,"display_name":"Ahmed, Asaduddin","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ahmed, Asaduddin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":true,"primary_topic":{"id":"https://openalex.org/T12568","display_name":"Plant Taxonomy and Phylogenetics","score":0.1850000023841858,"subfield":{"id":"https://openalex.org/subfields/1105","display_name":"Ecology, Evolution, Behavior and Systematics"},"field":{"id":"https://openalex.org/fields/11","display_name":"Agricultural and Biological Sciences"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},"topics":[{"id":"https://openalex.org/T12568","display_name":"Plant Taxonomy and Phylogenetics","score":0.1850000023841858,"subfield":{"id":"https://openalex.org/subfields/1105","display_name":"Ecology, Evolution, Behavior and Systematics"},"field":{"id":"https://openalex.org/fields/11","display_name":"Agricultural and Biological Sciences"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T13168","display_name":"Plant Ecology and Taxonomy Studies","score":0.04360000044107437,"subfield":{"id":"https://openalex.org/subfields/1105","display_name":"Ecology, Evolution, Behavior and Systematics"},"field":{"id":"https://openalex.org/fields/11","display_name":"Agricultural and Biological Sciences"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}},{"id":"https://openalex.org/T12003","display_name":"Bioenergy crop production and management","score":0.033900000154972076,"subfield":{"id":"https://openalex.org/subfields/1102","display_name":"Agronomy and Crop Science"},"field":{"id":"https://openalex.org/fields/11","display_name":"Agricultural and Biological Sciences"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/interleaving","display_name":"Interleaving","score":0.7833999991416931},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.751800000667572},{"id":"https://openalex.org/keywords/encoder","display_name":"Encoder","score":0.690500020980835},{"id":"https://openalex.org/keywords/perception","display_name":"Perception","score":0.6305999755859375},{"id":"https://openalex.org/keywords/transformer","display_name":"Transformer","score":0.6208000183105469},{"id":"https://openalex.org/keywords/perceptual-learning","display_name":"Perceptual learning","score":0.3971000015735626},{"id":"https://openalex.org/keywords/visual-perception","display_name":"Visual perception","score":0.37779998779296875},{"id":"https://openalex.org/keywords/feature-learning","display_name":"Feature learning","score":0.33959999680519104}],"concepts":[{"id":"https://openalex.org/C28034677","wikidata":"https://www.wikidata.org/wiki/Q17092530","display_name":"Interleaving","level":2,"score":0.7833999991416931},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.751800000667572},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7347999811172485},{"id":"https://openalex.org/C118505674","wikidata":"https://www.wikidata.org/wiki/Q42586063","display_name":"Encoder","level":2,"score":0.690500020980835},{"id":"https://openalex.org/C26760741","wikidata":"https://www.wikidata.org/wiki/Q160402","display_name":"Perception","level":2,"score":0.6305999755859375},{"id":"https://openalex.org/C66322947","wikidata":"https://www.wikidata.org/wiki/Q11658","display_name":"Transformer","level":3,"score":0.6208000183105469},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6180999875068665},{"id":"https://openalex.org/C22033958","wikidata":"https://www.wikidata.org/wiki/Q7167036","display_name":"Perceptual learning","level":3,"score":0.3971000015735626},{"id":"https://openalex.org/C178253425","wikidata":"https://www.wikidata.org/wiki/Q162668","display_name":"Visual perception","level":3,"score":0.37779998779296875},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.37369999289512634},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3727000057697296},{"id":"https://openalex.org/C59404180","wikidata":"https://www.wikidata.org/wiki/Q17013334","display_name":"Feature learning","level":2,"score":0.33959999680519104},{"id":"https://openalex.org/C123657996","wikidata":"https://www.wikidata.org/wiki/Q12271","display_name":"Architecture","level":2,"score":0.32749998569488525},{"id":"https://openalex.org/C2776010242","wikidata":"https://www.wikidata.org/wiki/Q4677575","display_name":"Active perception","level":3,"score":0.31540000438690186},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.303600013256073},{"id":"https://openalex.org/C101738243","wikidata":"https://www.wikidata.org/wiki/Q786435","display_name":"Autoencoder","level":3,"score":0.2976999878883362},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.28690001368522644},{"id":"https://openalex.org/C8038995","wikidata":"https://www.wikidata.org/wiki/Q1152135","display_name":"Unsupervised learning","level":2,"score":0.2655999958515167},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.26499998569488525},{"id":"https://openalex.org/C52622490","wikidata":"https://www.wikidata.org/wiki/Q1026626","display_name":"Feature extraction","level":2,"score":0.26100000739097595},{"id":"https://openalex.org/C50644808","wikidata":"https://www.wikidata.org/wiki/Q192776","display_name":"Artificial neural network","level":2,"score":0.25760000944137573}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2510.23148","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2510.23148","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2510.23148","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2510.23148","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"score":0.6824448704719543,"id":"https://metadata.un.org/sdg/16","display_name":"Peace, Justice and strong institutions"}],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Deep":[0],"reinforcement":[1],"learning":[2],"agents":[3],"often":[4],"struggle":[5],"when":[6],"tasks":[7],"require":[8],"understanding":[9],"both":[10],"vision":[11],"and":[12,71,118,127],"language.":[13],"Conventional":[14],"architectures":[15],"typically":[16],"isolate":[17],"perception":[18,42,70],"(for":[19],"example,":[20],"CNN-based":[21],"visual":[22,105],"encoders)":[23],"from":[24,82],"decision-making":[25,83],"(policy":[26],"networks).":[27],"This":[28,78],"separation":[29],"can":[30],"be":[31],"inefficient,":[32],"since":[33],"the":[34,41,53,110,114,121],"policy's":[35],"failures":[36],"do":[37],"not":[38],"directly":[39],"help":[40],"module":[43],"learn":[44],"what":[45],"is":[46],"important.":[47],"To":[48],"address":[49],"this,":[50],"we":[51,91],"implement":[52],"Perception-Decision":[54],"Interleaving":[55],"Transformer":[56],"(PDiT)":[57],"architecture":[58],"introduced":[59],"by":[60,97],"Mao":[61],"et":[62],"al.":[63],"(2023),":[64],"a":[65,75,93,132,144],"model":[66],"that":[67,120,139],"alternates":[68],"between":[69],"decision":[72],"layers":[73],"within":[74],"single":[76],"transformer.":[77],"interleaving":[79],"allows":[80],"feedback":[81],"to":[84,99,131],"refine":[85],"perceptual":[86],"features":[87],"dynamically.":[88],"In":[89],"addition,":[90],"integrate":[92],"contrastive":[94],"loss":[95],"inspired":[96],"CLIP":[98],"align":[100],"textual":[101],"mission":[102],"embeddings":[103],"with":[104],"scene":[106],"features.":[107],"We":[108],"evaluate":[109],"PDiT":[111],"encoders":[112,142],"on":[113],"BabyAI":[115],"GoToLocal":[116],"environment":[117],"find":[119],"approach":[122],"achieves":[123],"more":[124,149],"stable":[125],"rewards":[126],"stronger":[128],"alignment":[129],"compared":[130],"standard":[133],"PPO":[134],"baseline.":[135],"The":[136],"results":[137],"suggest":[138],"interleaved":[140],"transformer":[141],"are":[143],"promising":[145],"direction":[146],"for":[147],"developing":[148],"integrated":[150],"autonomous":[151],"agents.":[152]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2025-10-29T00:00:00"}
