{"id":"https://openalex.org/W7140853047","doi":"https://doi.org/10.48550/arxiv.2603.23964","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","display_name":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","publication_year":2026,"publication_date":"2026-03-25","ids":{"openalex":"https://openalex.org/W7140853047","doi":"https://doi.org/10.48550/arxiv.2603.23964"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.23964","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.23964","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.23964","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5130718837","display_name":"Lijing Luo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Luo, Lijing","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5130644074","display_name":"Yiben Luo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Luo, Yiben","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5015546377","display_name":"Alexey Gorbatovski","orcid":"https://orcid.org/0000-0003-3705-0047"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Gorbatovski, Alexey","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5029904389","display_name":"Sergey V. Kovalchuk","orcid":"https://orcid.org/0000-0001-8828-4615"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Kovalchuk, Sergey","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5130679918","display_name":"Xiaodan Liang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liang, Xiaodan","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.34529998898506165,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.34529998898506165,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12090","display_name":"Language and cultural evolution","score":0.13259999454021454,"subfield":{"id":"https://openalex.org/subfields/3316","display_name":"Cultural Studies"},"field":{"id":"https://openalex.org/fields/33","display_name":"Social Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T11883","display_name":"Embodied and Extended Cognition","score":0.07329999655485153,"subfield":{"id":"https://openalex.org/subfields/2805","display_name":"Cognitive Neuroscience"},"field":{"id":"https://openalex.org/fields/28","display_name":"Neuroscience"},"domain":{"id":"https://openalex.org/domains/1","display_name":"Life Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/bridging","display_name":"Bridging (networking)","score":0.7371000051498413},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7214000225067139},{"id":"https://openalex.org/keywords/empirical-research","display_name":"Empirical research","score":0.5511999726295471},{"id":"https://openalex.org/keywords/field","display_name":"Field (mathematics)","score":0.5508000254631042},{"id":"https://openalex.org/keywords/taxonomy","display_name":"Taxonomy (biology)","score":0.4722999930381775},{"id":"https://openalex.org/keywords/embodied-cognition","display_name":"Embodied cognition","score":0.40880000591278076},{"id":"https://openalex.org/keywords/inference","display_name":"Inference","score":0.3384999930858612}],"concepts":[{"id":"https://openalex.org/C174348530","wikidata":"https://www.wikidata.org/wiki/Q188635","display_name":"Bridging (networking)","level":2,"score":0.7371000051498413},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7355999946594238},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7214000225067139},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5690000057220459},{"id":"https://openalex.org/C120936955","wikidata":"https://www.wikidata.org/wiki/Q2155640","display_name":"Empirical research","level":2,"score":0.5511999726295471},{"id":"https://openalex.org/C9652623","wikidata":"https://www.wikidata.org/wiki/Q190109","display_name":"Field (mathematics)","level":2,"score":0.5508000254631042},{"id":"https://openalex.org/C58642233","wikidata":"https://www.wikidata.org/wiki/Q8269924","display_name":"Taxonomy (biology)","level":2,"score":0.4722999930381775},{"id":"https://openalex.org/C100609095","wikidata":"https://www.wikidata.org/wiki/Q1335050","display_name":"Embodied cognition","level":2,"score":0.40880000591278076},{"id":"https://openalex.org/C2522767166","wikidata":"https://www.wikidata.org/wiki/Q2374463","display_name":"Data science","level":1,"score":0.34880000352859497},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.3384999930858612},{"id":"https://openalex.org/C166052673","wikidata":"https://www.wikidata.org/wiki/Q83021","display_name":"Empirical evidence","level":2,"score":0.33309999108314514},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.30160000920295715},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.29490000009536743},{"id":"https://openalex.org/C184337299","wikidata":"https://www.wikidata.org/wiki/Q1437428","display_name":"Semantics (computer science)","level":2,"score":0.2766999900341034},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.2727000117301941},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.26330000162124634},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.2605000138282776},{"id":"https://openalex.org/C19273510","wikidata":"https://www.wikidata.org/wiki/Q263847","display_name":"Artificial life","level":2,"score":0.2587999999523163},{"id":"https://openalex.org/C2780966255","wikidata":"https://www.wikidata.org/wiki/Q5474306","display_name":"Foundation (evidence)","level":2,"score":0.2531999945640564}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.23964","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.23964","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.23964","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.23964","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0],"remarkable":[1],"progress":[2],"of":[3,36,45,104,129,138,159],"reinforcement":[4],"learning":[5],"(RL)":[6],"is":[7],"intrinsically":[8],"tied":[9],"to":[10,14,60,68,133],"the":[11,34,62,102,105,126,135,156,164],"environments":[12],"used":[13],"train":[15],"and":[16,48,86,93,118,143,170],"evaluate":[17],"artificial":[18],"agents.":[19,72],"Moving":[20],"beyond":[21],"traditional":[22],"qualitative":[23],"reviews,":[24],"this":[25,147],"work":[26],"presents":[27],"a":[28,42,57,74,97,108,119,150],"large-scale,":[29],"data-driven":[30],"empirical":[31],"investigation":[32],"into":[33,107],"evolution":[35],"RL":[37],"environments.":[38],"By":[39],"programmatically":[40],"processing":[41],"massive":[43],"corpus":[44],"academic":[46],"literature":[47],"rigorously":[49],"distilling":[50],"over":[51],"2,000":[52],"core":[53],"publications,":[54],"we":[55,78,124],"propose":[56],"quantitative":[58,152],"methodology":[59],"map":[61],"transition":[63],"from":[64],"isolated":[65],"physical":[66,168],"simulations":[67],"generalist,":[69],"language-driven":[70],"foundation":[71],"Implementing":[73],"novel,":[75],"multi-dimensional":[76],"taxonomy,":[77],"systematically":[79],"analyze":[80],"benchmarks":[81],"against":[82],"diverse":[83],"application":[84],"domains":[85,132],"requisite":[87],"cognitive":[88],"capabilities.":[89],"Our":[90],"automated":[91],"semantic":[92],"statistical":[94],"analysis":[95],"reveals":[96],"profound,":[98],"data-verified":[99],"paradigm":[100],"shift:":[101],"bifurcation":[103],"field":[106],"\"Semantic":[109],"Prior\"":[110],"ecosystem":[111],"dominated":[112],"by":[113],"Large":[114],"Language":[115],"Models":[116],"(LLMs)":[117],"\"Domain-Specific":[120],"Generalization\"":[121],"ecosystem.":[122],"Furthermore,":[123],"characterize":[125],"\"cognitive":[127],"fingerprints\"":[128],"these":[130],"distinct":[131],"uncover":[134],"underlying":[136],"mechanisms":[137],"cross-task":[139],"synergy,":[140],"multi-domain":[141],"interference,":[142],"zero-shot":[144],"generalization.":[145],"Ultimately,":[146],"study":[148],"offers":[149],"rigorous,":[151],"roadmap":[153],"for":[154],"designing":[155],"next":[157],"generation":[158],"Embodied":[160],"Semantic":[161],"Simulators,":[162],"bridging":[163],"gap":[165],"between":[166],"continuous":[167],"control":[169],"high-level":[171],"logical":[172],"reasoning.":[173]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-03-27T00:00:00"}
