{"id":"https://openalex.org/W7166888232","doi":"https://doi.org/10.18653/v1/2026.findings-acl.1596","title":"SCALER: Synthetic Scalable Adaptive Learning Environment for Reasoning","display_name":"SCALER: Synthetic Scalable Adaptive Learning Environment for Reasoning","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166888232","doi":"https://doi.org/10.18653/v1/2026.findings-acl.1596"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.1596","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1596","pdf_url":"https://aclanthology.org/2026.findings-acl.1596.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.1596.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5109741356","display_name":"Caijun Xu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Caijun Xu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139845649","display_name":"Changyi Xiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Changyi Xiao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139722419","display_name":"Zhongyuan Peng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhongyuan Peng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139812491","display_name":"Xinrun Wang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xinrun Wang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139848609","display_name":"Yixin Cao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yixin Cao","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.87644962,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"31905","last_page":"31923"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11902","display_name":"Intelligent Tutoring Systems and Adaptive Learning","score":0.3156999945640564,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11902","display_name":"Intelligent Tutoring Systems and Adaptive Learning","score":0.3156999945640564,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10906","display_name":"AI-based Problem Solving and Planning","score":0.26969999074935913,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.029500000178813934,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.46160000562667847},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.35109999775886536},{"id":"https://openalex.org/keywords/key","display_name":"Key (lock)","score":0.30309998989105225},{"id":"https://openalex.org/keywords/scale","display_name":"Scale (ratio)","score":0.2957000136375427},{"id":"https://openalex.org/keywords/adaptive-learning","display_name":"Adaptive learning","score":0.29339998960494995}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6852999925613403},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5630000233650208},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.46160000562667847},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.35109999775886536},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3483000099658966},{"id":"https://openalex.org/C26517878","wikidata":"https://www.wikidata.org/wiki/Q228039","display_name":"Key (lock)","level":2,"score":0.30309998989105225},{"id":"https://openalex.org/C2778755073","wikidata":"https://www.wikidata.org/wiki/Q10858537","display_name":"Scale (ratio)","level":2,"score":0.2957000136375427},{"id":"https://openalex.org/C125014702","wikidata":"https://www.wikidata.org/wiki/Q4680749","display_name":"Adaptive learning","level":2,"score":0.29339998960494995},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.250900000333786},{"id":"https://openalex.org/C527412718","wikidata":"https://www.wikidata.org/wiki/Q855395","display_name":"Interpretation (philosophy)","level":2,"score":0.24560000002384186}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.1596","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1596","pdf_url":"https://aclanthology.org/2026.findings-acl.1596.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.1596","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.1596","pdf_url":"https://aclanthology.org/2026.findings-acl.1596.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[{"id":"https://openalex.org/F4320321001","display_name":"National Natural Science Foundation of China","ror":"https://ror.org/01h0zpd94"}],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166888232.pdf","grobid_xml":"https://content.openalex.org/works/W7166888232.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1,75],"(RL)":[2],"offers":[3],"a":[4,49,70,82],"principled":[5],"way":[6],"to":[7,135,151],"enhance":[8],"the":[9,130,137],"reasoning":[10,93,172],"capabilities":[11],"of":[12,52,133],"large":[13],"language":[14],"models,":[15],"yet":[16],"its":[17],"effectiveness":[18],"hinges":[19],"on":[20,113],"training":[21,45,104,179],"signals":[22,76],"that":[23,72,86,123,163],"remain":[24],"informative":[25],"as":[26],"models":[27],"evolve.In":[28],"practice,":[29],"RL":[30,103,121,168],"progress":[31],"often":[32],"slows":[33],"when":[34,44],"task":[35,153],"difficulty":[36,97,127],"becomes":[37],"poorly":[38],"aligned":[39],"with":[40,95],"model":[41],"capability":[42,139],"or":[43],"is":[46],"dominated":[47],"by":[48],"narrow":[50,152],"set":[51,132],"recurring":[53],"problem":[54],"patterns.To":[55],"jointly":[56],"address":[57],"these":[58],"issues,":[59],"we":[60],"propose":[61],"SCALER":[62,115,164],"(Synthetic":[63],"sCalable":[64],"Adaptive":[65],"Learning":[66],"Environment":[67],"for":[68],"Reasoning),":[69],"framework":[71],"sustains":[73],"effective":[74],"through":[77],"adaptive":[78,119],"environment":[79],"design.SCALER":[80],"introduces":[81],"scalable":[83],"synthesis":[84],"pipeline":[85],"converts":[87],"real-world":[88],"programming":[89],"problems":[90],"into":[91],"verifiable":[92],"environments":[94,134],"controllable":[96],"and":[98,128,141,155,174],"unbounded":[99],"instance":[100,126],"generation,":[101],"enabling":[102],"beyond":[105],"finite":[106],"datasets":[107],"while":[108],"preserving":[109],"strong":[110],"correctness":[111],"guarantees.Building":[112],"this,":[114],"further":[116],"employs":[117],"an":[118],"multi-environment":[120],"strategy":[122],"dynamically":[124],"adjusts":[125],"curates":[129],"active":[131],"track":[136],"model's":[138],"frontier":[140],"maintain":[142],"distributional":[143],"diversity.This":[144],"co-adaptation":[145],"prevents":[146],"reward":[147],"sparsity,":[148],"mitigates":[149],"overfitting":[150],"patterns,":[154],"supports":[156],"sustained":[157],"improvement":[158],"throughout":[159],"training.Extensive":[160],"experiments":[161],"show":[162],"consistently":[165],"outperforms":[166],"other":[167],"baselines":[169],"across":[170],"diverse":[171],"benchmarks":[173],"exhibits":[175],"more":[176],"stable,":[177],"long-horizon":[178],"dynamics.":[180]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
