{"id":"https://openalex.org/W4416035878","doi":"https://doi.org/10.18653/v1/2025.findings-emnlp.56","title":"GTA: Supervised-Guided Reinforcement Learning for Text Classification with Large Language Models","display_name":"GTA: Supervised-Guided Reinforcement Learning for Text Classification with Large Language Models","publication_year":2025,"publication_date":"2025-01-01","ids":{"openalex":"https://openalex.org/W4416035878","doi":"https://doi.org/10.18653/v1/2025.findings-emnlp.56"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2025.findings-emnlp.56","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.56","pdf_url":"https://aclanthology.org/2025.findings-emnlp.56.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2025.findings-emnlp.56.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5100447234","display_name":"M. Zeng","orcid":"https://orcid.org/0000-0001-9717-1751"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Min Zeng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5044050817","display_name":"Jingfei Sun","orcid":"https://orcid.org/0000-0003-2616-8461"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jingfei Sun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Xueyou Luo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xueyou Luo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5100362570","display_name":"Shiqi Zhang","orcid":"https://orcid.org/0000-0002-8804-0693"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shiqi Zhang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5101945817","display_name":"Li Xie","orcid":"https://orcid.org/0000-0002-2008-6230"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Li Xie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5058873449","display_name":"Caiquan Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Caiquan Liu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5104668789","display_name":"Xiaoxin Chen","orcid":"https://orcid.org/0000-0002-1617-3315"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiaoxin Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.29229904,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"1050","last_page":"1060"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11550","display_name":"Text and Document Classification Technologies","score":0.17100000381469727,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11550","display_name":"Text and Document Classification Technologies","score":0.17100000381469727,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.1501999944448471,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.06390000134706497,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.40700000524520874},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.3928999900817871},{"id":"https://openalex.org/keywords/natural-language","display_name":"Natural language","score":0.3637999892234802},{"id":"https://openalex.org/keywords/class","display_name":"Class (philosophy)","score":0.30570000410079956},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.29649999737739563},{"id":"https://openalex.org/keywords/stability","display_name":"Stability (learning theory)","score":0.28119999170303345}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6412000060081482},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6000000238418579},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.5224999785423279},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.40700000524520874},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.3928999900817871},{"id":"https://openalex.org/C195324797","wikidata":"https://www.wikidata.org/wiki/Q33742","display_name":"Natural language","level":2,"score":0.3637999892234802},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3246000111103058},{"id":"https://openalex.org/C2777212361","wikidata":"https://www.wikidata.org/wiki/Q5127848","display_name":"Class (philosophy)","level":2,"score":0.30570000410079956},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.29649999737739563},{"id":"https://openalex.org/C112972136","wikidata":"https://www.wikidata.org/wiki/Q7595718","display_name":"Stability (learning theory)","level":2,"score":0.28119999170303345},{"id":"https://openalex.org/C74672266","wikidata":"https://www.wikidata.org/wiki/Q815859","display_name":"Language acquisition","level":2,"score":0.2802000045776367},{"id":"https://openalex.org/C129792486","wikidata":"https://www.wikidata.org/wiki/Q1050419","display_name":"Language identification","level":3,"score":0.26440000534057617},{"id":"https://openalex.org/C77967617","wikidata":"https://www.wikidata.org/wiki/Q4677561","display_name":"Active learning (machine learning)","level":2,"score":0.2515000104904175}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2025.findings-emnlp.56","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.56","pdf_url":"https://aclanthology.org/2025.findings-emnlp.56.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2025.findings-emnlp.56","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.56","pdf_url":"https://aclanthology.org/2025.findings-emnlp.56.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":true,"grobid_xml":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4416035878.pdf","grobid_xml":"https://content.openalex.org/works/W4416035878.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"In":[0],"natural":[1],"language":[2],"processing":[3],"tasks,":[4],"pure":[5,113,120],"reinforcement":[6],"learning":[7],"(RL)":[8],"fine-tuning":[9,21],"methods":[10],"often":[11],"suffer":[12],"from":[13],"inefficient":[14],"exploration":[15],"and":[16,32,98,115,134,154],"slow":[17],"convergence;":[18],"while":[19,149],"supervised":[20],"(SFT)":[22],"methods,":[23],"although":[24],"efficient":[25],"in":[26,61],"training,":[27],"have":[28],"limited":[29],"performance":[30,117],"ceiling":[31,118],"less":[33],"solid":[34],"theoretical":[35],"foundation":[36],"compared":[37],"to":[38],"RL.To":[39],"address":[40],"efficiency-capability":[41],"trade-off,":[42],"we":[43,130],"propose":[44],"the":[45,51,56,69,87,95,99,102,126],"Guess-Think-Answer":[46],"(GTA)":[47],"framework":[48],"that":[49,144],"combines":[50],"efficiency":[52],"of":[53,59,101],"SFT":[54,153],"with":[55,90],"capability":[57],"gains":[58],"RL":[60,91,114,155],"a":[62,73],"unified":[63],"training":[64,128],"paradigm.GTA":[65],"works":[66],"by":[67],"having":[68],"model":[70],"first":[71],"produce":[72],"provisional":[74],"guess":[75,84],"(optimized":[76],"via":[77],"cross-entropy":[78],"loss),":[79],"then":[80],"reflect":[81],"on":[82,138],"this":[83],"before":[85],"generating":[86],"final":[88,96],"answer,":[89],"rewards":[92],"shaping":[93],"both":[94,109,151],"output":[97],"format":[100],"entire":[103],"GTA":[104,145],"structure.This":[105],"hybrid":[106],"approach":[107],"achieves":[108],"faster":[110],"convergence":[111,148],"than":[112,119],"higher":[116],"SFT.To":[121],"mitigate":[122],"gradient":[123,135],"conflicts":[124],"between":[125],"two":[127],"signals,":[129],"employ":[131],"loss":[132],"masking":[133],"constraints.Empirical":[136],"results":[137],"four":[139],"text":[140],"classification":[141],"benchmarks":[142],"demonstrate":[143],"substantially":[146],"accelerates":[147],"outperforming":[150],"standalone":[152],"baselines.":[156]},"counts_by_year":[],"updated_date":"2026-08-18T07:49:30.821534","created_date":"2025-11-08T00:00:00"}
