{"id":"https://openalex.org/W4415432975","doi":"https://doi.org/10.21437/interspeech.2025-1965","title":"Evaluating Large Language Models in Data Generation for Low-Resource Scenarios: A Case Study on Question Answering","display_name":"Evaluating Large Language Models in Data Generation for Low-Resource Scenarios: A Case Study on Question Answering","publication_year":2025,"publication_date":"2025-08-17","ids":{"openalex":"https://openalex.org/W4415432975","doi":"https://doi.org/10.21437/interspeech.2025-1965"},"language":"en","primary_location":{"id":"doi:10.21437/interspeech.2025-1965","is_oa":false,"landing_page_url":"https://doi.org/10.21437/interspeech.2025-1965","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Interspeech 2025","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5032284977","display_name":"Ebru Ar\u0131soy","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ebru Arisoy","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5074204189","display_name":"Merve \u00dcnl\u00fc Menev\u015fe","orcid":"https://orcid.org/0000-0002-5405-0068"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Merve Unlu Menevse","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5082727072","display_name":"Yusufcan Manav","orcid":"https://orcid.org/0000-0003-2375-457X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yusufcan Manav","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5030252794","display_name":"Arzucan \u00d6zg\u00fcr","orcid":"https://orcid.org/0000-0001-8376-1056"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Arzucan Ozgur","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":2.9572,"has_fulltext":false,"cited_by_count":2,"citation_normalized_percentile":{"value":0.92230994,"is_in_top_1_percent":false,"is_in_top_10_percent":true},"cited_by_percentile_year":{"min":97,"max":98},"biblio":{"volume":null,"issue":null,"first_page":"1773","last_page":"1777"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.9918000102043152,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.9918000102043152,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T12031","display_name":"Speech and dialogue systems","score":0.953499972820282,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10181","display_name":"Natural Language Processing Techniques","score":0.9488000273704529,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/spoken-language","display_name":"Spoken language","score":0.7468000054359436},{"id":"https://openalex.org/keywords/robustness","display_name":"Robustness (evolution)","score":0.5582000017166138},{"id":"https://openalex.org/keywords/language-model","display_name":"Language model","score":0.5443000197410583},{"id":"https://openalex.org/keywords/turkish","display_name":"Turkish","score":0.4311999976634979},{"id":"https://openalex.org/keywords/question-answering","display_name":"Question answering","score":0.424699991941452},{"id":"https://openalex.org/keywords/scarcity","display_name":"Scarcity","score":0.3783999979496002},{"id":"https://openalex.org/keywords/missing-data","display_name":"Missing data","score":0.3725999891757965}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7865999937057495},{"id":"https://openalex.org/C2776230583","wikidata":"https://www.wikidata.org/wiki/Q1322198","display_name":"Spoken language","level":2,"score":0.7468000054359436},{"id":"https://openalex.org/C204321447","wikidata":"https://www.wikidata.org/wiki/Q30642","display_name":"Natural language processing","level":1,"score":0.6240000128746033},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6122999787330627},{"id":"https://openalex.org/C63479239","wikidata":"https://www.wikidata.org/wiki/Q7353546","display_name":"Robustness (evolution)","level":3,"score":0.5582000017166138},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.5443000197410583},{"id":"https://openalex.org/C2781121862","wikidata":"https://www.wikidata.org/wiki/Q256","display_name":"Turkish","level":2,"score":0.4311999976634979},{"id":"https://openalex.org/C44291984","wikidata":"https://www.wikidata.org/wiki/Q1074173","display_name":"Question answering","level":2,"score":0.424699991941452},{"id":"https://openalex.org/C109747225","wikidata":"https://www.wikidata.org/wiki/Q815758","display_name":"Scarcity","level":2,"score":0.3783999979496002},{"id":"https://openalex.org/C9357733","wikidata":"https://www.wikidata.org/wiki/Q6878417","display_name":"Missing data","level":2,"score":0.3725999891757965},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.3555999994277954},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.3212999999523163},{"id":"https://openalex.org/C160920958","wikidata":"https://www.wikidata.org/wiki/Q7662746","display_name":"Synthetic data","level":2,"score":0.320499986410141},{"id":"https://openalex.org/C2776187449","wikidata":"https://www.wikidata.org/wiki/Q1513879","display_name":"Natural language generation","level":3,"score":0.31130000948905945},{"id":"https://openalex.org/C2776145971","wikidata":"https://www.wikidata.org/wiki/Q30673951","display_name":"Labeled data","level":2,"score":0.3003999888896942},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.2743000090122223},{"id":"https://openalex.org/C133462117","wikidata":"https://www.wikidata.org/wiki/Q4929239","display_name":"Data collection","level":2,"score":0.2597000002861023},{"id":"https://openalex.org/C195324797","wikidata":"https://www.wikidata.org/wiki/Q33742","display_name":"Natural language","level":2,"score":0.258899986743927},{"id":"https://openalex.org/C155092808","wikidata":"https://www.wikidata.org/wiki/Q182557","display_name":"Computational linguistics","level":2,"score":0.25130000710487366}],"mesh":[],"locations_count":2,"locations":[{"id":"doi:10.21437/interspeech.2025-1965","is_oa":false,"landing_page_url":"https://doi.org/10.21437/interspeech.2025-1965","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Interspeech 2025","raw_type":"proceedings-article"},{"id":"pmh:oai:gcris.mef.edu.tr:20.500.11779/3141","is_oa":false,"landing_page_url":"https://doi.org/10.21437/Interspeech.2025-1965","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Conference Object"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Large":[0],"Language":[1],"Models":[2],"(LLMs)":[3],"are":[4],"powerful":[5],"tools":[6],"for":[7,54],"generating":[8,29],"synthetic":[9,47],"data,":[10],"offering":[11],"a":[12,97],"promising":[13],"solution":[14],"to":[15,32],"data":[16,48,71,130],"scarcity":[17],"in":[18,28,72,131,136],"low-resource":[19],"scenarios.":[20],"This":[21],"study":[22],"evaluates":[23],"the":[24,34,67,92,126,137],"effectiveness":[25],"of":[26,36,69,91,108,128,139],"LLMs":[27],"question-answer":[30],"pairs":[31],"enhance":[33],"performance":[35,78],"question":[37],"answering":[38],"(QA)":[39],"models":[40,115],"trained":[41,116],"with":[42],"limited":[43],"annotated":[44],"data.":[45,121],"While":[46],"generation":[49],"has":[50],"been":[51],"widely":[52],"explored":[53],"text-based":[55,82],"QA,":[56],"its":[57],"impact":[58],"on":[59,89,118],"spoken":[60,74,84,99,132],"QA":[61,75,85,100,133],"remains":[62],"underexplored.":[63],"We":[64],"specifically":[65],"investigate":[66],"role":[68],"LLM-generated":[70,129],"improving":[73],"models,":[76],"showing":[77],"gains":[79],"across":[80],"both":[81],"and":[83,96,111],"tasks.":[86],"Experimental":[87],"results":[88],"subsets":[90],"SQuAD,":[93,95],"Spoken":[94],"Turkish":[98],"dataset":[101],"demonstrate":[102],"significant":[103],"relative":[104],"F1":[105],"score":[106],"improvements":[107],"7.8%,":[109],"7.0%,":[110],"2.7%,":[112],"respectively,":[113],"over":[114],"solely":[117],"restricted":[119],"human-annotated":[120],"Furthermore,":[122],"our":[123],"findings":[124],"highlight":[125],"robustness":[127],"settings,":[134],"even":[135],"presence":[138],"noise.":[140]},"counts_by_year":[{"year":2026,"cited_by_count":2}],"updated_date":"2026-08-12T21:12:35.861297","created_date":"2025-10-24T00:00:00"}
