{"id":"https://openalex.org/W4416034880","doi":"https://doi.org/10.18653/v1/2025.findings-emnlp.463","title":"Training Medical QA Models Based on Mixed Rewards from Multiple-Choice and Open-Ended Questions","display_name":"Training Medical QA Models Based on Mixed Rewards from Multiple-Choice and Open-Ended Questions","publication_year":2025,"publication_date":"2025-01-01","ids":{"openalex":"https://openalex.org/W4416034880","doi":"https://doi.org/10.18653/v1/2025.findings-emnlp.463"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2025.findings-emnlp.463","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.463","pdf_url":"https://aclanthology.org/2025.findings-emnlp.463.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2025.findings-emnlp.463.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5033731578","display_name":"Yue Qiu","orcid":"https://orcid.org/0000-0002-2164-090X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yue Qiu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":null,"display_name":"Yujan Ting","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yujan Ting","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5018944119","display_name":"Pei Dong","orcid":"https://orcid.org/0000-0002-3122-3739"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Pei Dong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5038526207","display_name":"Terrence Chen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Terrence Chen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5059364615","display_name":"Weijing Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Weijing Huang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"8721","last_page":"8729"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T13309","display_name":"Reliability and Agreement in Measurement","score":0.2451000064611435,"subfield":{"id":"https://openalex.org/subfields/1804","display_name":"Statistics, Probability and Uncertainty"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},"topics":[{"id":"https://openalex.org/T13309","display_name":"Reliability and Agreement in Measurement","score":0.2451000064611435,"subfield":{"id":"https://openalex.org/subfields/1804","display_name":"Statistics, Probability and Uncertainty"},"field":{"id":"https://openalex.org/fields/18","display_name":"Decision Sciences"},"domain":{"id":"https://openalex.org/domains/2","display_name":"Social Sciences"}},{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.06270000338554382,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10664","display_name":"Sentiment Analysis and Opinion Mining","score":0.046799998730421066,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/training","display_name":"Training (meteorology)","score":0.4970000088214874},{"id":"https://openalex.org/keywords/quality","display_name":"Quality (philosophy)","score":0.296999990940094},{"id":"https://openalex.org/keywords/test","display_name":"Test (biology)","score":0.24060000479221344},{"id":"https://openalex.org/keywords/data-collection","display_name":"Data collection","score":0.23430000245571136}],"concepts":[{"id":"https://openalex.org/C2777211547","wikidata":"https://www.wikidata.org/wiki/Q17141490","display_name":"Training (meteorology)","level":2,"score":0.4970000088214874},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.43689998984336853},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.4000000059604645},{"id":"https://openalex.org/C509550671","wikidata":"https://www.wikidata.org/wiki/Q126945","display_name":"Medical education","level":1,"score":0.38589999079704285},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.30880001187324524},{"id":"https://openalex.org/C2779530757","wikidata":"https://www.wikidata.org/wiki/Q1207505","display_name":"Quality (philosophy)","level":2,"score":0.296999990940094},{"id":"https://openalex.org/C56739046","wikidata":"https://www.wikidata.org/wiki/Q192060","display_name":"Knowledge management","level":1,"score":0.27549999952316284},{"id":"https://openalex.org/C75630572","wikidata":"https://www.wikidata.org/wiki/Q538904","display_name":"Applied psychology","level":1,"score":0.2614000141620636},{"id":"https://openalex.org/C2777267654","wikidata":"https://www.wikidata.org/wiki/Q3519023","display_name":"Test (biology)","level":2,"score":0.24060000479221344},{"id":"https://openalex.org/C133462117","wikidata":"https://www.wikidata.org/wiki/Q4929239","display_name":"Data collection","level":2,"score":0.23430000245571136}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2025.findings-emnlp.463","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.463","pdf_url":"https://aclanthology.org/2025.findings-emnlp.463.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2025.findings-emnlp.463","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2025.findings-emnlp.463","pdf_url":"https://aclanthology.org/2025.findings-emnlp.463.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: EMNLP 2025","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W4416034880.pdf","grobid_xml":"https://content.openalex.org/works/W4416034880.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"for":[3,17,56],"large":[4],"language":[5],"models":[6],"(LLMs)":[7],"typically":[8],"requires":[9],"clear":[10,50],"reward":[11,41],"signals,":[12],"which":[13,48,57],"are":[14],"often":[15],"unavailable":[16],"open-ended":[18],"(OE)":[19],"questions":[20,46],"where":[21],"answer":[22],"evaluation":[23],"is":[24],"ambiguous":[25],"without":[26],"scalable":[27],"expert":[28],"labeling.We":[29],"investigate":[30],"whether":[31],"LLMs":[32],"benefit":[33],"from":[34],"training":[35,76],"on":[36],"mixed":[37,78],"data":[38],"with":[39,53,79],"varying":[40],"clarity.Our":[42],"approach":[43,86],"combines":[44],"Multiplechoice":[45],"(MCQs),":[47],"offer":[49],"binary":[51],"rewards,":[52],"OE":[54,80],"questions,":[55],"we":[58],"use":[59],"simpler,":[60],"potentially":[61],"noisy":[62],"rewards":[63],"such":[64],"as":[65],"Jaccard":[66],"similarity":[67],"or":[68],"LLM-based":[69],"evaluators.We":[70],"hypothesize":[71],"that":[72],"MCQs":[73],"can":[74],"stabilize":[75],"when":[77],"questions.Our":[81],"experiments":[82],"show":[83],"this":[84],"mixed-data":[85],"consistently":[87],"improves":[88],"medical":[89],"question-answering":[90],"performance":[91],"across":[92],"model":[93],"scales.":[94]},"counts_by_year":[],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-11-08T00:00:00"}
