{"id":"https://openalex.org/W7138191096","doi":"https://doi.org/10.1609/aaai.v40i34.40125","title":"MedGR2: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning","display_name":"MedGR2: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning","publication_year":2026,"publication_date":"2026-03-14","ids":{"openalex":"https://openalex.org/W7138191096","doi":"https://doi.org/10.1609/aaai.v40i34.40125"},"language":null,"primary_location":{"id":"doi:10.1609/aaai.v40i34.40125","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aaai.v40i34.40125","pdf_url":null,"source":{"id":"https://openalex.org/S4210191458","display_name":"Proceedings of the AAAI Conference on Artificial Intelligence","issn_l":"2159-5399","issn":["2159-5399","2374-3468"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/P4310320058","host_organization_name":"Association for the Advancement of Artificial Intelligence","host_organization_lineage":["https://openalex.org/P4310320058"],"host_organization_lineage_names":["Association for the Advancement of Artificial Intelligence"],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI Conference on Artificial Intelligence","raw_type":"journal-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"diamond","oa_url":"https://doi.org/10.1609/aaai.v40i34.40125","any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":null,"display_name":"Weihai Zhi","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Weihai Zhi","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5129720884","display_name":"Jiayan Guo","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Jiayan Guo","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5129715641","display_name":"Shangyang Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shangyang Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":{"value":0.25710747,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":"40","issue":"34","first_page":"28901","last_page":"28909"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.7651000022888184,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T11714","display_name":"Multimodal Machine Learning Applications","score":0.7651000022888184,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.05820000171661377,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.04390000179409981,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.7559000253677368},{"id":"https://openalex.org/keywords/bottleneck","display_name":"Bottleneck","score":0.6065000295639038},{"id":"https://openalex.org/keywords/scarcity","display_name":"Scarcity","score":0.5034000277519226},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.4805999994277954},{"id":"https://openalex.org/keywords/generalization","display_name":"Generalization","score":0.4745999872684479},{"id":"https://openalex.org/keywords/generative-model","display_name":"Generative model","score":0.4562999904155731},{"id":"https://openalex.org/keywords/modalities","display_name":"Modalities","score":0.4530999958515167},{"id":"https://openalex.org/keywords/supervised-learning","display_name":"Supervised learning","score":0.4410000145435333}],"concepts":[{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.7559000253677368},{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7113000154495239},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.6873999834060669},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.650600016117096},{"id":"https://openalex.org/C2780513914","wikidata":"https://www.wikidata.org/wiki/Q18210350","display_name":"Bottleneck","level":2,"score":0.6065000295639038},{"id":"https://openalex.org/C109747225","wikidata":"https://www.wikidata.org/wiki/Q815758","display_name":"Scarcity","level":2,"score":0.5034000277519226},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.4805999994277954},{"id":"https://openalex.org/C177148314","wikidata":"https://www.wikidata.org/wiki/Q170084","display_name":"Generalization","level":2,"score":0.4745999872684479},{"id":"https://openalex.org/C167966045","wikidata":"https://www.wikidata.org/wiki/Q5532625","display_name":"Generative model","level":3,"score":0.4562999904155731},{"id":"https://openalex.org/C2779903281","wikidata":"https://www.wikidata.org/wiki/Q6888026","display_name":"Modalities","level":2,"score":0.4530999958515167},{"id":"https://openalex.org/C136389625","wikidata":"https://www.wikidata.org/wiki/Q334384","display_name":"Supervised learning","level":3,"score":0.4410000145435333},{"id":"https://openalex.org/C2780992000","wikidata":"https://www.wikidata.org/wiki/Q17016113","display_name":"Generator (circuit theory)","level":3,"score":0.4230000078678131},{"id":"https://openalex.org/C2780226545","wikidata":"https://www.wikidata.org/wiki/Q6888030","display_name":"Modality (human\u2013computer interaction)","level":2,"score":0.3912000060081482},{"id":"https://openalex.org/C108583219","wikidata":"https://www.wikidata.org/wiki/Q197536","display_name":"Deep learning","level":2,"score":0.3230000138282776},{"id":"https://openalex.org/C160920958","wikidata":"https://www.wikidata.org/wiki/Q7662746","display_name":"Synthetic data","level":2,"score":0.30559998750686646},{"id":"https://openalex.org/C58973888","wikidata":"https://www.wikidata.org/wiki/Q1041418","display_name":"Semi-supervised learning","level":2,"score":0.2897999882698059},{"id":"https://openalex.org/C64543145","wikidata":"https://www.wikidata.org/wiki/Q162942","display_name":"Intersection (aeronautics)","level":2,"score":0.2816999852657318},{"id":"https://openalex.org/C51632099","wikidata":"https://www.wikidata.org/wiki/Q3985153","display_name":"Training set","level":2,"score":0.27129998803138733},{"id":"https://openalex.org/C67186912","wikidata":"https://www.wikidata.org/wiki/Q367664","display_name":"Data modeling","level":2,"score":0.26669999957084656},{"id":"https://openalex.org/C2776145971","wikidata":"https://www.wikidata.org/wiki/Q30673951","display_name":"Labeled data","level":2,"score":0.2630999982357025}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.1609/aaai.v40i34.40125","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aaai.v40i34.40125","pdf_url":null,"source":{"id":"https://openalex.org/S4210191458","display_name":"Proceedings of the AAAI Conference on Artificial Intelligence","issn_l":"2159-5399","issn":["2159-5399","2374-3468"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/P4310320058","host_organization_name":"Association for the Advancement of Artificial Intelligence","host_organization_lineage":["https://openalex.org/P4310320058"],"host_organization_lineage_names":["Association for the Advancement of Artificial Intelligence"],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI Conference on Artificial Intelligence","raw_type":"journal-article"}],"best_oa_location":{"id":"doi:10.1609/aaai.v40i34.40125","is_oa":true,"landing_page_url":"https://doi.org/10.1609/aaai.v40i34.40125","pdf_url":null,"source":{"id":"https://openalex.org/S4210191458","display_name":"Proceedings of the AAAI Conference on Artificial Intelligence","issn_l":"2159-5399","issn":["2159-5399","2374-3468"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/P4310320058","host_organization_name":"Association for the Advancement of Artificial Intelligence","host_organization_lineage":["https://openalex.org/P4310320058"],"host_organization_lineage_names":["Association for the Advancement of Artificial Intelligence"],"type":"conference"},"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings of the AAAI Conference on Artificial Intelligence","raw_type":"journal-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":false,"pdf":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"The":[0,68],"application":[1],"of":[2,13,43,85,167,197],"vision-language":[3],"models":[4,111,161],"in":[5,47,180],"medicine":[6],"is":[7,38,123],"critically":[8],"hampered":[9],"by":[10,40],"the":[11,41,80,106,120,134,185,195],"scarcity":[12,189],"high-quality,":[14],"expert-annotated":[15],"data.":[16],"Supervised":[17],"fine-tuning":[18,104],"on":[19,27,113],"existing":[20],"datasets":[21],"often":[22],"leads":[23],"to":[24,190],"poor":[25],"generalization":[26],"unseen":[28],"modalities":[29],"and":[30,75,82,140,193,203],"tasks,":[31],"while":[32],"reinforcement":[33,127,198],"learning,":[34],"a":[35,57,64,72,76,149,174],"promising":[36],"alternative,":[37],"stymied":[39],"lack":[42],"reliable":[44],"reward":[45,77],"signals":[46],"this":[48,53,154],"data-scarce":[49],"domain.":[50],"To":[51],"address":[52],"challenge,":[54],"we":[55],"propose":[56],"Generative":[58],"Reward":[59],"Learning":[60],"framework":[61,69,155],"that":[62,90,102],"establishes":[63],"self-improving":[65],"training":[66,95],"cycle.":[67],"jointly":[70],"develops":[71],"data":[73,89,108,122,188,191],"generator":[74],"model,":[78],"enabling":[79],"automated":[81],"continuous":[83],"creation":[84],"high-quality":[86],"multimodal":[87],"medical":[88,182,205],"serves":[91],"as":[92],"an":[93,165],"effective":[94],"source":[96],"for":[97,126,177,200],"post-training.":[98],"Our":[99],"experiments":[100],"demonstrate":[101],"supervised":[103],"using":[105],"generated":[107,121],"already":[109],"surpasses":[110],"trained":[112,152],"large-scale":[114],"human-curated":[115],"datasets.":[116],"More":[117],"importantly,":[118],"when":[119],"further":[124],"leveraged":[125],"learning":[128,179,199],"via":[129],"Group":[130],"Relative":[131],"Policy":[132],"Optimization,":[133],"resulting":[135],"model":[136,151],"achieves":[137],"state-of-the-art":[138],"cross-modality":[139],"cross-task":[141],"generalization,":[142],"significantly":[143],"outperforming":[144],"specialized":[145],"reinforcement-learning-based":[146],"methods.":[147],"Notably,":[148],"compact":[150],"under":[153],"attains":[156],"performance":[157],"competitive":[158],"with":[159],"foundation":[160],"containing":[162],"more":[163,169],"than":[164],"order":[166],"magnitude":[168],"parameters.":[170],"These":[171],"results":[172],"suggest":[173],"new":[175],"paradigm":[176],"data-efficient":[178],"high-stakes":[181],"domains,":[183],"shifting":[184],"bottleneck":[186],"from":[187],"generation":[192],"unlocking":[194],"potential":[196],"building":[201],"robust":[202],"generalizable":[204],"AI":[206],"systems.":[207]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-03-18T00:00:00"}
