{"id":"https://openalex.org/W7166834503","doi":"https://doi.org/10.18653/v1/2026.findings-acl.18","title":"MGPO: Thinking with Images via Multi-Turn Grounding-Based Reinforcement Learning","display_name":"MGPO: Thinking with Images via Multi-Turn Grounding-Based Reinforcement Learning","publication_year":2026,"publication_date":"2026-01-01","ids":{"openalex":"https://openalex.org/W7166834503","doi":"https://doi.org/10.18653/v1/2026.findings-acl.18"},"language":null,"primary_location":{"id":"doi:10.18653/v1/2026.findings-acl.18","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.18","pdf_url":"https://aclanthology.org/2026.findings-acl.18.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":true,"oa_status":"gold","oa_url":"https://aclanthology.org/2026.findings-acl.18.pdf","any_repository_has_fulltext":null},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5139726899","display_name":"Xinyu Huang","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xinyu Huang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139807188","display_name":"Yuhao Dong","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Yuhao Dong","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139830868","display_name":"Weiwei Tian","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Weiwei Tian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139774110","display_name":"Bo Li","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Bo Li","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5139758001","display_name":"Rui Feng","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Rui Feng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5139774796","display_name":"Ziwei Liu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Ziwei Liu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":0.0,"has_fulltext":true,"cited_by_count":0,"citation_normalized_percentile":{"value":0.86823169,"is_in_top_1_percent":false,"is_in_top_10_percent":false},"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"383","last_page":"399"},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.34610000252723694,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.34610000252723694,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.08839999884366989,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10462","display_name":"Reinforcement Learning in Robotics","score":0.052799999713897705,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.43560001254081726},{"id":"https://openalex.org/keywords/action","display_name":"Action (physics)","score":0.30390000343322754},{"id":"https://openalex.org/keywords/control","display_name":"Control (management)","score":0.30079999566078186},{"id":"https://openalex.org/keywords/reinforcement","display_name":"Reinforcement","score":0.2865999937057495},{"id":"https://openalex.org/keywords/feature","display_name":"Feature (linguistics)","score":0.2635999917984009}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.4984999895095825},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.4790000021457672},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.43560001254081726},{"id":"https://openalex.org/C15744967","wikidata":"https://www.wikidata.org/wiki/Q9418","display_name":"Psychology","level":0,"score":0.32089999318122864},{"id":"https://openalex.org/C2780791683","wikidata":"https://www.wikidata.org/wiki/Q846785","display_name":"Action (physics)","level":2,"score":0.30390000343322754},{"id":"https://openalex.org/C2775924081","wikidata":"https://www.wikidata.org/wiki/Q55608371","display_name":"Control (management)","level":2,"score":0.30079999566078186},{"id":"https://openalex.org/C67203356","wikidata":"https://www.wikidata.org/wiki/Q1321905","display_name":"Reinforcement","level":2,"score":0.2865999937057495},{"id":"https://openalex.org/C31972630","wikidata":"https://www.wikidata.org/wiki/Q844240","display_name":"Computer vision","level":1,"score":0.28130000829696655},{"id":"https://openalex.org/C2776401178","wikidata":"https://www.wikidata.org/wiki/Q12050496","display_name":"Feature (linguistics)","level":2,"score":0.2635999917984009},{"id":"https://openalex.org/C107457646","wikidata":"https://www.wikidata.org/wiki/Q207434","display_name":"Human\u2013computer interaction","level":1,"score":0.25850000977516174},{"id":"https://openalex.org/C177264268","wikidata":"https://www.wikidata.org/wiki/Q1514741","display_name":"Set (abstract data type)","level":2,"score":0.2531999945640564},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.25209999084472656},{"id":"https://openalex.org/C12713177","wikidata":"https://www.wikidata.org/wiki/Q1900281","display_name":"Perspective (graphical)","level":2,"score":0.2515999972820282}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.18653/v1/2026.findings-acl.18","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.18","pdf_url":"https://aclanthology.org/2026.findings-acl.18.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"}],"best_oa_location":{"id":"doi:10.18653/v1/2026.findings-acl.18","is_oa":true,"landing_page_url":"https://doi.org/10.18653/v1/2026.findings-acl.18","pdf_url":"https://aclanthology.org/2026.findings-acl.18.pdf","source":null,"license":"cc-by","license_id":"https://openalex.org/licenses/cc-by","version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Findings of the Association for Computational Linguistics: ACL 2026","raw_type":"proceedings-article"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"grobid_xml":true,"pdf":true},"content_urls":{"pdf":"https://content.openalex.org/works/W7166834503.pdf","grobid_xml":"https://content.openalex.org/works/W7166834503.grobid-xml"},"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"State-of-the-art":[0],"large":[1],"multi-modal":[2],"models":[3,200],"(LMMs)":[4],"face":[5],"challenges":[6],"when":[7,152],"processing":[8],"highresolution":[9],"images,":[10],"as":[11],"these":[12],"inputs":[13],"are":[14,23,206],"converted":[15],"into":[16],"enormous":[17],"visual":[18,52,115],"tokens,":[19],"many":[20],"of":[21,103],"which":[22,72],"irrelevant":[24],"to":[25,47,68,112,137,169,172],"the":[26,89,101,104,118,182,202],"downstream":[27],"task.In":[28],"this":[29,122],"paper,":[30],"we":[31,107,126],"propose":[32],"Multi-turn":[33],"Groundingbased":[34],"Policy":[35],"Optimization":[36],"(MGPO),":[37],"an":[38],"endto-end":[39],"reinforcement":[40],"learning":[41],"(RL)":[42],"framework":[43],"that":[44,81,109],"enables":[45],"LMMs":[46,82,110],"iteratively":[48],"focus":[49],"on":[50,59,154,175,181,190,201],"key":[51],"regions":[53],"by":[54],"automatically":[55],"cropping":[56],"sub-images,":[57],"based":[58],"model-predicted":[60],"grounding":[61,76,86,116,160,166],"coordinates":[62],"within":[63],"a":[64,95,128],"multi-turn":[65,129],"conversation":[66],"framework.Compared":[67],"supervised":[69],"finetuning":[70],"(SFT),":[71],"requires":[73],"costly":[74],"additional":[75],"annotations,":[77,161],"our":[78],"approach":[79],"highlights":[80],"can":[83],"emerge":[84],"robust":[85],"abilities":[87],"during":[88,117],"RL":[90],"training":[91],"process,":[92],"leveraging":[93],"only":[94],"binary":[96],"reward":[97],"function":[98],"derived":[99],"from":[100],"correctness":[102],"final":[105],"answer.Additionally,":[106],"observe":[108],"struggle":[111],"autonomously":[113],"trigger":[114],"rollout":[119],"process.To":[120],"address":[121],"cold":[123],"start":[124],"problem,":[125],"design":[127],"conversational":[130],"template":[131],"and":[132,178,198],"restrict":[133],"policy":[134],"loss":[135],"computation":[136],"model":[138],"outputs":[139],"generated":[140],"across":[141],"multiple":[142],"dialogue":[143],"rounds,":[144],"thereby":[145],"promoting":[146],"stable":[147],"optimization.Extensive":[148],"experiments":[149],"demonstrate":[150],"that,":[151],"trained":[153],"standard":[155],"visual-questionshort":[156],"answering":[157],"data":[158],"without":[159],"MGPO":[162,188],"effectively":[163],"elicits":[164],"stronger":[165],"capabilities":[167],"compared":[168],"GRPO,":[170],"leading":[171],"5.4%":[173],"improvement":[174,180],"in-distribution":[176],"MME-Realworld":[177],"5.2%":[179],"challenging":[183],"out-of-distribution":[184],"(OOD)":[185],"V*":[186,204],"Bench.Notably,":[187],"post-training":[189],"Qwen2.5-VL-7B":[191],"with":[192],"21K":[193],"samples":[194],"surpasses":[195],"OpenAI's":[196],"o1":[197],"GPT-4o":[199],"OOD":[203],"Bench.Codes":[205],"available":[207],"at":[208],"https:":[209],"//github.com/EvolvingLMMs-Lab/MGPO.":[210]},"counts_by_year":[],"updated_date":"2026-07-29T14:22:42.915294","created_date":"2026-07-02T00:00:00"}
