{"id":"https://openalex.org/W7147103948","doi":"https://doi.org/10.48550/arxiv.2603.28460","title":"$R_\\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation","display_name":"$R_\\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation","publication_year":2026,"publication_date":"2026-03-30","ids":{"openalex":"https://openalex.org/W7147103948","doi":"https://doi.org/10.48550/arxiv.2603.28460"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2603.28460","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.28460","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2603.28460","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5041373884","display_name":"Linqian Fan","orcid":"https://orcid.org/0000-0001-9386-4235"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fan, Linqian","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132713275","display_name":"Peiqin Sun","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Sun, Peiqin","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132589384","display_name":"Tiancheng Wen","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Wen, Tiancheng","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5132656914","display_name":"Shun Lu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Lu, Shun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5132613698","display_name":"Chengru Song","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Song, Chengru","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.2644999921321869,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.2644999921321869,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11307","display_name":"Domain Adaptation and Few-Shot Learning","score":0.19499999284744263,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T11612","display_name":"Stochastic Gradient Optimization Techniques","score":0.15049999952316284,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5593000054359436},{"id":"https://openalex.org/keywords/normalization","display_name":"Normalization (sociology)","score":0.5001999735832214},{"id":"https://openalex.org/keywords/sampling","display_name":"Sampling (signal processing)","score":0.4894999861717224},{"id":"https://openalex.org/keywords/matching","display_name":"Matching (statistics)","score":0.48590001463890076},{"id":"https://openalex.org/keywords/distillation","display_name":"Distillation","score":0.45669999718666077},{"id":"https://openalex.org/keywords/weighting","display_name":"Weighting","score":0.4481000006198883},{"id":"https://openalex.org/keywords/importance-sampling","display_name":"Importance sampling","score":0.3711000084877014}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.6977999806404114},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5593000054359436},{"id":"https://openalex.org/C136886441","wikidata":"https://www.wikidata.org/wiki/Q926129","display_name":"Normalization (sociology)","level":2,"score":0.5001999735832214},{"id":"https://openalex.org/C140779682","wikidata":"https://www.wikidata.org/wiki/Q210868","display_name":"Sampling (signal processing)","level":3,"score":0.4894999861717224},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.48590001463890076},{"id":"https://openalex.org/C204030448","wikidata":"https://www.wikidata.org/wiki/Q101017","display_name":"Distillation","level":2,"score":0.45669999718666077},{"id":"https://openalex.org/C126255220","wikidata":"https://www.wikidata.org/wiki/Q141495","display_name":"Mathematical optimization","level":1,"score":0.4481000006198883},{"id":"https://openalex.org/C183115368","wikidata":"https://www.wikidata.org/wiki/Q856577","display_name":"Weighting","level":2,"score":0.4481000006198883},{"id":"https://openalex.org/C52740198","wikidata":"https://www.wikidata.org/wiki/Q1539564","display_name":"Importance sampling","level":3,"score":0.3711000084877014},{"id":"https://openalex.org/C2781395549","wikidata":"https://www.wikidata.org/wiki/Q4680762","display_name":"Adaptive sampling","level":3,"score":0.3646000027656555},{"id":"https://openalex.org/C2777303404","wikidata":"https://www.wikidata.org/wiki/Q759757","display_name":"Convergence (economics)","level":2,"score":0.35690000653266907},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.3375000059604645},{"id":"https://openalex.org/C99498987","wikidata":"https://www.wikidata.org/wiki/Q2210247","display_name":"Noise (video)","level":3,"score":0.3294999897480011},{"id":"https://openalex.org/C150921843","wikidata":"https://www.wikidata.org/wiki/Q1170431","display_name":"Resampling","level":2,"score":0.3280999958515167},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.29760000109672546},{"id":"https://openalex.org/C167723999","wikidata":"https://www.wikidata.org/wiki/Q3773214","display_name":"Sampling distribution","level":2,"score":0.2847000062465668},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.26089999079704285},{"id":"https://openalex.org/C137836250","wikidata":"https://www.wikidata.org/wiki/Q984063","display_name":"Optimization problem","level":2,"score":0.260699987411499},{"id":"https://openalex.org/C2780586882","wikidata":"https://www.wikidata.org/wiki/Q7520643","display_name":"Simple (philosophy)","level":2,"score":0.2538999915122986},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.25369998812675476}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2603.28460","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.28460","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2603.28460","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2603.28460","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":null,"issn":null,"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Diffusion":[0,87],"models":[1],"achieve":[2],"state-of-the-art":[3],"generative":[4],"performance":[5,30],"but":[6],"are":[7,235],"fundamentally":[8],"bottlenecked":[9],"by":[10,31,46,69,189,199],"their":[11],"slow,":[12],"iterative":[13],"sampling":[14,176],"process.":[15],"While":[16],"diffusion":[17],"distillation":[18,57],"techniques":[19],"enable":[20],"high-fidelity,":[21],"few-step":[22],"generation,":[23],"traditional":[24],"objectives":[25],"often":[26],"restrict":[27],"the":[28,36,83,145,163,187],"student's":[29],"anchoring":[32],"it":[33],"solely":[34],"to":[35,42,114,171],"teacher.":[37],"Recent":[38],"approaches":[39],"have":[40],"attempted":[41],"break":[43],"this":[44,62],"ceiling":[45],"integrating":[47],"Reinforcement":[48],"Learning":[49],"(RL),":[50],"typically":[51],"through":[52],"a":[53,66,74,124,172,210,216,224],"simple":[54],"summation":[55],"of":[56,148,213,219],"and":[58,91,127,207,215,227],"RL":[59,111,161],"objectives.":[60],"In":[61],"work,":[63],"we":[64],"propose":[65],"novel":[67],"paradigm":[68],"re-conceptualizing":[70],"distribution":[71],"matching":[72],"as":[73,77],"reward,":[75],"denoted":[76],"$R_\\text{dm}$.":[78],"This":[79],"unified":[80],"perspective":[81],"bridges":[82],"algorithmic":[84],"gap":[85],"between":[86,204],"Matching":[88,106],"Distillation":[89],"(DMD)":[90],"RL,":[92],"providing":[93],"several":[94],"primary":[95],"benefits.":[96],"(1)":[97],"Enhanced":[98],"Optimization":[99],"Stability:":[100],"We":[101],"introduce":[102],"Group":[103],"Normalized":[104],"Distribution":[105],"(GNDM),":[107],"which":[108],"adapts":[109],"standard":[110],"group":[112],"normalization":[113],"stabilize":[115],"$R_\\text{dm}$":[116,222],"estimation.":[117],"By":[118,158],"leveraging":[119],"group-mean":[120],"statistics,":[121],"GNDM":[122,182],"establishes":[123],"more":[125],"robust":[126],"effective":[128],"optimization":[129],"direction.":[130],"(2)":[131],"Seamless":[132],"Reward":[133],"Integration:":[134],"Our":[135],"reward-centric":[136],"formulation":[137],"inherently":[138],"supports":[139],"adaptive":[140],"weighting":[141],"mechanisms,":[142],"allowing":[143],"for":[144,230],"fluid":[146],"combination":[147],"DMD":[149],"with":[150,160],"external":[151],"reward":[152],"models.":[153],"(3)":[154],"Improved":[155],"Sampling":[156,168],"Efficiency:":[157],"aligning":[159],"principles,":[162],"framework":[164,229],"readily":[165],"incorporates":[166],"Importance":[167],"(IS),":[169],"leading":[170],"significant":[173],"boost":[174],"in":[175],"efficiency.":[177],"Extensive":[178],"experiments":[179],"demonstrate":[180],"that":[181],"outperforms":[183],"vanilla":[184],"DMD,":[185],"reducing":[186],"FID":[188],"1.87.":[190],"Furthermore,":[191],"our":[192],"multi-reward":[193],"variant,":[194],"GNDMR,":[195],"surpasses":[196],"existing":[197],"baselines":[198],"striking":[200],"an":[201],"optimal":[202],"balance":[203],"aesthetic":[205],"quality":[206],"fidelity,":[208],"achieving":[209],"peak":[211],"HPS":[212],"30.37":[214],"low":[217],"FID-SD":[218],"12.21.":[220],"Ultimately,":[221],"provides":[223],"flexible,":[225],"stable,":[226],"efficient":[228],"real-time,":[231],"high-fidelity":[232],"synthesis.":[233],"Codes":[234],"coming":[236],"soon.":[237]},"counts_by_year":[],"updated_date":"2026-07-01T06:00:48.157686","created_date":"2026-04-02T00:00:00"}
