{"id":"https://openalex.org/W7164053716","doi":"https://doi.org/10.48550/arxiv.2606.08501","title":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","display_name":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","publication_year":2026,"publication_date":"2026-06-07","ids":{"openalex":"https://openalex.org/W7164053716","doi":"https://doi.org/10.48550/arxiv.2606.08501"},"language":null,"primary_location":{"id":"doi:10.48550/arxiv.2606.08501","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.08501","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"type":"preprint","indexed_in":["datacite"],"open_access":{"is_oa":true,"oa_status":"green","oa_url":"https://doi.org/10.48550/arxiv.2606.08501","any_repository_has_fulltext":true},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5044815585","display_name":"Yawen Shao","orcid":"https://orcid.org/0000-0002-9938-669X"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Shao, Yawen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138213816","display_name":"Jie Xiao","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Xiao, Jie","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138267332","display_name":"Kai Zhu","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhu, Kai","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138206298","display_name":"Yu Liu","orcid":"https://orcid.org/0009-0003-1096-6562"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Liu, Yu","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5033167077","display_name":"Hongchen Luo","orcid":"https://orcid.org/0000-0003-0744-2074"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Luo, Hongchen","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5079007635","display_name":"Xueyang Fu","orcid":"https://orcid.org/0000-0001-8036-4071"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Fu, Xueyang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138240780","display_name":"Yang Cao","orcid":"https://orcid.org/0000-0002-6424-8633"},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Cao, Yang","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"middle","author":{"id":"https://openalex.org/A5138286375","display_name":"Wei Zhai","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zhai, Wei","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]},{"author_position":"last","author":{"id":"https://openalex.org/A5138205125","display_name":"Zheng-Jun Zha","orcid":null},"institutions":[],"countries":[],"is_corresponding":false,"raw_author_name":"Zha, Zheng-Jun","raw_affiliation_strings":[],"raw_orcid":null,"affiliations":[]}],"institutions":[],"countries_distinct_count":0,"institutions_distinct_count":0,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":0,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":null,"last_page":null},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.28700000047683716,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10028","display_name":"Topic Modeling","score":0.28700000047683716,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T13702","display_name":"Machine Learning in Healthcare","score":0.10209999978542328,"subfield":{"id":"https://openalex.org/subfields/1702","display_name":"Artificial Intelligence"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10775","display_name":"Generative Adversarial Networks and Image Synthesis","score":0.060600001364946365,"subfield":{"id":"https://openalex.org/subfields/1707","display_name":"Computer Vision and Pattern Recognition"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/discriminative-model","display_name":"Discriminative model","score":0.682699978351593},{"id":"https://openalex.org/keywords/process","display_name":"Process (computing)","score":0.6212000250816345},{"id":"https://openalex.org/keywords/reinforcement-learning","display_name":"Reinforcement learning","score":0.5791000127792358},{"id":"https://openalex.org/keywords/trajectory","display_name":"Trajectory","score":0.5539000034332275},{"id":"https://openalex.org/keywords/dual","display_name":"Dual (grammatical number)","score":0.42669999599456787},{"id":"https://openalex.org/keywords/generative-grammar","display_name":"Generative grammar","score":0.42579999566078186},{"id":"https://openalex.org/keywords/margin","display_name":"Margin (machine learning)","score":0.4219000041484833},{"id":"https://openalex.org/keywords/frame","display_name":"Frame (networking)","score":0.3763999938964844}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.7196999788284302},{"id":"https://openalex.org/C97931131","wikidata":"https://www.wikidata.org/wiki/Q5282087","display_name":"Discriminative model","level":2,"score":0.682699978351593},{"id":"https://openalex.org/C98045186","wikidata":"https://www.wikidata.org/wiki/Q205663","display_name":"Process (computing)","level":2,"score":0.6212000250816345},{"id":"https://openalex.org/C97541855","wikidata":"https://www.wikidata.org/wiki/Q830687","display_name":"Reinforcement learning","level":2,"score":0.5791000127792358},{"id":"https://openalex.org/C154945302","wikidata":"https://www.wikidata.org/wiki/Q11660","display_name":"Artificial intelligence","level":1,"score":0.5583000183105469},{"id":"https://openalex.org/C13662910","wikidata":"https://www.wikidata.org/wiki/Q193139","display_name":"Trajectory","level":2,"score":0.5539000034332275},{"id":"https://openalex.org/C2780980858","wikidata":"https://www.wikidata.org/wiki/Q110022","display_name":"Dual (grammatical number)","level":2,"score":0.42669999599456787},{"id":"https://openalex.org/C39890363","wikidata":"https://www.wikidata.org/wiki/Q36108","display_name":"Generative grammar","level":2,"score":0.42579999566078186},{"id":"https://openalex.org/C774472","wikidata":"https://www.wikidata.org/wiki/Q6760393","display_name":"Margin (machine learning)","level":2,"score":0.4219000041484833},{"id":"https://openalex.org/C119857082","wikidata":"https://www.wikidata.org/wiki/Q2539","display_name":"Machine learning","level":1,"score":0.3788999915122986},{"id":"https://openalex.org/C126042441","wikidata":"https://www.wikidata.org/wiki/Q1324888","display_name":"Frame (networking)","level":2,"score":0.3763999938964844},{"id":"https://openalex.org/C2779664074","wikidata":"https://www.wikidata.org/wiki/Q3518405","display_name":"Terminal (telecommunication)","level":2,"score":0.3441999852657318},{"id":"https://openalex.org/C153083717","wikidata":"https://www.wikidata.org/wiki/Q6535263","display_name":"Leverage (statistics)","level":2,"score":0.32670000195503235},{"id":"https://openalex.org/C137293760","wikidata":"https://www.wikidata.org/wiki/Q3621696","display_name":"Language model","level":2,"score":0.2973000109195709},{"id":"https://openalex.org/C41065033","wikidata":"https://www.wikidata.org/wiki/Q2825412","display_name":"Adversary","level":2,"score":0.29440000653266907},{"id":"https://openalex.org/C165064840","wikidata":"https://www.wikidata.org/wiki/Q1321061","display_name":"Matching (statistics)","level":2,"score":0.29440000653266907},{"id":"https://openalex.org/C2776214188","wikidata":"https://www.wikidata.org/wiki/Q408386","display_name":"Inference","level":2,"score":0.27880001068115234},{"id":"https://openalex.org/C106189395","wikidata":"https://www.wikidata.org/wiki/Q176789","display_name":"Markov decision process","level":3,"score":0.27549999952316284},{"id":"https://openalex.org/C2779700847","wikidata":"https://www.wikidata.org/wiki/Q775594","display_name":"Countdown","level":2,"score":0.27459999918937683},{"id":"https://openalex.org/C37736160","wikidata":"https://www.wikidata.org/wiki/Q1801315","display_name":"Adversarial system","level":2,"score":0.27309998869895935}],"mesh":[],"locations_count":1,"locations":[{"id":"doi:10.48550/arxiv.2606.08501","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.08501","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":null,"raw_source_name":null,"raw_type":"Preprint"}],"best_oa_location":{"id":"doi:10.48550/arxiv.2606.08501","is_oa":true,"landing_page_url":"https://doi.org/10.48550/arxiv.2606.08501","pdf_url":null,"source":{"id":"https://openalex.org/S4306400194","display_name":"arXiv (Cornell University)","issn_l":"2331-8422","issn":["2331-8422"],"is_oa":true,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I205783295","host_organization_name":"Cornell University","host_organization_lineage":["https://openalex.org/I205783295"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":null,"is_accepted":false,"is_published":false,"raw_source_name":null,"raw_type":"Preprint"},"sustainable_development_goals":[{"display_name":"Reduced inequalities","id":"https://metadata.un.org/sdg/10","score":0.7298058867454529}],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":0,"referenced_works":[],"related_works":[],"abstract_inverted_index":{"Reinforcement":[0],"learning":[1],"(RL)":[2],"holds":[3],"immense":[4],"promise":[5],"for":[6],"enhancing":[7],"the":[8,31,49,93,97],"reasoning":[9],"capabilities":[10],"of":[11,48,140],"diffusion":[12],"large":[13],"language":[14],"models":[15],"(dLLMs).":[16],"However,":[17],"progress":[18],"is":[19],"fundamentally":[20],"constrained":[21],"by":[22],"a":[23,87],"dual":[24],"misalignment":[25],"between":[26],"authentic":[27,122],"generation":[28,50],"trajectory":[29,100],"and":[30,115,152],"gradient":[32],"update":[33,95],"process:":[34],"(i)":[35],"Process-reward":[36],"misalignment.":[37,60],"Sparse,":[38],"terminal":[39,109],"rewards":[40,110],"are":[41,63],"indiscriminately":[42],"assigned":[43],"to":[44,53,142],"all":[45],"intermediate":[46],"steps":[47],"process,":[51],"failing":[52],"provide":[54],"discriminative":[55],"credit":[56],"assignment.":[57],"(ii)":[58],"State-trajectory":[59],"Policy":[61,84],"updates":[62],"often":[64],"diverted":[65],"toward":[66],"artificial,":[67],"out-of-trajectory":[68],"states,":[69],"squandering":[70],"gradients":[71],"on":[72,129,144,147,150,154],"less":[73],"informative":[74],"samples.":[75],"To":[76],"address":[77],"these":[78],"limitations,":[79],"we":[80],"introduce":[81],"Process":[82,103],"Aligned":[83],"Optimization":[85],"(PAPO),":[86],"novel":[88],"framework":[89],"that":[90,106,120,133],"holistically":[91],"aligns":[92],"RL":[94],"with":[96],"dLLM's":[98],"generative":[99],"via":[101],"Step-Aware":[102],"Rewards":[104],"(SPR)":[105],"transform":[107],"sparse":[108],"into":[111],"dense,":[112],"step-wise":[113],"credit,":[114],"Entropy-Guided":[116],"Historical":[117],"Re-enactment":[118],"(EHR)":[119],"replays":[121],"trajectories":[123],"at":[124],"high-uncertainty":[125],"steps.":[126],"Extensive":[127],"experiments":[128],"four":[130],"benchmarks":[131],"demonstrate":[132],"PAPO":[134],"significantly":[135],"outperforms":[136],"baselines,":[137],"achieving":[138],"gains":[139],"up":[141],"4.5%":[143],"GSM8K,":[145],"4.8%":[146],"MATH500,":[148],"42.2%":[149],"Countdown":[151],"16.1%":[153],"Sudoku.":[155]},"counts_by_year":[],"updated_date":"2026-07-28T07:46:37.118299","created_date":"2026-06-10T00:00:00"}
