Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
Tianren Ma, Mu Zhang, Yibing Wang, Qixiang Ye
摘要
Optimizing discrete diffusion model (DDM) with rewards remains a challenge-the non-autoregressive paradigm makes importance sampling intractable and rollout complex, puzzling reinforcement learning methods such as Group Relative Policy Optimization (GRPO). In this study, we introduce MaskGRPO, the first viable approach to enable scalable multimodal reinforcement learning in discrete diffusion with effective importance sampling and modality-specific adaptations. To this end, we first clarify the theoretical foundation for DDMs, which facilitates building an importance estimator that captures valuable token fluctuation for gradient updates. We then delicately tailored the rollout method for visual sequences, which yields diverse completions and reliable optimization gradients. Upon math reasoning, coding, and visual generation benchmarks, MaskGRPO brings more stable and efficient updates, leading to stronger reasoning performance and better generation quality. This study establishes MaskGRPO as a systematic policy optimization approach and the first practical way for discretized visual diffusion. Our code is available at https://github.com/martian422/MaskGRPO . 𝜋𝜋 𝜃𝜃 𝑜𝑜𝑜𝑜𝑜𝑜 o 𝑖𝑖 o 𝑗𝑗 o 𝑘𝑘 � 𝜌𝜌 𝑗𝑗 𝑡𝑡 = exp ℓ 𝜋𝜋𝜃𝜃 𝑜𝑜 𝑗𝑗 𝑡𝑡 , 𝑜𝑜 𝑗𝑗 -ℓ 𝜋𝜋𝜃𝜃 𝑜𝑜𝑜𝑜𝑜𝑜 𝑜𝑜 𝑗𝑗 𝑡𝑡 , 𝑜𝑜 𝑗𝑗 𝜋𝜋 𝜃𝜃 o 𝑖𝑖 o 𝑗𝑗 o 𝑘𝑘 Semi-AR sampler Emerge sampler AR-like re-masked 𝑜𝑜 𝑗𝑗 𝑡𝑡 Random re-masked 𝑜𝑜 𝑗𝑗 𝑡𝑡
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper3
- MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image GenerationGuohui Zhang, Hu Yu, Xiaoxiao Ma, Yaning Pan 等CVPR 2026 · 被引用 6 次
- AceTone: Bridging Words and Colors for Conditional Image GradingTianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang YeCVPR 2026 · 被引用 2 次
- RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep CreditsMu Zhang, Tianren Ma, Yunfan Liu, Kun Hu 等CVPR 2026
它引用的顶会 Paper21
- Direct Preference Optimization: Your Language Model is Secretly a Reward ModelRafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D. Manning 等NeurIPS 2023 · 被引用 10,924 次
- SDXL: Improving Latent Diffusion Models for High-Resolution Image SynthesisDustin Podell, Zion English, Kyle Lacey, Andreas Blattmann 等ICLR 2024 · 被引用 4,569 次
- Scaling Rectified Flow Transformers for High-Resolution Image SynthesisPatrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari 等ICML 2024 · 被引用 3,620 次
- Let's Verify Step by StepHunter Lightman, Vineet Kosaraju, Yuri Burda, Harrison Edwards 等ICLR 2024 · 被引用 3,045 次
- ImageReward: Learning and Evaluating Human Preferences for Text-to-Image GenerationJiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong 等NeurIPS 2023 · 被引用 1,310 次
相关 Paper
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image GenerationYifu Luo, Xinhao Hu, Keyu Fan, Haoyuan Sun 等NeurIPS 2025 · 被引用 12 次
- AG-GRPO: Answer-Guided GRPO for Masked Diffusion Language ModelsJuhyeong Kim, Gyunyeop Kim, Sangwoo KangACL 2026
- VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive GenerationShikun Sun, Liao Qu, Huichao Zhang, Yiheng Liu 等CVPR 2026 · 被引用 2 次
- Principled RL for Diffusion LLMs Emerges from a Sequence-Level PerspectiveJingyang Ou, Jiaqi Han, Minkai Xu, Shaoxuan Xu 等ICLR 2026 · 被引用 33 次
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy OptimizationKevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider 等ICLR 2026 · 被引用 34 次
