Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
Tianren Ma, Mu Zhang, Yibing Wang, Qixiang Ye
Abstract
Optimizing discrete diffusion model (DDM) with rewards remains a challenge-the non-autoregressive paradigm makes importance sampling intractable and rollout complex, puzzling reinforcement learning methods such as Group Relative Policy Optimization (GRPO). In this study, we introduce MaskGRPO, the first viable approach to enable scalable multimodal reinforcement learning in discrete diffusion with effective importance sampling and modality-specific adaptations. To this end, we first clarify the theoretical foundation for DDMs, which facilitates building an importance estimator that captures valuable token fluctuation for gradient updates. We then delicately tailored the rollout method for visual sequences, which yields diverse completions and reliable optimization gradients. Upon math reasoning, coding, and visual generation benchmarks, MaskGRPO brings more stable and efficient updates, leading to stronger reasoning performance and better generation quality. This study establishes MaskGRPO as a systematic policy optimization approach and the first practical way for discretized visual diffusion. Our code is available at https://github.com/martian422/MaskGRPO . ๐๐ ๐๐ ๐๐๐๐๐๐ o ๐๐ o ๐๐ o ๐๐ ๏ฟฝ ๐๐ ๐๐ ๐ก๐ก = exp โ ๐๐๐๐ ๐๐ ๐๐ ๐ก๐ก , ๐๐ ๐๐ -โ ๐๐๐๐ ๐๐๐๐๐๐ ๐๐ ๐๐ ๐ก๐ก , ๐๐ ๐๐ ๐๐ ๐๐ o ๐๐ o ๐๐ o ๐๐ Semi-AR sampler Emerge sampler AR-like re-masked ๐๐ ๐๐ ๐ก๐ก Random re-masked ๐๐ ๐๐ ๐ก๐ก
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 165b3810-2fa5-44c5-a01d-b166951719deCited by top-tier papers3
- MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image GenerationGuohui Zhang, Hu Yu, Xiaoxiao Ma, Yaning Pan et al.CVPR 2026 ยท 6 citations
- AceTone: Bridging Words and Colors for Conditional Image GradingTianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang YeCVPR 2026 ยท 2 citations
- RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep CreditsMu Zhang, Tianren Ma, Yunfan Liu, Kun Hu et al.CVPR 2026
Builds on21
- Direct Preference Optimization: Your Language Model is Secretly a Reward ModelRafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D. Manning et al.NeurIPS 2023 ยท 10,924 citations
- SDXL: Improving Latent Diffusion Models for High-Resolution Image SynthesisDustin Podell, Zion English, Kyle Lacey, Andreas Blattmann et al.ICLR 2024 ยท 4,569 citations
- Scaling Rectified Flow Transformers for High-Resolution Image SynthesisPatrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari et al.ICML 2024 ยท 3,620 citations
- Let's Verify Step by StepHunter Lightman, Vineet Kosaraju, Yuri Burda, Harrison Edwards et al.ICLR 2024 ยท 3,045 citations
- ImageReward: Learning and Evaluating Human Preferences for Text-to-Image GenerationJiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong et al.NeurIPS 2023 ยท 1,310 citations
Related papers
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image GenerationYifu Luo, Xinhao Hu, Keyu Fan, Haoyuan Sun et al.NeurIPS 2025 ยท 12 citations
- AG-GRPO: Answer-Guided GRPO for Masked Diffusion Language ModelsJuhyeong Kim, Gyunyeop Kim, Sangwoo KangACL 2026
- VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive GenerationShikun Sun, Liao Qu, Huichao Zhang, Yiheng Liu et al.CVPR 2026 ยท 2 citations
- Principled RL for Diffusion LLMs Emerges from a Sequence-Level PerspectiveJingyang Ou, Jiaqi Han, Minkai Xu, Shaoxuan Xu et al.ICLR 2026 ยท 33 citations
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy OptimizationKevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider et al.ICLR 2026 ยท 34 citations
