Jul 16, 2026 · Mask-Aware Policy Gradients
Mask-Aware Policy Gradients for Diffusion Language Models
Mask-Aware Policy Gradients (MAPG) 方法在 GSM8K 上达到 87.1%,在 MBPP 上达到 53.4%。
EVENT STORY
Development
- First ReportMask-Aware Policy Gradients for Diffusion Language ModelsarXiv cs.AI
- Current Assessment该工作表明,将强化学习应用于扩散语言模型可以显著提升推理能力,可能推动扩散模型在需要逐步推理的任务中的应用。Agent Pulse · analysis
Mask-Aware Policy Gradients (MAPG) 方法通过将 MDLM 生成过程形式化为两阶段动作 MDP,联合优化 token 项和 masking 项,在数学推理和编程基准上取得 SOTA 结果。
该方法解决了 MDLM 中 log-likelihood 估计的难解问题,通过分解策略梯度为 token 和 masking 两项,实现了更有效的强化学习训练。
该工作表明,将强化学习应用于扩散语言模型可以显著提升推理能力,可能推动扩散模型在需要逐步推理的任务中的应用。
提升数学和代码推理能力可增强 AI 在教育和软件开发等领域的实用性,但当前为研究阶段,商业转化尚需时间。
未来可关注该方法在更大规模模型和更多推理任务上的扩展性,以及是否会被集成到主流扩散语言模型框架中。