Bellman Policy Optimization作者Zhuoqing Song, Haotian Xu, Xikun Zhang, Lidong Bing核心发表机构Apodex US, Inc.、Princeton University论文链接arXiv:2609.15987v1发布于arXiv 预印本cs.LG|————| GRPO-ClipHigher | 45.6 | 34.8 | 38.0 | 39.5 || GSPO | 50.3 | 35.5 | 44.6 | 43.5 || CISPO | 52.7 | 39.0 | 50.4 | 47.4 || DPPO | 55.8 | 39.2 | 44.2 | 46.4 || BPO |57.4|41.0|53.0|50.5|相对最强基线 CISPO47.4%BPO 高出 3.1 个百分点相对 DPPO46.4%高出 4.1 个百分点相对 GSPO43.5%高出 7.0 个百分点相对 GRPO-ClipHigher39.5%高出 11.0 个百分点。训练 400 步结束时 BPO 平均准确率为 49.4%而训练结束时最强基线 DPPO 为 45.5%说明 BPO 不仅峰值更高收敛终点也更好。图 1 展示了训练过程中的平均 Avg32 曲线可以看出 BPO 在大部分训练区间内都处于领先位置。这一结果对论文的核心论点提供了直接支持BPO 的“互补 token 概率平滑比”确实比 GRPO 的“重要性采样比”以及 DPPO/CISPO/GSPO 等变体更有效地利用了终端奖励信号。4.3 消融实验 / Ablation Study消融实验在 Qwen3-4B-Base 上考察 BPO 的两个关键超参平滑参数ϵ \epsilonϵ与截断参数C CC。ϵ \epsilonϵ消融固定C 3.0 C3.0C3.0的结果如下MethodAIME24AIME25AIME26Avg.BPO (ϵ 0.05 \epsilon0.05ϵ0.05)31.623.022.825.8BPO (ϵ 0.1 \epsilon0.1ϵ0.1)27.626.821.825.4BPO (ϵ 0.2 \epsilon0.2ϵ0.2)29.124.323.025.5BPO (ϵ 0.3 \epsilon0.3ϵ0.3)26.425.520.424.1GRPO-ClipHigher22.122.816.620.5当ϵ ∈ { 0.05 , 0.1 , 0.2 } \epsilon\in\{0.05,0.1,0.2\}ϵ∈{0.05,0.1,0.2}时BPO 平均准确率稳定在 25.4%–25.8% 之间ϵ 0.3 \epsilon0.3ϵ0.3时下降到 24.1%但仍比 GRPO-ClipHigher 的 20.5% 高出 3.6 个百分点。这说明平滑参数在合理区间内对性能不敏感主要作用是数值稳定性而非精度调优。图 2 显示了对应的训练曲线虚线标记每条曲线的峰值。)C CC消融固定ϵ 0.1 \epsilon0.1ϵ0.1的结果如下MethodAIME24AIME25AIME26Avg.BPO (C 2.0 C2.0C2.0)26.426.023.525.3BPO (C 3.0 C3.0C3.0)27.626.821.825.4BPO (C 4.0 C4.0C4.0)27.129.021.325.8GRPO-ClipHigher22.122.816.620.5三个C CC值给出的平均准确率在 25.3%–25.8% 之间跨度仅 0.5 个百分点且都超过 GRPO-ClipHigher 的 20.5%。不同年份基准上的最优C CC并不一致AIME26 偏好C 2.0 C2.0C2.0AIME24 偏好C 3.0 C3.0C3.0AIME25 偏好C 4.0 C4.0C4.0但整体平均差异很小。图 3 显示了对应的训练曲线。)综合两组消融BPO 对ϵ \epsilonϵ和C CC都表现出较好的鲁棒性这与其损失设计一致加性平滑与 cap 的主要目的是控制w ~ t i \tilde{w}_t^iw~ti​的数值范围而非引入需要精细调节的性能敏感项。五、相关工作 / Related Work与 GRPO 及其变体的关系。GRPO 用组内奖励归一化得到优势并在 PPO 风格裁剪目标中使用 token 级重要性采样比r t i π / μ r_t^i\pi/\murti​π/μ。BPO 保留了这个代理目标的整体结构但把r t i r_t^irti​替换为截断后的 mismatch-correction weightmin ⁡ { s g ( w ~ t i ) , C } \min\{\mathrm{sg}(\tilde{w}_t^i),C\}min{sg(w~ti​),C}其中w ~ t i ( 1 ϵ − μ ) / ( 1 ϵ − π ) \tilde{w}_t^i(1\epsilon-\mu)/(1\epsilon-\pi)w~ti​(1ϵ−μ)/(1ϵ−π)。mask 规则也沿用 GRPO 裁剪形式只是把判断对象从r t i r_t^irti​换成w ~ t i \tilde{w}_t^iw~ti​。因此 BPO 可以看作“把 GRPO 的启发式比值修正替换为从 PMD 推导出的互补概率比修正”。实验中对比的 GRPO-ClipHigher 使用 DAPO 的非对称裁剪区间[ 0.8 , 1.28 ] [0.8,1.28][0.8,1.28]。与需要 value model 的 actor-critic / PPO 类方法的关系。BPO 是 critic-free 的它既不需要训练 value model也不需要估计中间状态的V μ V^\muVμ、Q μ Q^\muQμ或A μ A^\muAμ。这一点直接回应了论文在动机中提出的两个问题——训练 critic 的显存与计算成本以及学习到的值估计在推理任务上可能不准确。与 Policy Mirror Descent 的关系。BPO 不是对 PMD 的简单应用而是将 PMD 重写为一个轨迹级平方残差目标。这一步的关键是利用 Bellman 方程把 token 级优势的累积折叠为终端奖励与初始值之差。论文证明这一重写保持了与 advantage-based PMD 相同的唯一最优解在 rollout 策略可达状态和完成分布意义上因此 BPO 可以视为 PMD 在“终端奖励加自回归生成”这一特殊设定下的等价 critic-free 形式。与直接对齐方法DPO 类的关系。BPO 的推导思路受到直接对齐工作的影响如 DPO 类方法及其 token-level 变体但它并非简单的 DPO 变形它的出发点是一个显式的轨迹级残差最小化问题最终损失的 mask、cap 与平滑结构都与 PPO/GRPO 风格的代理目标一致而不是 DPO 式的闭式偏好损失。与 DPPO、CISPO、GSPO 的关系。这三者都是近期 RLVR 中出现的策略优化变体。DPPO 使用 binary total variation、阈值δ 0.1 \delta0.1δ0.1CISPO 使用重要性权重 cap 3.0GSPO 使用序列级裁剪区间。BPO 与它们的共同点是都在 GRPO 框架内调整比值或裁剪机制区别在于 BPO 的权重来自“互补 token 概率”的平滑比并且有 PMD 与 Bellman 方程的理论推导支撑而不仅仅是启发式改动。计算成本方面。全量 reverse KL 需要整个词表的 logits代价高BPO 使用 binary KL 作为全量 KL 的下界近似只需要 token 自身的概率及其补概率。推导中的 reverse KL 项经 binary KL 近似后体现在 token 权重中因此训练时无需额外 KL penalty。六、局限性与展望 / Limitations Future Work论文提供的材料中没有独立的 Limitations 章节也没有失败案例分析。基于方法本身与实验材料可以识别出以下约束与代价Binary KL 是有偏近似。理论目标中的全量 reverse KL 在实用损失中被替换为 binary KL。binary KL 只是全量 KL 的一个下界不直接优化完整 KL 散度因此 BPO 理论目标与实现损失之间存在明确的近似间隙。这一间隙对最终性能的影响在材料中未被定量分析。权重存在数值风险需要ϵ \epsilonϵ与C CC双重控制。未平滑的乘子1 − μ ( y t ) 1 − π ( y t ) \frac{1-\mu(y_t)}{1-\pi(y_t)}1−π(yt​)1−μ(yt​)​在π ( y t ) → 1 \pi(y_t)\to 1π(yt​)→1时可能发散。论文通过加性平滑ϵ \epsilonϵ与截断C CC来控制它消融显示两者在合理范围内都不敏感但这同时也意味着最终损失的形式依赖于这两个工程性超参而它们的理论最优选择在材料中未给出。等价性定理有条件。定理的等价性建立在 rollout 策略可达状态、完成分布意义以及相关 KL 量有限的前提上。在真实训练中rollout 策略与当前策略的差异来自策略更新和推理引擎数值差异可达状态集合会随训练变化因此定理对“实际训练轨迹”的覆盖率在材料中未做进一步讨论。对组内估计的依赖。V μ ( x ) V^\mu(x)Vμ(x)用组内奖励均值估计ϕ ( x ) \phi(x)ϕ(x)用组内奖励标准差的倒数估计因此 BPO 与 GRPO 一样依赖 group rollout。当组内奖励方差为零或极小时ϕ ( x ) \phi(x)ϕ(x)的估计会不稳定材料中未说明这种情况下的处理方式。实验覆盖范围有限。主实验只在 Qwen3-30B-A3B-Base 上、只在 DAPO-Math-17k 英文子集上、只评估 AIME24–26 三个数学推理基准消融只在 Qwen3-4B-Base 上进行。材料中未给出其他数学推理或通用推理基准、其他模型规模、其他数据集的系统结果因此 BPO 的泛化性仍有待进一步验证。此外消融中 AIME26 的分数整体低于 AIME24 和 AIME25且不同年份最优超参不一致材料中未解释这一现象。训练成本对比未展开。材料中给出了训练配置400 步、4096 条回复/step 等但没有给出 BPO 与各基线在显存占用、吞吐量、总 GPU 小时上的直接对比。考虑到 BPO 与 GRPO 在损失结构上的相似性其额外开销主要来自w ~ t i \tilde{w}_t^iw~ti​的计算理论上接近零但材料中未见实证。七、总结 / ConclusionBellman Policy Optimization 的核心思想可以用一句话概括在终端奖励加自回归生成的设定下Bellman 方程可以把 advantage-based PMD 的逐状态更新条件折叠成一条轨迹级的平方残差目标从而在不训练 critic、不估计中间状态价值的前提下恢复与 PMD 相同的策略更新。论文的推导链条清晰从 PMD 的闭式解出发先消去状态相关配分函数得到以 token 级残差表示的最优性条件再用 Bellman 性质的望远镜求和把累积优势折叠为R ( x , y ) − V μ ( x ) R(x,y)-V^\mu(x)R(x,y)−Vμ(x)得到只依赖终端奖励和初始值的轨迹级目标随后通过线性化、组内优势标准化、binary KL 近似、加性平滑与 GRPO 风格 mask/clip将该目标转化为可实现的 token 级损失。最终损失的形式与 GRPO 高度相似唯一关键区别是用“互补 token 概率的平滑比”w ~ t i \tilde{w}_t^iw~ti​替代了重要性采样比r t i r_t^irti​。实验上在 Qwen3-30B-A3B-Base 上训练 400 步BPO 在 AIME24–26 上取得 50.5% 的峰值平均 Avg32超过 GRPO-ClipHigher、GSPO、CISPO、DPPO 3.1–11.0 个百分点。在 Qwen3-4B-Base 上对ϵ \epsilonϵ和C CC的消融显示 BPO 在多个设置下都能稳定优于 GRPO-ClipHigher且对两个超参不敏感。这些结果支持了论文的核心主张从 PMD 和 Bellman 方程出发推导出的互补概率比修正比 GRPO 的重要性采样比以及 DPPO/CISPO/GSPO 等启发式变体更有效地把终端奖励信号转化为 token 级策略更新。原文摘要:Reinforcement learning with verifiable rewards (RLVR) improves the reasoning capabilities of large language models (LLMs). We introduce Bellman Policy Optimization (BPO), a critic-free method derived from Policy Mirror Descent (PMD). For autoregressive generation with terminal rewards, BPO uses the Bellman equations to reformulate PMD as a trajectory-level objective. The reformulation avoids estimating state values at intermediate states. We prove that it has the same unique optimal solution as the original PMD objective. We derive the practical BPO loss by approximating this objective. Its mismatch-correction weight is a smoothed ratio of complementary token probabilities. Experiments on mathematical reasoning benchmarks demonstrate the effectiveness of BPO.PDF链接:https://arxiv.org/pdf/2609.15987v1部分平台可能图片显示异常请以我的博客内容为准