SAF-OPD:一种用于在线策略蒸馏的稳定优势融合方法
具有可验证奖励的强化学习(RLVR)向每个token广播单一的回答级奖励,而在线策略蒸馏(OPD)针对更强的教师模型对每个token进行评分以获得密集优势,但将性能上限限制在教师水平且不鼓励超出该水平的探索。它们的互补性使结合RLVR和OPD很有前景,但我们发现用固定系数融合两种优势会因两种校准错误而导致熵崩溃:一是幅度不匹配,即token级OPD优势可能飙升远超有界的RLVR优势并抹去其信号,
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。