CoRT:基于反事实回放的 Token 级评分标准引导策略优化
基于评分标准的强化学习通过显式标准评估模型输出来丰富语言模型训练。然而在 GRPO 风格流程中,这些结构化判断被压缩为标量响应级奖励并转化为统一的响应级优势,导致响应内各 token 无法获得差异化信用分配,即使不同标准对应不同文本片段、格式决策或语义选择。CoRT 提出针对评分条件 GRPO 的 Token 级信用加权方法。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
基于评分标准的强化学习通过显式标准评估模型输出来丰富语言模型训练。然而在 GRPO 风格流程中,这些结构化判断被压缩为标量响应级奖励并转化为统一的响应级优势,导致响应内各 token 无法获得差异化信用分配,即使不同标准对应不同文本片段、格式决策或语义选择。CoRT 提出针对评分条件 GRPO 的 Token 级信用加权方法。
查看原文