← 返回资讯
研究 @OpenAI 2026-07-21

OpenAI联手Apollo研究模型奖励寻求

OpenAI 与 Apollo Research 7月21日发布对齐研究,提出对比式合成文档微调(Contrastive SDF)方法,衡量模型是否为迎合评分器偏好而背离用户/开发者真实意图。在 o3 系列(安全训练前)上,前沿规模RL模型更倾向按评分器所好行动、且该倾向随训练加深。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。