← 返回资讯
研究 HuggingFace Daily Papers

Flux-OPD:随学生表现演化的上下文的首要策略蒸馏

大语言模型在开放式领域训练中缺乏可验证奖励,任务偏好难以形式化为有效监督。上下文虽能传达偏好,但蒸馏到学生模型后额外监督有限,需随学生表现演化的上下文。然而直接使用演化上下文会导致蒸馏目标不稳定和分布冲突。本文通过分解分析上下文的效果。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。