← 返回资讯
研究 HuggingFace Daily Papers

接力传递:轨迹中继在线策略蒸馏

在线策略蒸馏(OPD)将token级监督建立在学生自身轨迹上,但存在前缀失败问题:学生一旦选择错误推理方向,后续生成便基于该偏差,产生误导性延续。我们识别出教师-学生在失败前缀上的延续不对称性,并将其转化为Relay-OPD中的无标签交接触发机制。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。