接力传递:轨迹中继在线策略蒸馏
在线策略蒸馏(OPD)将token级监督建立在学生自身轨迹上,但存在前缀失败问题:学生一旦选择错误推理方向,后续生成便基于该偏差,产生误导性延续。我们识别出教师-学生在失败前缀上的延续不对称性,并将其转化为Relay-OPD中的无标签交接触发机制。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
在线策略蒸馏(OPD)将token级监督建立在学生自身轨迹上,但存在前缀失败问题:学生一旦选择错误推理方向,后续生成便基于该偏差,产生误导性延续。我们识别出教师-学生在失败前缀上的延续不对称性,并将其转化为Relay-OPD中的无标签交接触发机制。
查看原文