LLM 即教练:非可验证任务的体验式学习
传统 RL 在开放式任务中将 LLM 评价压缩为标量奖励,丢弃丰富的文本反馈。该研究提出体验式学习,将 LLM 评判模型转为教练角色,将对每次响应的评估提炼为可迁移的体验知识,通过上下文蒸馏内化到策略中,提供比标量奖励更高带宽的反馈。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
传统 RL 在开放式任务中将 LLM 评价压缩为标量奖励,丢弃丰富的文本反馈。该研究提出体验式学习,将 LLM 评判模型转为教练角色,将对每次响应的评估提炼为可迁移的体验知识,通过上下文蒸馏内化到策略中,提供比标量奖励更高带宽的反馈。
查看原文