← 返回资讯
大模型 HuggingFace Daily Papers 2026-07-21

LLM 即教练:非可验证任务的体验式学习

LLM 即教练:非可验证任务的体验式学习

传统 RL 在开放式任务中将 LLM 评价压缩为标量奖励,丢弃丰富的文本反馈。该研究提出体验式学习,将 LLM 评判模型转为教练角色,将对每次响应的评估提炼为可迁移的体验知识,通过上下文蒸馏内化到策略中,提供比标量奖励更高带宽的反馈。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。