← 返回资讯
大模型 HuggingFace Daily Papers

CAST:游戏求解器作为 LLM 代理的回合级教师

为解决 LLM 在长时域游戏中强化学习稀疏奖励的信用分配问题,我们提出 CAST,利用游戏求解器的状态值变化提供更密集的回合级过程信号。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。