为解决 LLM 在长时域游戏中强化学习稀疏奖励的信用分配问题,我们提出 CAST,利用游戏求解器的状态值变化提供更密集的回合级过程信号。
想读得更深?AI Insight Pro 解锁全部深度研报与资讯完整解读。