EnvACE:通过世界排演内化环境动态以实现智能体强化学习
为长时程工具使用训练大型语言模型智能体通常依赖与真实或合成可执行环境的交互,这些环境的构建和验证成本高昂,或依赖难以落地的外部模拟器。我们引入EnvACE,一种智能体强化学习方法,用世界排演替代训练期间的外部环境交互。策略在行动和排演之间交替:首先生成工具调用,然后扮演环境角色产生该动作诱导的响应,并条件化后续决策...
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
为长时程工具使用训练大型语言模型智能体通常依赖与真实或合成可执行环境的交互,这些环境的构建和验证成本高昂,或依赖难以落地的外部模拟器。我们引入EnvACE,一种智能体强化学习方法,用世界排演替代训练期间的外部环境交互。策略在行动和排演之间交替:首先生成工具调用,然后扮演环境角色产生该动作诱导的响应,并条件化后续决策...
查看原文