ABSeeker:基于答案回溯信用分配的長程搜索智能体训练方法
长程搜索智能体需执行多步序列操作来搜索、检索、验证并整合证据以得出答案,但现有方法在监督微调和强化学习中对轨迹内所有步骤一视同仁,无法区分有效操作与错误或冗余操作。该论文提出答案回溯信用分配(ABC)框架,通过将稀疏的轨迹级结果转化为细粒度信用信号,实现对长程搜索智能体的精细训练。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
长程搜索智能体需执行多步序列操作来搜索、检索、验证并整合证据以得出答案,但现有方法在监督微调和强化学习中对轨迹内所有步骤一视同仁,无法区分有效操作与错误或冗余操作。该论文提出答案回溯信用分配(ABC)框架,通过将稀疏的轨迹级结果转化为细粒度信用信号,实现对长程搜索智能体的精细训练。
查看原文