WeaveBench:面向混合界面计算机智能体的长时序真实任务基准
WeaveBench 提供综合基准用于评估多界面计算机智能体,揭示了长时序任务编排的重大挑战,并指出传统性能评估方法的局限性。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。
WeaveBench 提供综合基准用于评估多界面计算机智能体,揭示了长时序任务编排的重大挑战,并指出传统性能评估方法的局限性。
查看原文