← 返回资讯
研究 HuggingFace Daily Papers

SWE-Touch:用户修改代码时代码智能体的基准测试

现实软件开发需要代码智能体在共享工作空间运行,用户可能在其间检查和修改代码。然而现有仓库级基准测试通常评估单独工作的智能体,或仅将用户参与限制在消息层面。这促使我们提出问题:代码智能体如何在共享工作空间中理解和响应代码变化?我们引入SWE-Touch框架,通过验证的Counter-Edits(对任务相关代码的似是而非的编辑,会与任务完成冲突)来压力测试这一场景。SWE-Touch从mu中挖掘任务关

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。