← 返回资讯
研究 HuggingFace Daily Papers

SWE-Bench ProMax:大规模多语言代码重构智能体基准测试

随着AI编码智能体承担越来越复杂的长期软件工程任务,现有基准测试正快速饱和并受到严格审查:近期审计发现近60%的SWE-bench Verified未解决实例存在测试缺陷——或过于狭窄拒绝正确方案,或过于宽泛检查未声明需求,且前沿模型可能从训练数据中逐字复现标准补丁。代码重构需要跨多文件的行为保持协调变更。

查看原文
解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。