← 返回资讯
研究 @Alibaba_Qwen

通义千问: 📢Qwen3.7-Max just hit #3 on ITbench-AA — a…

📢Qwen3.7-Max just hit #3 on ITbench-AA — a fresh benchmark testing how well models handle real-wor…

查看原文
TL;DR · 评测解读

Qwen3.7-Max 在新晋 ITbench-AA 评测中拿下第三名,但该 benchmark 透明度极低——缺乏公开评分标准、参评模型数量和具体分数差距,厂商"报喜"式传播存在 cherry-picking 风险,实际参考价值存疑。

深度解读

测什么:ITbench-AA 的定位存疑

ITbench-AA 名称暗示是面向 Agent(智能体)场景的 IT 任务评测,但目前公开信息极为有限。从常识推断,该 benchmark 应覆盖代码执行、工具调用、自动化工作流等场景——这也是 2026 年主流模型评测的标配方向。然而,benchmark 的具体任务集、评分维度和数据来源均未披露,外界无法判断其与真实 Agent 使用场景的贴合程度。

更关键的是,该 benchmark 尚未建立行业公信力。相比 SWE-bench(代码任务)、AgentBench(综合 Agent 评估)等有学术背书的评测,ITbench-AA 的第三方验证缺失,使其更像是一个厂商主导的定制化测试场。

方法论质疑

参考来源
  1. Qwen3.7-Max ITbench-AA 第三名公告 · 2026-05-28
  2. AgentBench: A Benchmark for Agents · 2023-08-01
  3. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? · 2022-10-01
本解读由 AI 自动生成 · 模板:评测解读 · 仅供参考,请以原文为准。