Agent / 工具调用
自动跑流程、调工具、做运维任务——谁靠得住
口径:AA τ²-bench(工具调用)· τ²-bench Banking · ITBench-SRE(SRE 运维任务)· Terminal-Bench Hard · 看真实任务完成率;ITBench-SRE 最贴近内部运维(17 个模型有分)
120 个模型 · 2 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。
跳到榜单: τ²-bench Banking · ITBench-SRE (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)
已剔除 2 个窗口内不足 10 个模型的榜:Terminal-Bench Hard、τ²-bench —— 只有几个模型在比,排出来的名次是巧合(数据本身仍在模型详情页可见,没删)。
τ²-bench Banking
Artificial Analysis
τ²-bench Banking
数据日期 2026年10月9日
近 7 天
共 22 条(近 90 天发布)· 另有 20 个更早的未显示 · 最多展示前 30 条(全部)
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:工具调用与多轮对话任务通过率(模拟真实业务流程) · 不代表:场景化指标,不代表通用对话或写作能力
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Meta: Muse Spark 1.3 | Meta | 50.515 | +0.00 名次持平 | 银行业务 Agent |
| 2 | Z.ai: GLM 5.3 | 智谱 AI | 50.309 | +0.00 名次持平 | 银行业务 Agent |
| 3 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 49.072 | +0.00 名次持平 | 银行业务 Agent |
| 4 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 48.041 | +0.00 名次持平 | 银行业务 Agent |
| 5 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 47.835 | +0.00 名次持平 | 银行业务 Agent |
| 6 | Anthropic: Claude Fable 5.1 | Anthropic | 47.216 | +0.00 名次持平 | 银行业务 Agent |
| 7 | Z.ai: GLM 5.3 Flash | 智谱 AI | 47.216 | +0.00 名次持平 | 银行业务 Agent |
| 8 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 45.979 | +0.00 名次持平 | 银行业务 Agent |
| 9 | Google: Gemini 3.8 Flash | 44.948 | +0.00 名次持平 | 银行业务 Agent | |
| 10 | OpenAI: GPT-6 Astra | OpenAI | 41.443 | +0.00 名次持平 | 银行业务 Agent |
展开其余 12 条(第 11–22 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 12 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 39.588 | +0.00 分 — | 银行业务 Agent |
| 13 | inclusionAI: Ling 3.0 Flash Fin | 蚂蚁集团 | 38.557 | +0.00 分 — | 银行业务 Agent |
| 14 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 34.433 | +0.00 分 — | 银行业务 Agent |
| 15 | Thinking Machines: Inkling | Thinkingmachines | 29.072 | +0.00 分 — | 银行业务 Agent |
| 16 | Upstage: Solar Pro 4 | Upstage | 23.299 | +0.00 分 — | 银行业务 Agent |
| 20 | Thinking Machines: Inkling Small | Thinkingmachines | 18.763 | +0.00 分 — | 银行业务 Agent |
| 21 | Google: Gemini 3.5 Flash Lite | 17.526 | +0.00 分 — | 银行业务 Agent | |
| 27 | Meituan: LongCat 2.0 | Meituan | 13.196 | +0.00 分 — | 银行业务 Agent |
| 33 | NVIDIA: Nemotron 3.5 Lightning | NVIDIA | 8.866 | +0.00 分 — | 银行业务 Agent |
| 34 | IBM: Granite 4.2 8B | Ibm Granite | 7.629 | +0.00 分 — | 银行业务 Agent |
| 35 | LiquidAI: LFM2.5-2.6B (free) | Liquid | 7.216 | +0.00 分 — | 银行业务 Agent |
| 37 | Cohere: Command A+ | Cohere | 5.979 | +0.00 分 — | 银行业务 Agent |
ITBench-SRE
Artificial Analysis
ITBench-SRE
数据日期 2026年10月9日
近 7 天
共 12 条(近 90 天发布)· 另有 6 个更早的未显示 · 最多展示前 30 条(全部)
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:SRE 运维任务完成率(故障定位与处置) · 不代表:运维场景专项,不代表开发能力
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | StepFun: Step 5 Preview | 阶跃星辰 | 55.556 | — | SRE 运维任务 |
| 2 | Google: Gemini 3.8 Flash | 52.542 | +0.00 ↓1 | SRE 运维任务 | |
| 3 | Z.ai: GLM 5.3 Flash | 智谱 AI | 51.243 | +0.00 ↓1 | SRE 运维任务 |
| 5 | Anthropic: Claude Fable 5.1 | Anthropic | 49.529 | +0.00 ↓1 | SRE 运维任务 |
| 6 | OpenAI: GPT-6 Astra | OpenAI | 48.588 | +0.00 ↓1 | SRE 运维任务 |
| 7 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 47.693 | +0.00 ↓1 | SRE 运维任务 |
| 8 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 46.916 | +0.00 ↓1 | SRE 运维任务 |
| 9 | Z.ai: GLM 5.3 | 智谱 AI | 46.083 | +0.00 ↓1 | SRE 运维任务 |
| 10 | SpaceXAI: Grok 4.7 | xAI | 42.081 | +0.00 ↓1 | SRE 运维任务 |
| 11 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 40.254 | +0.00 ↓1 | SRE 运维任务 |
展开其余 2 条(第 11–12 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 12 | Anthropic: Claude Opus 5.5 | Anthropic | 38.230 | +0.00 分 ↓1 | SRE 运维任务 |
| 14 | Meta: Muse Spark 1.3 | Meta | 33.239 | +0.00 分 ↓1 | SRE 运维任务 |