跳到正文
N 大模型信息总览

    ← 场景总览

    Agent / 工具调用

    自动跑流程、调工具、做运维任务——谁靠得住

    口径:AA τ²-bench(工具调用)· τ²-bench Banking · ITBench-SRE(SRE 运维任务)· Terminal-Bench Hard · 看真实任务完成率;ITBench-SRE 最贴近内部运维(17 个模型有分)

    120 个模型 · 2 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。

    跳到榜单: τ²-bench Banking · ITBench-SRE (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)

    已剔除 2 个窗口内不足 10 个模型的榜:Terminal-Bench Hard、τ²-bench —— 只有几个模型在比,排出来的名次是巧合(数据本身仍在模型详情页可见,没删)。

    τ²-bench Banking

    Artificial Analysis τ²-bench Banking 数据日期 2026年10月9日 近 7 天 共 22 条(近 90 天发布)· 另有 20 个更早的未显示 · 最多展示前 30 条(全部) 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:工具调用与多轮对话任务通过率(模拟真实业务流程) · 不代表:场景化指标,不代表通用对话或写作能力

    # 模型(榜单原样) 厂商 % 较上一批 备注
    1 Meta: Muse Spark 1.3 Meta 50.515 +0.00 名次持平 银行业务 Agent
    2 Z.ai: GLM 5.3 智谱 AI 50.309 +0.00 名次持平 银行业务 Agent
    3 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 49.072 +0.00 名次持平 银行业务 Agent
    4 Qwen: Qwen3.8 27B 阿里云 通义千问 48.041 +0.00 名次持平 银行业务 Agent
    5 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 47.835 +0.00 名次持平 银行业务 Agent
    6 Anthropic: Claude Fable 5.1 Anthropic 47.216 +0.00 名次持平 银行业务 Agent
    7 Z.ai: GLM 5.3 Flash 智谱 AI 47.216 +0.00 名次持平 银行业务 Agent
    8 MoonshotAI: Kimi K3 月之暗面 Kimi 45.979 +0.00 名次持平 银行业务 Agent
    9 Google: Gemini 3.8 Flash Google 44.948 +0.00 名次持平 银行业务 Agent
    10 OpenAI: GPT-6 Astra OpenAI 41.443 +0.00 名次持平 银行业务 Agent
    展开其余 12 条(第 11–22 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 % 较上一批 备注
    12 DeepSeek: DeepSeek V4 Pro 0813 DeepSeek 深度求索 39.588 +0.00 分 — 银行业务 Agent
    13 inclusionAI: Ling 3.0 Flash Fin 蚂蚁集团 38.557 +0.00 分 — 银行业务 Agent
    14 inclusionAI: Ling 3.0 Flash VL 蚂蚁集团 34.433 +0.00 分 — 银行业务 Agent
    15 Thinking Machines: Inkling Thinkingmachines 29.072 +0.00 分 — 银行业务 Agent
    16 Upstage: Solar Pro 4 Upstage 23.299 +0.00 分 — 银行业务 Agent
    20 Thinking Machines: Inkling Small Thinkingmachines 18.763 +0.00 分 — 银行业务 Agent
    21 Google: Gemini 3.5 Flash Lite Google 17.526 +0.00 分 — 银行业务 Agent
    27 Meituan: LongCat 2.0 Meituan 13.196 +0.00 分 — 银行业务 Agent
    33 NVIDIA: Nemotron 3.5 Lightning NVIDIA 8.866 +0.00 分 — 银行业务 Agent
    34 IBM: Granite 4.2 8B Ibm Granite 7.629 +0.00 分 — 银行业务 Agent
    35 LiquidAI: LFM2.5-2.6B (free) Liquid 7.216 +0.00 分 — 银行业务 Agent
    37 Cohere: Command A+ Cohere 5.979 +0.00 分 — 银行业务 Agent

    ITBench-SRE

    Artificial Analysis ITBench-SRE 数据日期 2026年10月9日 近 7 天 共 12 条(近 90 天发布)· 另有 6 个更早的未显示 · 最多展示前 30 条(全部) 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:SRE 运维任务完成率(故障定位与处置) · 不代表:运维场景专项,不代表开发能力

    # 模型(榜单原样) 厂商 % 较上一批 备注
    1 StepFun: Step 5 Preview 阶跃星辰 55.556 — SRE 运维任务
    2 Google: Gemini 3.8 Flash Google 52.542 +0.00 ↓1 SRE 运维任务
    3 Z.ai: GLM 5.3 Flash 智谱 AI 51.243 +0.00 ↓1 SRE 运维任务
    5 Anthropic: Claude Fable 5.1 Anthropic 49.529 +0.00 ↓1 SRE 运维任务
    6 OpenAI: GPT-6 Astra OpenAI 48.588 +0.00 ↓1 SRE 运维任务
    7 MoonshotAI: Kimi K3 月之暗面 Kimi 47.693 +0.00 ↓1 SRE 运维任务
    8 DeepSeek: DeepSeek V4.1 Flash DeepSeek 深度求索 46.916 +0.00 ↓1 SRE 运维任务
    9 Z.ai: GLM 5.3 智谱 AI 46.083 +0.00 ↓1 SRE 运维任务
    10 SpaceXAI: Grok 4.7 xAI 42.081 +0.00 ↓1 SRE 运维任务
    11 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 40.254 +0.00 ↓1 SRE 运维任务
    展开其余 2 条(第 11–12 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 % 较上一批 备注
    12 Anthropic: Claude Opus 5.5 Anthropic 38.230 +0.00 分 ↓1 SRE 运维任务
    14 Meta: Muse Spark 1.3 Meta 33.239 +0.00 分 ↓1 SRE 运维任务