跳到正文
N 大模型信息总览

    ← 场景总览

    编码

    写代码、改代码、跑测试——谁的通过率最高

    口径:AA SciCode(科学编程)· AA Terminal-Bench 4.0(终端任务) · 通过率越高越好(第三方跑真实编程题,非厂商自报)

    106 个模型 · 2 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。

    跳到榜单: Terminal-Bench 4.0 · SciCode (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)

    口径说明与已剔除项

    • 已剔除 Aider polyglot:信源停更(最新条目 2025-09-29,近 3 个月无新模型),旧分不再采集也不再展示 —— 停更的榜拿来选型会误导。

    Terminal-Bench 4.0

    Artificial Analysis Terminal-Bench 4.0 数据日期 2026年10月9日 近 7 天 共 34 条(近 90 天发布)· 另有 18 个更早的未显示 · 最多展示前 30 条 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:终端任务完成率(真实命令行操作,含多步任务) · 不代表:不代表代码质量、架构设计或业务理解

    # 模型(榜单原样) 厂商 % 较上一批 备注
    1 Anthropic: Claude Sonnet 5.5 Anthropic 63.636 +0.00 名次持平 终端操作 / Agent
    2 Anthropic: Claude Opus 5.5 Anthropic 59.596 +0.00 名次持平 终端操作 / Agent
    3 OpenAI: GPT-6 Astra OpenAI 59.091 +0.00 名次持平 终端操作 / Agent
    4 OpenAI: GPT-6.1 Sol OpenAI 56.061 +0.00 名次持平 终端操作 / Agent
    5 Anthropic: Claude Fable 5.1 Anthropic 52.020 +0.00 名次持平 终端操作 / Agent
    6 Z.ai: GLM 5.3 智谱 AI 41.919 +0.00 名次持平 终端操作 / Agent
    7 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 38.889 +0.00 名次持平 终端操作 / Agent
    9 Xiaomi: MiMo-V2.6-Pro Xiaomi 34.848 +0.00 名次持平 终端操作 / Agent
    10 inclusionAI: Ling 3.1 Flash 蚂蚁集团 33.333 +0.00 ↓1 终端操作 / Agent
    11 Meta: Muse Spark 1.3 Meta 33.333 +0.00 名次持平 终端操作 / Agent
    展开其余 20 条(第 11–30 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 % 较上一批 备注
    12 StepFun: Step 5 Preview 阶跃星辰 33.333 — 终端操作 / Agent
    13 Anthropic: Claude Haiku 5.5 Anthropic 32.828 +0.00 分 ↓1 终端操作 / Agent
    14 Z.ai: GLM 5.3 Flash 智谱 AI 32.828 +0.00 分 ↓1 终端操作 / Agent
    15 DeepSeek: DeepSeek V4.1 Flash DeepSeek 深度求索 26.768 +0.00 分 ↓1 终端操作 / Agent
    16 SpaceXAI: Grok 4.7 xAI 25.758 +0.00 分 ↓1 终端操作 / Agent
    17 Xiaomi: MiMo-V2.6-Flash Xiaomi 22.727 +0.00 分 ↓1 终端操作 / Agent
    18 Google: Gemini 3.8 Flash Google 19.697 +0.00 分 ↓1 终端操作 / Agent
    19 DeepSeek: DeepSeek V4 Pro 0813 DeepSeek 深度求索 14.141 +0.00 分 ↓1 终端操作 / Agent
    20 OpenAI: GPT-6 Luna OpenAI 12.626 +0.00 分 ↓1 终端操作 / Agent
    21 MoonshotAI: Kimi K3 月之暗面 Kimi 12.626 +0.00 分 ↓1 终端操作 / Agent
    22 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 11.111 +0.00 分 ↓1 终端操作 / Agent
    23 Qwen: Qwen3.8 27B 阿里云 通义千问 5.556 +0.00 分 ↓1 终端操作 / Agent
    26 Upstage: Solar Mini 4 Upstage 1.010 +0.00 分 ↓1 终端操作 / Agent
    27 Thinking Machines: Inkling Small Thinkingmachines 1.010 +0.00 分 ↓1 终端操作 / Agent
    28 Google: Gemini 3.5 Flash Lite Google 1.010 +0.00 分 ↓1 终端操作 / Agent
    29 Thinking Machines: Inkling Thinkingmachines 1.010 +0.00 分 ↓1 终端操作 / Agent
    32 Cohere: Command A+ Cohere 0.505 +0.00 分 ↓1 终端操作 / Agent
    33 NVIDIA: Nemotron 3.5 Lightning NVIDIA 0.505 +0.00 分 ↓1 终端操作 / Agent
    34 Upstage: Solar Pro 4 Upstage 0.505 +0.00 分 ↓1 终端操作 / Agent
    39 inclusionAI: Ling 3.0 Flash VL 蚂蚁集团 0.000 +0.00 分 ↓1 终端操作 / Agent

    SciCode

    Artificial Analysis SciCode 数据日期 2026年10月9日 近 7 天 共 35 条(近 90 天发布)· 另有 19 个更早的未显示 · 最多展示前 30 条 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:科学计算编程题的正确率(第三方在自己环境里跑真实题目) · 不代表:不代表工程能力、代码可维护性,也不代表中文场景

    # 模型(榜单原样) 厂商 % 较上一批 备注
    1 Anthropic: Claude Opus 5.5 Anthropic 66.898 +0.00 名次持平 科学编程
    2 Anthropic: Claude Fable 5.1 Anthropic 63.079 +0.00 名次持平 科学编程
    3 Anthropic: Claude Sonnet 5.5 Anthropic 60.995 +0.00 名次持平 科学编程
    4 Xiaomi: MiMo-V2.6-Pro Xiaomi 60.880 +0.00 名次持平 科学编程
    5 MoonshotAI: Kimi K3 月之暗面 Kimi 59.491 +0.00 名次持平 科学编程
    6 Z.ai: GLM 5.3 智谱 AI 59.028 +0.00 名次持平 科学编程
    7 StepFun: Step 5 Preview 阶跃星辰 58.912 — 科学编程
    8 Meta: Muse Spark 1.3 Meta 58.796 +0.00 ↓1 科学编程
    10 SpaceXAI: Grok 4.7 xAI 57.407 +0.00 ↓1 科学编程
    11 Google: Gemini 3.8 Flash Google 56.597 +0.00 ↓1 科学编程
    展开其余 20 条(第 11–30 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 % 较上一批 备注
    12 OpenAI: GPT-6 Astra OpenAI 56.481 +0.00 分 ↓1 科学编程
    13 Anthropic: Claude Haiku 5.5 Anthropic 54.977 +0.00 分 ↓1 科学编程
    15 OpenAI: GPT-6 Luna OpenAI 54.630 +0.00 分 ↓1 科学编程
    16 OpenAI: GPT-6.1 Sol OpenAI 54.167 +0.00 分 ↓1 科学编程
    17 inclusionAI: Ling 3.1 Flash 蚂蚁集团 54.051 +0.00 分 ↓1 科学编程
    18 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 54.051 +0.00 分 ↓1 科学编程
    19 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 52.083 +0.00 分 ↓1 科学编程
    20 DeepSeek: DeepSeek V4.1 Flash DeepSeek 深度求索 51.852 +0.00 分 ↓1 科学编程
    21 Z.ai: GLM 5.3 Flash 智谱 AI 51.620 +0.00 分 ↓1 科学编程
    22 Xiaomi: MiMo-V2.6-Flash Xiaomi 51.273 +0.00 分 ↓1 科学编程
    23 DeepSeek: DeepSeek V4 Pro 0813 DeepSeek 深度求索 51.042 +0.00 分 ↓1 科学编程
    24 Thinking Machines: Inkling Small Thinkingmachines 49.653 +0.00 分 ↓1 科学编程
    27 Upstage: Solar Mini 4 Upstage 47.569 +0.00 分 ↓1 科学编程
    29 Thinking Machines: Inkling Thinkingmachines 46.991 +0.00 分 ↓1 科学编程
    30 Qwen: Qwen3.8 27B 阿里云 通义千问 46.644 +0.00 分 ↓1 科学编程
    33 Upstage: Solar Pro 4 Upstage 44.560 +0.00 分 ↓1 科学编程
    34 inclusionAI: Ling 3.0 Flash VL 蚂蚁集团 44.213 +0.00 分 ↓1 科学编程
    35 inclusionAI: Ling 3.0 Flash Fin 蚂蚁集团 42.361 +0.00 分 ↓1 科学编程
    36 Google: Gemini 3.5 Flash Lite Google 41.319 +0.00 分 ↓1 科学编程
    43 Cohere: Command A+ Cohere 38.542 +0.00 分 ↓1 科学编程