编码
写代码、改代码、跑测试——谁的通过率最高
口径:AA SciCode(科学编程)· AA Terminal-Bench 4.0(终端任务) · 通过率越高越好(第三方跑真实编程题,非厂商自报)
106 个模型 · 2 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。
跳到榜单: Terminal-Bench 4.0 · SciCode (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)
口径说明与已剔除项
- 已剔除 Aider polyglot:信源停更(最新条目 2025-09-29,近 3 个月无新模型),旧分不再采集也不再展示 —— 停更的榜拿来选型会误导。
Terminal-Bench 4.0
Artificial Analysis
Terminal-Bench 4.0
数据日期 2026年10月9日
近 7 天
共 34 条(近 90 天发布)· 另有 18 个更早的未显示 · 最多展示前 30 条
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:终端任务完成率(真实命令行操作,含多步任务) · 不代表:不代表代码质量、架构设计或业务理解
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Anthropic: Claude Sonnet 5.5 | Anthropic | 63.636 | +0.00 名次持平 | 终端操作 / Agent |
| 2 | Anthropic: Claude Opus 5.5 | Anthropic | 59.596 | +0.00 名次持平 | 终端操作 / Agent |
| 3 | OpenAI: GPT-6 Astra | OpenAI | 59.091 | +0.00 名次持平 | 终端操作 / Agent |
| 4 | OpenAI: GPT-6.1 Sol | OpenAI | 56.061 | +0.00 名次持平 | 终端操作 / Agent |
| 5 | Anthropic: Claude Fable 5.1 | Anthropic | 52.020 | +0.00 名次持平 | 终端操作 / Agent |
| 6 | Z.ai: GLM 5.3 | 智谱 AI | 41.919 | +0.00 名次持平 | 终端操作 / Agent |
| 7 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 38.889 | +0.00 名次持平 | 终端操作 / Agent |
| 9 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 34.848 | +0.00 名次持平 | 终端操作 / Agent |
| 10 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 33.333 | +0.00 ↓1 | 终端操作 / Agent |
| 11 | Meta: Muse Spark 1.3 | Meta | 33.333 | +0.00 名次持平 | 终端操作 / Agent |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 12 | StepFun: Step 5 Preview | 阶跃星辰 | 33.333 | — | 终端操作 / Agent |
| 13 | Anthropic: Claude Haiku 5.5 | Anthropic | 32.828 | +0.00 分 ↓1 | 终端操作 / Agent |
| 14 | Z.ai: GLM 5.3 Flash | 智谱 AI | 32.828 | +0.00 分 ↓1 | 终端操作 / Agent |
| 15 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 26.768 | +0.00 分 ↓1 | 终端操作 / Agent |
| 16 | SpaceXAI: Grok 4.7 | xAI | 25.758 | +0.00 分 ↓1 | 终端操作 / Agent |
| 17 | Xiaomi: MiMo-V2.6-Flash | Xiaomi | 22.727 | +0.00 分 ↓1 | 终端操作 / Agent |
| 18 | Google: Gemini 3.8 Flash | 19.697 | +0.00 分 ↓1 | 终端操作 / Agent | |
| 19 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 14.141 | +0.00 分 ↓1 | 终端操作 / Agent |
| 20 | OpenAI: GPT-6 Luna | OpenAI | 12.626 | +0.00 分 ↓1 | 终端操作 / Agent |
| 21 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 12.626 | +0.00 分 ↓1 | 终端操作 / Agent |
| 22 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 11.111 | +0.00 分 ↓1 | 终端操作 / Agent |
| 23 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 5.556 | +0.00 分 ↓1 | 终端操作 / Agent |
| 26 | Upstage: Solar Mini 4 | Upstage | 1.010 | +0.00 分 ↓1 | 终端操作 / Agent |
| 27 | Thinking Machines: Inkling Small | Thinkingmachines | 1.010 | +0.00 分 ↓1 | 终端操作 / Agent |
| 28 | Google: Gemini 3.5 Flash Lite | 1.010 | +0.00 分 ↓1 | 终端操作 / Agent | |
| 29 | Thinking Machines: Inkling | Thinkingmachines | 1.010 | +0.00 分 ↓1 | 终端操作 / Agent |
| 32 | Cohere: Command A+ | Cohere | 0.505 | +0.00 分 ↓1 | 终端操作 / Agent |
| 33 | NVIDIA: Nemotron 3.5 Lightning | NVIDIA | 0.505 | +0.00 分 ↓1 | 终端操作 / Agent |
| 34 | Upstage: Solar Pro 4 | Upstage | 0.505 | +0.00 分 ↓1 | 终端操作 / Agent |
| 39 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 0.000 | +0.00 分 ↓1 | 终端操作 / Agent |
SciCode
Artificial Analysis
SciCode
数据日期 2026年10月9日
近 7 天
共 35 条(近 90 天发布)· 另有 19 个更早的未显示 · 最多展示前 30 条
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:科学计算编程题的正确率(第三方在自己环境里跑真实题目) · 不代表:不代表工程能力、代码可维护性,也不代表中文场景
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Anthropic: Claude Opus 5.5 | Anthropic | 66.898 | +0.00 名次持平 | 科学编程 |
| 2 | Anthropic: Claude Fable 5.1 | Anthropic | 63.079 | +0.00 名次持平 | 科学编程 |
| 3 | Anthropic: Claude Sonnet 5.5 | Anthropic | 60.995 | +0.00 名次持平 | 科学编程 |
| 4 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 60.880 | +0.00 名次持平 | 科学编程 |
| 5 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 59.491 | +0.00 名次持平 | 科学编程 |
| 6 | Z.ai: GLM 5.3 | 智谱 AI | 59.028 | +0.00 名次持平 | 科学编程 |
| 7 | StepFun: Step 5 Preview | 阶跃星辰 | 58.912 | — | 科学编程 |
| 8 | Meta: Muse Spark 1.3 | Meta | 58.796 | +0.00 ↓1 | 科学编程 |
| 10 | SpaceXAI: Grok 4.7 | xAI | 57.407 | +0.00 ↓1 | 科学编程 |
| 11 | Google: Gemini 3.8 Flash | 56.597 | +0.00 ↓1 | 科学编程 |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 12 | OpenAI: GPT-6 Astra | OpenAI | 56.481 | +0.00 分 ↓1 | 科学编程 |
| 13 | Anthropic: Claude Haiku 5.5 | Anthropic | 54.977 | +0.00 分 ↓1 | 科学编程 |
| 15 | OpenAI: GPT-6 Luna | OpenAI | 54.630 | +0.00 分 ↓1 | 科学编程 |
| 16 | OpenAI: GPT-6.1 Sol | OpenAI | 54.167 | +0.00 分 ↓1 | 科学编程 |
| 17 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 54.051 | +0.00 分 ↓1 | 科学编程 |
| 18 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 54.051 | +0.00 分 ↓1 | 科学编程 |
| 19 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 52.083 | +0.00 分 ↓1 | 科学编程 |
| 20 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 51.852 | +0.00 分 ↓1 | 科学编程 |
| 21 | Z.ai: GLM 5.3 Flash | 智谱 AI | 51.620 | +0.00 分 ↓1 | 科学编程 |
| 22 | Xiaomi: MiMo-V2.6-Flash | Xiaomi | 51.273 | +0.00 分 ↓1 | 科学编程 |
| 23 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 51.042 | +0.00 分 ↓1 | 科学编程 |
| 24 | Thinking Machines: Inkling Small | Thinkingmachines | 49.653 | +0.00 分 ↓1 | 科学编程 |
| 27 | Upstage: Solar Mini 4 | Upstage | 47.569 | +0.00 分 ↓1 | 科学编程 |
| 29 | Thinking Machines: Inkling | Thinkingmachines | 46.991 | +0.00 分 ↓1 | 科学编程 |
| 30 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 46.644 | +0.00 分 ↓1 | 科学编程 |
| 33 | Upstage: Solar Pro 4 | Upstage | 44.560 | +0.00 分 ↓1 | 科学编程 |
| 34 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 44.213 | +0.00 分 ↓1 | 科学编程 |
| 35 | inclusionAI: Ling 3.0 Flash Fin | 蚂蚁集团 | 42.361 | +0.00 分 ↓1 | 科学编程 |
| 36 | Google: Gemini 3.5 Flash Lite | 41.319 | +0.00 分 ↓1 | 科学编程 | |
| 43 | Cohere: Command A+ | Cohere | 38.542 | +0.00 分 ↓1 | 科学编程 |