场景子榜单
7 / 7 个场景有第三方数据。每个场景绑一个明确的第三方指标,原样收录、原样排序 —— 不把不同来源的分数加权成一个「场景总分」(口径不同,加起来没有意义)。 这一页是总览:每个场景给前十名预览;点进场景看完整榜单, 窗口内每条都在(每榜最多 30 条):前 10 名直接可见,第 11 名起折叠,删减一条都没有。 榜单得有几个模型真的在比才算数 —— 窗口内不足 10 个模型的榜不展示(并写明是哪几个)。
编码
写代码、改代码、跑测试——谁的通过率最高 106 个模型口径:AA SciCode(科学编程)· AA Terminal-Bench 4.0(终端任务) · 通过率越高越好(第三方跑真实编程题,非厂商自报)
- Terminal-Bench 4.0 共 34 条(近 90 天发布)· 另有 18 个更早未显示 数据日期 2026年10月9日
- SciCode 共 35 条(近 90 天发布)· 另有 19 个更早未显示 数据日期 2026年10月9日
前十名预览(按「Terminal-Bench 4.0」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号
| # | 模型(榜单原样) | 厂商 | % |
|---|---|---|---|
| 1 | Anthropic: Claude Sonnet 5.5 | Anthropic | 63.636 |
| 2 | Anthropic: Claude Opus 5.5 | Anthropic | 59.596 |
| 3 | OpenAI: GPT-6 Astra | OpenAI | 59.091 |
| 4 | OpenAI: GPT-6.1 Sol | OpenAI | 56.061 |
| 5 | Anthropic: Claude Fable 5.1 | Anthropic | 52.020 |
| 6 | Z.ai: GLM 5.3 | 智谱 AI | 41.919 |
| 7 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 38.889 |
| 9 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 34.848 |
| 10 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 33.333 |
| 11 | Meta: Muse Spark 1.3 | Meta | 33.333 |
口径说明与已剔除项
- 已剔除 Aider polyglot:信源停更(最新条目 2025-09-29,近 3 个月无新模型),旧分不再采集也不再展示 —— 停更的榜拿来选型会误导。
Agent / 工具调用
自动跑流程、调工具、做运维任务——谁靠得住 120 个模型口径:AA τ²-bench(工具调用)· τ²-bench Banking · ITBench-SRE(SRE 运维任务)· Terminal-Bench Hard · 看真实任务完成率;ITBench-SRE 最贴近内部运维(17 个模型有分)
- τ²-bench Banking 共 22 条(近 90 天发布)· 另有 20 个更早未显示 数据日期 2026年10月9日
- ITBench-SRE 共 12 条(近 90 天发布)· 另有 6 个更早未显示 数据日期 2026年10月9日
前十名预览(按「τ²-bench Banking」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号
| # | 模型(榜单原样) | 厂商 | % |
|---|---|---|---|
| 1 | Meta: Muse Spark 1.3 | Meta | 50.515 |
| 2 | Z.ai: GLM 5.3 | 智谱 AI | 50.309 |
| 3 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 49.072 |
| 4 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 48.041 |
| 5 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 47.835 |
| 6 | Anthropic: Claude Fable 5.1 | Anthropic | 47.216 |
| 7 | Z.ai: GLM 5.3 Flash | 智谱 AI | 47.216 |
| 8 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 45.979 |
| 9 | Google: Gemini 3.8 Flash | 44.948 | |
| 10 | OpenAI: GPT-6 Astra | OpenAI | 41.443 |
已剔除 2 个窗口内不足 10 个模型的榜:Terminal-Bench Hard、τ²-bench —— 只有几个模型在比,名次是巧合。
长文本 / 文档处理
喂长文档、按真实职业要求交付——谁更稳 120 个模型口径:AA LCR(长上下文推理)· AA GDPval(真实职业交付任务) · LCR 看长上下文推理;GDPval 是真实职业任务交付,越接近「能用」的分越高
- GDPval 共 35 条(近 90 天发布)· 另有 20 个更早未显示 数据日期 2026年10月9日
- LCR 共 36 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日
前十名预览(按「GDPval」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号
| # | 模型(榜单原样) | 厂商 | % |
|---|---|---|---|
| 1 | Anthropic: Claude Opus 5.5 | Anthropic | 68.313 |
| 2 | Anthropic: Claude Sonnet 5.5 | Anthropic | 66.955 |
| 3 | Anthropic: Claude Fable 5.1 | Anthropic | 62.811 |
| 4 | SpaceXAI: Grok 4.7 | xAI | 60.622 |
| 5 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 59.238 |
| 6 | Meta: Muse Spark 1.3 | Meta | 59.050 |
| 7 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 58.570 |
| 8 | Z.ai: GLM 5.3 | 智谱 AI | 57.536 |
| 9 | Z.ai: GLM 5.3 Flash | 智谱 AI | 57.206 |
| 10 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 56.088 |
通用推理
通用推理与文本综合水平(与首页散点图同源) 181 个模型口径:AA 智能指数(10 项基准综合)· GPQA Diamond · Humanity's Last Exam · 智能指数就是首页散点图的纵轴,这里是同一口径 —— 别当成两份数据
- AA 智能指数 共 36 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日
- Humanity's Last Exam 共 36 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日
- GPQA Diamond 共 22 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日
前十名预览(按「AA 智能指数」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号
| # | 模型(榜单原样) | 厂商 | 分 |
|---|---|---|---|
| 1 | Anthropic: Claude Opus 5.5 | Anthropic | 57.622 |
| 2 | Anthropic: Claude Sonnet 5.5 | Anthropic | 56.000 |
| 3 | Anthropic: Claude Fable 5.1 | Anthropic | 53.355 |
| 4 | OpenAI: GPT-6 Astra | OpenAI | 52.674 |
| 5 | OpenAI: GPT-6.1 Sol | OpenAI | 51.833 |
| 6 | Meta: Muse Spark 1.3 | Meta | 48.092 |
| 7 | SpaceXAI: Grok 4.7 | xAI | 46.447 |
| 8 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 46.324 |
| 9 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 45.415 |
| 10 | Z.ai: GLM 5.3 | 智谱 AI | 44.777 |
图像
文生图谁的成图更受欢迎、单价多少 168 个模型口径:Arena Elo(人类盲测偏好) · Elo 越高越受欢迎(1000 为基准锚点);价格是第三方口径的每千张
- Arena Elo(人类盲测偏好) 共 164 条(近 90 天发布)· 另有 4 个更早未显示 数据日期 2026年10月9日
前十名预览(按「Arena Elo(人类盲测偏好)」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号
| # | 模型(榜单原样) | 厂商 | Elo |
|---|---|---|---|
| 1 | GPT Image 2.5 Sunburst (max) | OpenAI | 1197.570 |
| 2 | GPT Image 2.5 Flare (max) | OpenAI | 1190.850 |
| 3 | GPT Image 2 (high) | OpenAI | 1172.430 |
| 4 | Nano Banana 2.1 | 1160.060 | |
| 5 | Grok Imagine Image 2.0 | SpaceXAI | 1155.660 |
| 6 | MAI-Image-2.6 | Microsoft AI | 1151.060 |
| 8 | Muse Image | Meta | 1115.100 |
| 9 | GPT Image 1.5 (high) | OpenAI | 1107.380 |
| 10 | MAI-Image-2.6-Flash | Microsoft AI | 1105.420 |
| 11 | MAI-Image-2.5 | Microsoft AI | 1103.590 |
视频
文生视频谁的效果最好 112 个模型口径:Arena Elo(人类盲测偏好)· 文生视频 / 图生视频两个榜 · Elo 越高越受欢迎(人类盲测两两投票);视频榜迭代快,务必看榜头的快照日期
- Arena Elo(图生视频 · 人类盲测偏好) 共 81 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日
- Arena Elo(文生视频 · 人类盲测偏好) 共 31 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日
前十名预览(按「Arena Elo(图生视频 · 人类盲测偏好)」;第 11 名之后的完整榜单在该场景页)
| # | 模型(榜单原样) | 厂商 | Elo |
|---|---|---|---|
| 1 | Gemini Omni Flash | 1368.150 | |
| 2 | Bach 1.0 Pro | Video Rebirth | 1362.010 |
| 3 | Wan 3.0 | Alibaba | 1361.760 |
| 4 | Vimoo 1.0 | Vimoo | 1348.480 |
| 5 | PixVerse V6 | PixVerse | 1338.880 |
| 6 | Grok Imagine Video 1.5 | SpaceXAI | 1330.980 |
| 7 | grok-imagine-video | SpaceXAI | 1328.220 |
| 8 | Kling 2.5 Turbo 1080p | KlingAI | 1298.640 |
| 9 | Vidu Q3 Pro | Vidu | 1289.990 |
| 10 | PixVerse V5.6 | PixVerse | 1287.050 |
口径说明与已剔除项
- 文生视频与图生视频是两个独立榜,同一个模型在两个榜上的名次可能差很多 —— 按用途各看各的,不合并
- 视频模型多数不在本站的文本模型目录里,所以只进榜单、不参与价格与散点图
语音
语音合成自然度、语音识别准确率与单价 133 个模型口径:合成:Arena Preference Elo(越高越好)· 识别:AA-WER Index(越低越好) · 合成看偏好 Elo;识别看 WER 指数(错误率,越低越好)
- Arena Preference Elo(人类偏好) 共 97 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日
- AA-WER Index(词错误率,越低越好) 共 36 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日
前十名预览(按「Arena Preference Elo(人类偏好)」;第 11 名之后的完整榜单在该场景页)
| # | 模型(榜单原样) | 厂商 | Elo |
|---|---|---|---|
| 1 | Eleven v4 Turbo | — | 1329.000 |
| 2 | Eleven v4 | — | 1326.000 |
| 3 | Qwen-Audio-3.1-TTS-Plus | — | 1298.000 |
| 4 | Sonic 3.6 | — | 1281.000 |
| 5 | Gemini 3.8 Flash TTS | — | 1275.000 |
| 6 | Qwen-Audio-3.0-TTS-Plus | — | 1267.000 |
| 7 | Realtime TTS-2 | — | 1257.000 |
| 8 | Simba 3.2 | — | 1244.000 |
| 9 | Gemini 3.8 Flash-Lite TTS | — | 1243.000 |
| 10 | Breeze TTS 2 | — | 1222.000 |