跳到正文
N 大模型信息总览

    场景子榜单

    7 / 7 个场景有第三方数据。每个场景绑一个明确的第三方指标,原样收录、原样排序 —— 不把不同来源的分数加权成一个「场景总分」(口径不同,加起来没有意义)。 这一页是总览:每个场景给前十名预览;点进场景看完整榜单, 窗口内每条都在(每榜最多 30 条):前 10 名直接可见,第 11 名起折叠,删减一条都没有。 榜单得有几个模型真的在比才算数 —— 窗口内不足 10 个模型的榜不展示(并写明是哪几个)。

    编码

    写代码、改代码、跑测试——谁的通过率最高 106 个模型

    口径:AA SciCode(科学编程)· AA Terminal-Bench 4.0(终端任务) · 通过率越高越好(第三方跑真实编程题,非厂商自报)

    • Terminal-Bench 4.0 共 34 条(近 90 天发布)· 另有 18 个更早未显示 数据日期 2026年10月9日
    • SciCode 共 35 条(近 90 天发布)· 另有 19 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「Terminal-Bench 4.0」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号

    # 模型(榜单原样) 厂商 %
    1 Anthropic: Claude Sonnet 5.5 Anthropic 63.636
    2 Anthropic: Claude Opus 5.5 Anthropic 59.596
    3 OpenAI: GPT-6 Astra OpenAI 59.091
    4 OpenAI: GPT-6.1 Sol OpenAI 56.061
    5 Anthropic: Claude Fable 5.1 Anthropic 52.020
    6 Z.ai: GLM 5.3 智谱 AI 41.919
    7 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 38.889
    9 Xiaomi: MiMo-V2.6-Pro Xiaomi 34.848
    10 inclusionAI: Ling 3.1 Flash 蚂蚁集团 33.333
    11 Meta: Muse Spark 1.3 Meta 33.333

    查看完整榜单(2 个榜 · 每榜最多 30 条)→

    口径说明与已剔除项

    • 已剔除 Aider polyglot:信源停更(最新条目 2025-09-29,近 3 个月无新模型),旧分不再采集也不再展示 —— 停更的榜拿来选型会误导。

    Agent / 工具调用

    自动跑流程、调工具、做运维任务——谁靠得住 120 个模型

    口径:AA τ²-bench(工具调用)· τ²-bench Banking · ITBench-SRE(SRE 运维任务)· Terminal-Bench Hard · 看真实任务完成率;ITBench-SRE 最贴近内部运维(17 个模型有分)

    • τ²-bench Banking 共 22 条(近 90 天发布)· 另有 20 个更早未显示 数据日期 2026年10月9日
    • ITBench-SRE 共 12 条(近 90 天发布)· 另有 6 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「τ²-bench Banking」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号

    # 模型(榜单原样) 厂商 %
    1 Meta: Muse Spark 1.3 Meta 50.515
    2 Z.ai: GLM 5.3 智谱 AI 50.309
    3 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 49.072
    4 Qwen: Qwen3.8 27B 阿里云 通义千问 48.041
    5 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 47.835
    6 Anthropic: Claude Fable 5.1 Anthropic 47.216
    7 Z.ai: GLM 5.3 Flash 智谱 AI 47.216
    8 MoonshotAI: Kimi K3 月之暗面 Kimi 45.979
    9 Google: Gemini 3.8 Flash Google 44.948
    10 OpenAI: GPT-6 Astra OpenAI 41.443

    查看完整榜单(2 个榜 · 每榜最多 30 条)→

    已剔除 2 个窗口内不足 10 个模型的榜:Terminal-Bench Hard、τ²-bench —— 只有几个模型在比,名次是巧合。

    长文本 / 文档处理

    喂长文档、按真实职业要求交付——谁更稳 120 个模型

    口径:AA LCR(长上下文推理)· AA GDPval(真实职业交付任务) · LCR 看长上下文推理;GDPval 是真实职业任务交付,越接近「能用」的分越高

    • GDPval 共 35 条(近 90 天发布)· 另有 20 个更早未显示 数据日期 2026年10月9日
    • LCR 共 36 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「GDPval」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号

    # 模型(榜单原样) 厂商 %
    1 Anthropic: Claude Opus 5.5 Anthropic 68.313
    2 Anthropic: Claude Sonnet 5.5 Anthropic 66.955
    3 Anthropic: Claude Fable 5.1 Anthropic 62.811
    4 SpaceXAI: Grok 4.7 xAI 60.622
    5 Xiaomi: MiMo-V2.6-Pro Xiaomi 59.238
    6 Meta: Muse Spark 1.3 Meta 59.050
    7 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 58.570
    8 Z.ai: GLM 5.3 智谱 AI 57.536
    9 Z.ai: GLM 5.3 Flash 智谱 AI 57.206
    10 inclusionAI: Ling 3.1 Flash 蚂蚁集团 56.088

    查看完整榜单(2 个榜 · 每榜最多 30 条)→

    通用推理

    通用推理与文本综合水平(与首页散点图同源) 181 个模型

    口径:AA 智能指数(10 项基准综合)· GPQA Diamond · Humanity's Last Exam · 智能指数就是首页散点图的纵轴,这里是同一口径 —— 别当成两份数据

    • AA 智能指数 共 36 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日
    • Humanity's Last Exam 共 36 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日
    • GPQA Diamond 共 22 条(近 90 天发布)· 另有 29 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「AA 智能指数」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号

    # 模型(榜单原样) 厂商 分
    1 Anthropic: Claude Opus 5.5 Anthropic 57.622
    2 Anthropic: Claude Sonnet 5.5 Anthropic 56.000
    3 Anthropic: Claude Fable 5.1 Anthropic 53.355
    4 OpenAI: GPT-6 Astra OpenAI 52.674
    5 OpenAI: GPT-6.1 Sol OpenAI 51.833
    6 Meta: Muse Spark 1.3 Meta 48.092
    7 SpaceXAI: Grok 4.7 xAI 46.447
    8 Xiaomi: MiMo-V2.6-Pro Xiaomi 46.324
    9 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 45.415
    10 Z.ai: GLM 5.3 智谱 AI 44.777

    查看完整榜单(3 个榜 · 每榜最多 30 条)→

    图像

    文生图谁的成图更受欢迎、单价多少 168 个模型

    口径:Arena Elo(人类盲测偏好) · Elo 越高越受欢迎(1000 为基准锚点);价格是第三方口径的每千张

    • Arena Elo(人类盲测偏好) 共 164 条(近 90 天发布)· 另有 4 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「Arena Elo(人类盲测偏好)」;第 11 名之后的完整榜单在该场景页) · 名次沿用信源原始名次,窗口外的老模型已隐藏,所以会跳号

    # 模型(榜单原样) 厂商 Elo
    1 GPT Image 2.5 Sunburst (max) OpenAI 1197.570
    2 GPT Image 2.5 Flare (max) OpenAI 1190.850
    3 GPT Image 2 (high) OpenAI 1172.430
    4 Nano Banana 2.1 Google 1160.060
    5 Grok Imagine Image 2.0 SpaceXAI 1155.660
    6 MAI-Image-2.6 Microsoft AI 1151.060
    8 Muse Image Meta 1115.100
    9 GPT Image 1.5 (high) OpenAI 1107.380
    10 MAI-Image-2.6-Flash Microsoft AI 1105.420
    11 MAI-Image-2.5 Microsoft AI 1103.590

    查看完整榜单(1 个榜 · 每榜最多 30 条)→

    视频

    文生视频谁的效果最好 112 个模型

    口径:Arena Elo(人类盲测偏好)· 文生视频 / 图生视频两个榜 · Elo 越高越受欢迎(人类盲测两两投票);视频榜迭代快,务必看榜头的快照日期

    • Arena Elo(图生视频 · 人类盲测偏好) 共 81 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日
    • Arena Elo(文生视频 · 人类盲测偏好) 共 31 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「Arena Elo(图生视频 · 人类盲测偏好)」;第 11 名之后的完整榜单在该场景页)

    # 模型(榜单原样) 厂商 Elo
    1 Gemini Omni Flash Google 1368.150
    2 Bach 1.0 Pro Video Rebirth 1362.010
    3 Wan 3.0 Alibaba 1361.760
    4 Vimoo 1.0 Vimoo 1348.480
    5 PixVerse V6 PixVerse 1338.880
    6 Grok Imagine Video 1.5 SpaceXAI 1330.980
    7 grok-imagine-video SpaceXAI 1328.220
    8 Kling 2.5 Turbo 1080p KlingAI 1298.640
    9 Vidu Q3 Pro Vidu 1289.990
    10 PixVerse V5.6 PixVerse 1287.050

    查看完整榜单(2 个榜 · 每榜最多 30 条)→

    口径说明与已剔除项

    • 文生视频与图生视频是两个独立榜,同一个模型在两个榜上的名次可能差很多 —— 按用途各看各的,不合并
    • 视频模型多数不在本站的文本模型目录里,所以只进榜单、不参与价格与散点图

    语音

    语音合成自然度、语音识别准确率与单价 133 个模型

    口径:合成:Arena Preference Elo(越高越好)· 识别:AA-WER Index(越低越好) · 合成看偏好 Elo;识别看 WER 指数(错误率,越低越好)

    • Arena Preference Elo(人类偏好) 共 97 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日
    • AA-WER Index(词错误率,越低越好) 共 36 条(近 90 天发布)· 另有 0 个更早未显示 数据日期 2026年10月9日

    前十名预览(按「Arena Preference Elo(人类偏好)」;第 11 名之后的完整榜单在该场景页)

    # 模型(榜单原样) 厂商 Elo
    1 Eleven v4 Turbo — 1329.000
    2 Eleven v4 — 1326.000
    3 Qwen-Audio-3.1-TTS-Plus — 1298.000
    4 Sonic 3.6 — 1281.000
    5 Gemini 3.8 Flash TTS — 1275.000
    6 Qwen-Audio-3.0-TTS-Plus — 1267.000
    7 Realtime TTS-2 — 1257.000
    8 Simba 3.2 — 1244.000
    9 Gemini 3.8 Flash-Lite TTS — 1243.000
    10 Breeze TTS 2 — 1222.000

    查看完整榜单(2 个榜 · 每榜最多 30 条)→