跳到正文
N 大模型信息总览

    ← 场景总览

    通用推理

    通用推理与文本综合水平(与首页散点图同源)

    口径:AA 智能指数(10 项基准综合)· GPQA Diamond · Humanity's Last Exam · 智能指数就是首页散点图的纵轴,这里是同一口径 —— 别当成两份数据

    181 个模型 · 3 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。

    跳到榜单: AA 智能指数 · Humanity's Last Exam · GPQA Diamond (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)

    AA 智能指数

    Artificial Analysis AA 智能指数 数据日期 2026年10月9日 近 7 天 共 36 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:10 项公开基准的综合分(本站首页散点图同源) · 不代表:综合分会把不同能力平均掉 —— 选型要看分项,别只看它

    # 模型(榜单原样) 厂商 分 较上一批 备注
    1 Anthropic: Claude Opus 5.5 Anthropic 57.622 +0.00 名次持平 综合智能指数(10 项基准)
    2 Anthropic: Claude Sonnet 5.5 Anthropic 56.000 +0.00 名次持平 综合智能指数(10 项基准)
    3 Anthropic: Claude Fable 5.1 Anthropic 53.355 +0.00 名次持平 综合智能指数(10 项基准)
    4 OpenAI: GPT-6 Astra OpenAI 52.674 +0.00 名次持平 综合智能指数(10 项基准)
    5 OpenAI: GPT-6.1 Sol OpenAI 51.833 +0.00 名次持平 综合智能指数(10 项基准)
    6 Meta: Muse Spark 1.3 Meta 48.092 +0.00 名次持平 综合智能指数(10 项基准)
    7 SpaceXAI: Grok 4.7 xAI 46.447 +0.00 名次持平 综合智能指数(10 项基准)
    8 Xiaomi: MiMo-V2.6-Pro Xiaomi 46.324 +0.00 名次持平 综合智能指数(10 项基准)
    9 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 45.415 +0.00 名次持平 综合智能指数(10 项基准)
    10 Z.ai: GLM 5.3 智谱 AI 44.777 +0.00 名次持平 综合智能指数(10 项基准)
    展开其余 20 条(第 11–30 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 分 较上一批 备注
    11 StepFun: Step 5 Preview 阶跃星辰 43.734 — 综合智能指数(10 项基准)
    12 MoonshotAI: Kimi K3 月之暗面 Kimi 43.594 +0.00 分 ↓1 综合智能指数(10 项基准)
    13 Anthropic: Claude Haiku 5.5 Anthropic 43.395 +0.00 分 ↓1 综合智能指数(10 项基准)
    15 Z.ai: GLM 5.3 Flash 智谱 AI 41.807 +0.00 分 ↓1 综合智能指数(10 项基准)
    16 inclusionAI: Ling 3.1 Flash 蚂蚁集团 41.091 +0.00 分 ↓1 综合智能指数(10 项基准)
    17 Google: Gemini 3.8 Flash Google 40.926 +0.00 分 ↓1 综合智能指数(10 项基准)
    18 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 39.886 +0.00 分 ↓1 综合智能指数(10 项基准)
    19 DeepSeek: DeepSeek V4.1 Flash DeepSeek 深度求索 39.456 +0.00 分 ↓1 综合智能指数(10 项基准)
    20 OpenAI: GPT-6 Luna OpenAI 38.125 +0.00 分 ↓1 综合智能指数(10 项基准)
    21 Xiaomi: MiMo-V2.6-Flash Xiaomi 37.884 +0.00 分 ↓1 综合智能指数(10 项基准)
    22 DeepSeek: DeepSeek V4 Pro 0813 DeepSeek 深度求索 35.997 +0.00 分 ↓1 综合智能指数(10 项基准)
    23 Qwen: Qwen3.8 27B 阿里云 通义千问 33.696 +0.00 分 ↓1 综合智能指数(10 项基准)
    27 Upstage: Solar Pro 4 Upstage 28.154 +0.00 分 ↓1 综合智能指数(10 项基准)
    29 Thinking Machines: Inkling Small Thinkingmachines 25.658 +0.00 分 ↓1 综合智能指数(10 项基准)
    32 Thinking Machines: Inkling Thinkingmachines 24.985 +0.00 分 ↓1 综合智能指数(10 项基准)
    33 inclusionAI: Ling 3.0 Flash VL 蚂蚁集团 24.569 +0.00 分 ↓1 综合智能指数(10 项基准)
    34 Upstage: Solar Mini 4 Upstage 24.052 +0.00 分 ↓1 综合智能指数(10 项基准)
    36 inclusionAI: Ling 3.0 Flash Fin 蚂蚁集团 22.597 +0.00 分 ↓1 综合智能指数(10 项基准)
    37 Google: Gemini 3.5 Flash Lite Google 22.169 +0.00 分 ↓1 综合智能指数(10 项基准)
    40 Meituan: LongCat 2.0 Meituan 19.112 +0.00 分 ↓1 综合智能指数(10 项基准)

    Humanity's Last Exam

    Artificial Analysis Humanity's Last Exam 数据日期 2026年10月9日 近 7 天 共 36 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:跨学科高难题正确率 · 不代表:偏学术难题,离生产任务较远

    # 模型(榜单原样) 厂商 % 较上一批 备注
    1 Anthropic: Claude Opus 5.5 Anthropic 61.353 +0.00 名次持平 专家级跨学科
    2 Anthropic: Claude Fable 5.1 Anthropic 59.129 +0.00 名次持平 专家级跨学科
    3 Anthropic: Claude Sonnet 5.5 Anthropic 54.958 +0.00 名次持平 专家级跨学科
    4 OpenAI: GPT-6 Astra OpenAI 54.680 +0.00 名次持平 专家级跨学科
    5 OpenAI: GPT-6.1 Sol OpenAI 52.919 +0.00 名次持平 专家级跨学科
    6 Xiaomi: MiMo-V2.6-Pro Xiaomi 49.351 +0.00 名次持平 专家级跨学科
    7 Meta: Muse Spark 1.3 Meta 48.703 +0.00 名次持平 专家级跨学科
    8 Google: Gemini 3.8 Flash Google 47.822 +0.00 名次持平 专家级跨学科
    10 MoonshotAI: Kimi K3 月之暗面 Kimi 46.895 +0.00 名次持平 专家级跨学科
    11 StepFun: Step 5 Preview 阶跃星辰 46.478 — 专家级跨学科
    展开其余 20 条(第 11–30 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 % 较上一批 备注
    12 Anthropic: Claude Haiku 5.5 Anthropic 44.393 +0.00 分 ↓1 专家级跨学科
    13 SpaceXAI: Grok 4.7 xAI 43.142 +0.00 分 ↓1 专家级跨学科
    14 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 43.095 +0.00 分 ↓1 专家级跨学科
    17 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 42.447 +0.00 分 ↓1 专家级跨学科
    18 Z.ai: GLM 5.3 智谱 AI 42.261 +0.00 分 ↓1 专家级跨学科
    19 DeepSeek: DeepSeek V4 Pro 0813 DeepSeek 深度求索 41.010 +0.00 分 ↓1 专家级跨学科
    20 Z.ai: GLM 5.3 Flash 智谱 AI 39.852 +0.00 分 ↓1 专家级跨学科
    21 inclusionAI: Ling 3.1 Flash 蚂蚁集团 39.435 +0.00 分 ↓1 专家级跨学科
    22 DeepSeek: DeepSeek V4.1 Flash DeepSeek 深度求索 39.249 +0.00 分 ↓1 专家级跨学科
    24 OpenAI: GPT-6 Luna OpenAI 38.508 +0.00 分 ↓1 专家级跨学科
    26 Xiaomi: MiMo-V2.6-Flash Xiaomi 35.079 +0.00 分 ↓1 专家级跨学科
    28 Qwen: Qwen3.8 27B 阿里云 通义千问 33.920 +0.00 分 ↓1 专家级跨学科
    29 Meituan: LongCat 2.0 Meituan 33.689 +0.00 分 ↓1 专家级跨学科
    31 Thinking Machines: Inkling Small Thinkingmachines 33.318 +0.00 分 ↓1 专家级跨学科
    32 Thinking Machines: Inkling Thinkingmachines 31.881 +0.00 分 ↓1 专家级跨学科
    33 Upstage: Solar Pro 4 Upstage 29.240 +0.00 分 ↓1 专家级跨学科
    35 Upstage: Solar Mini 4 Upstage 25.765 +0.00 分 ↓1 专家级跨学科
    37 inclusionAI: Ling 3.0 Flash Fin 蚂蚁集团 22.614 +0.00 分 ↓1 专家级跨学科
    39 inclusionAI: Ling 3.0 Flash VL 蚂蚁集团 21.965 +0.00 分 ↓1 专家级跨学科
    45 Google: Gemini 3.5 Flash Lite Google 18.814 +0.00 分 ↓1 专家级跨学科

    GPQA Diamond

    Artificial Analysis GPQA Diamond 数据日期 2026年10月9日 近 7 天 共 22 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条(全部) 较上一批:2026年10月8日 那批 名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号 信源页面

    测什么:研究生级理科选择题正确率 · 不代表:知识型指标,不代表工程与工具使用能力

    # 模型(榜单原样) 厂商 % 较上一批 备注
    1 OpenAI: GPT-6 Astra OpenAI 96.061 +0.00 名次持平 研究生级科学推理
    2 Google: Gemini 3.8 Flash Google 95.253 +0.00 名次持平 研究生级科学推理
    4 Anthropic: Claude Fable 5.1 Anthropic 93.737 +0.00 名次持平 研究生级科学推理
    5 Meta: Muse Spark 1.3 Meta 93.535 +0.00 名次持平 研究生级科学推理
    6 Qwen: Qwen3.8 2.4T A95B 阿里云 通义千问 93.535 +0.00 名次持平 研究生级科学推理
    7 MoonshotAI: Kimi K3 月之暗面 Kimi 93.535 +0.00 名次持平 研究生级科学推理
    9 Qwen: Qwen3.8 Max (0902) 阿里云 通义千问 92.828 +0.00 名次持平 研究生级科学推理
    10 DeepSeek: DeepSeek V4 Pro 0813 DeepSeek 深度求索 92.828 +0.00 名次持平 研究生级科学推理
    12 Z.ai: GLM 5.3 智谱 AI 91.717 +0.00 名次持平 研究生级科学推理
    14 Z.ai: GLM 5.3 Flash 智谱 AI 91.212 +0.00 名次持平 研究生级科学推理
    展开其余 12 条(第 11–22 名;与上表同列,未删减)
    # 模型(榜单原样) 厂商 % 较上一批 备注
    15 Qwen: Qwen3.8 27B 阿里云 通义千问 90.505 +0.00 分 — 研究生级科学推理
    19 Thinking Machines: Inkling Small Thinkingmachines 89.495 +0.00 分 — 研究生级科学推理
    20 Upstage: Solar Pro 4 Upstage 89.091 +0.00 分 — 研究生级科学推理
    21 Thinking Machines: Inkling Thinkingmachines 87.172 +0.00 分 — 研究生级科学推理
    23 inclusionAI: Ling 3.0 Flash VL 蚂蚁集团 86.162 +0.00 分 — 研究生级科学推理
    27 Google: Gemini 3.5 Flash Lite Google 83.838 +0.00 分 — 研究生级科学推理
    34 Meituan: LongCat 2.0 Meituan 77.980 +0.00 分 — 研究生级科学推理
    36 ByteDance Seed: Seed-2.0-Code 字节跳动 豆包 76.364 +0.00 分 — 研究生级科学推理
    37 Cohere: Command A+ Cohere 76.061 +0.00 分 — 研究生级科学推理
    41 NVIDIA: Nemotron 3.5 Lightning NVIDIA 74.343 +0.00 分 — 研究生级科学推理
    45 IBM: Granite 4.2 8B Ibm Granite 63.131 +0.00 分 — 研究生级科学推理
    49 LiquidAI: LFM2.5-2.6B (free) Liquid 55.758 +0.00 分 — 研究生级科学推理