通用推理
通用推理与文本综合水平(与首页散点图同源)
口径:AA 智能指数(10 项基准综合)· GPQA Diamond · Humanity's Last Exam · 智能指数就是首页散点图的纵轴,这里是同一口径 —— 别当成两份数据
181 个模型 · 3 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。
跳到榜单: AA 智能指数 · Humanity's Last Exam · GPQA Diamond (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)
AA 智能指数
Artificial Analysis
AA 智能指数
数据日期 2026年10月9日
近 7 天
共 36 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:10 项公开基准的综合分(本站首页散点图同源) · 不代表:综合分会把不同能力平均掉 —— 选型要看分项,别只看它
| # | 模型(榜单原样) | 厂商 | 分 | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Anthropic: Claude Opus 5.5 | Anthropic | 57.622 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 2 | Anthropic: Claude Sonnet 5.5 | Anthropic | 56.000 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 3 | Anthropic: Claude Fable 5.1 | Anthropic | 53.355 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 4 | OpenAI: GPT-6 Astra | OpenAI | 52.674 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 5 | OpenAI: GPT-6.1 Sol | OpenAI | 51.833 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 6 | Meta: Muse Spark 1.3 | Meta | 48.092 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 7 | SpaceXAI: Grok 4.7 | xAI | 46.447 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 8 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 46.324 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 9 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 45.415 | +0.00 名次持平 | 综合智能指数(10 项基准) |
| 10 | Z.ai: GLM 5.3 | 智谱 AI | 44.777 | +0.00 名次持平 | 综合智能指数(10 项基准) |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | 分 | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 11 | StepFun: Step 5 Preview | 阶跃星辰 | 43.734 | — | 综合智能指数(10 项基准) |
| 12 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 43.594 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 13 | Anthropic: Claude Haiku 5.5 | Anthropic | 43.395 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 15 | Z.ai: GLM 5.3 Flash | 智谱 AI | 41.807 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 16 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 41.091 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 17 | Google: Gemini 3.8 Flash | 40.926 | +0.00 分 ↓1 | 综合智能指数(10 项基准) | |
| 18 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 39.886 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 19 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 39.456 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 20 | OpenAI: GPT-6 Luna | OpenAI | 38.125 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 21 | Xiaomi: MiMo-V2.6-Flash | Xiaomi | 37.884 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 22 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 35.997 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 23 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 33.696 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 27 | Upstage: Solar Pro 4 | Upstage | 28.154 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 29 | Thinking Machines: Inkling Small | Thinkingmachines | 25.658 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 32 | Thinking Machines: Inkling | Thinkingmachines | 24.985 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 33 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 24.569 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 34 | Upstage: Solar Mini 4 | Upstage | 24.052 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 36 | inclusionAI: Ling 3.0 Flash Fin | 蚂蚁集团 | 22.597 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
| 37 | Google: Gemini 3.5 Flash Lite | 22.169 | +0.00 分 ↓1 | 综合智能指数(10 项基准) | |
| 40 | Meituan: LongCat 2.0 | Meituan | 19.112 | +0.00 分 ↓1 | 综合智能指数(10 项基准) |
Humanity's Last Exam
Artificial Analysis
Humanity's Last Exam
数据日期 2026年10月9日
近 7 天
共 36 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:跨学科高难题正确率 · 不代表:偏学术难题,离生产任务较远
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Anthropic: Claude Opus 5.5 | Anthropic | 61.353 | +0.00 名次持平 | 专家级跨学科 |
| 2 | Anthropic: Claude Fable 5.1 | Anthropic | 59.129 | +0.00 名次持平 | 专家级跨学科 |
| 3 | Anthropic: Claude Sonnet 5.5 | Anthropic | 54.958 | +0.00 名次持平 | 专家级跨学科 |
| 4 | OpenAI: GPT-6 Astra | OpenAI | 54.680 | +0.00 名次持平 | 专家级跨学科 |
| 5 | OpenAI: GPT-6.1 Sol | OpenAI | 52.919 | +0.00 名次持平 | 专家级跨学科 |
| 6 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 49.351 | +0.00 名次持平 | 专家级跨学科 |
| 7 | Meta: Muse Spark 1.3 | Meta | 48.703 | +0.00 名次持平 | 专家级跨学科 |
| 8 | Google: Gemini 3.8 Flash | 47.822 | +0.00 名次持平 | 专家级跨学科 | |
| 10 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 46.895 | +0.00 名次持平 | 专家级跨学科 |
| 11 | StepFun: Step 5 Preview | 阶跃星辰 | 46.478 | — | 专家级跨学科 |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 12 | Anthropic: Claude Haiku 5.5 | Anthropic | 44.393 | +0.00 分 ↓1 | 专家级跨学科 |
| 13 | SpaceXAI: Grok 4.7 | xAI | 43.142 | +0.00 分 ↓1 | 专家级跨学科 |
| 14 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 43.095 | +0.00 分 ↓1 | 专家级跨学科 |
| 17 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 42.447 | +0.00 分 ↓1 | 专家级跨学科 |
| 18 | Z.ai: GLM 5.3 | 智谱 AI | 42.261 | +0.00 分 ↓1 | 专家级跨学科 |
| 19 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 41.010 | +0.00 分 ↓1 | 专家级跨学科 |
| 20 | Z.ai: GLM 5.3 Flash | 智谱 AI | 39.852 | +0.00 分 ↓1 | 专家级跨学科 |
| 21 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 39.435 | +0.00 分 ↓1 | 专家级跨学科 |
| 22 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 39.249 | +0.00 分 ↓1 | 专家级跨学科 |
| 24 | OpenAI: GPT-6 Luna | OpenAI | 38.508 | +0.00 分 ↓1 | 专家级跨学科 |
| 26 | Xiaomi: MiMo-V2.6-Flash | Xiaomi | 35.079 | +0.00 分 ↓1 | 专家级跨学科 |
| 28 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 33.920 | +0.00 分 ↓1 | 专家级跨学科 |
| 29 | Meituan: LongCat 2.0 | Meituan | 33.689 | +0.00 分 ↓1 | 专家级跨学科 |
| 31 | Thinking Machines: Inkling Small | Thinkingmachines | 33.318 | +0.00 分 ↓1 | 专家级跨学科 |
| 32 | Thinking Machines: Inkling | Thinkingmachines | 31.881 | +0.00 分 ↓1 | 专家级跨学科 |
| 33 | Upstage: Solar Pro 4 | Upstage | 29.240 | +0.00 分 ↓1 | 专家级跨学科 |
| 35 | Upstage: Solar Mini 4 | Upstage | 25.765 | +0.00 分 ↓1 | 专家级跨学科 |
| 37 | inclusionAI: Ling 3.0 Flash Fin | 蚂蚁集团 | 22.614 | +0.00 分 ↓1 | 专家级跨学科 |
| 39 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 21.965 | +0.00 分 ↓1 | 专家级跨学科 |
| 45 | Google: Gemini 3.5 Flash Lite | 18.814 | +0.00 分 ↓1 | 专家级跨学科 |
GPQA Diamond
Artificial Analysis
GPQA Diamond
数据日期 2026年10月9日
近 7 天
共 22 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条(全部)
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:研究生级理科选择题正确率 · 不代表:知识型指标,不代表工程与工具使用能力
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | OpenAI: GPT-6 Astra | OpenAI | 96.061 | +0.00 名次持平 | 研究生级科学推理 |
| 2 | Google: Gemini 3.8 Flash | 95.253 | +0.00 名次持平 | 研究生级科学推理 | |
| 4 | Anthropic: Claude Fable 5.1 | Anthropic | 93.737 | +0.00 名次持平 | 研究生级科学推理 |
| 5 | Meta: Muse Spark 1.3 | Meta | 93.535 | +0.00 名次持平 | 研究生级科学推理 |
| 6 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 93.535 | +0.00 名次持平 | 研究生级科学推理 |
| 7 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 93.535 | +0.00 名次持平 | 研究生级科学推理 |
| 9 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 92.828 | +0.00 名次持平 | 研究生级科学推理 |
| 10 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 92.828 | +0.00 名次持平 | 研究生级科学推理 |
| 12 | Z.ai: GLM 5.3 | 智谱 AI | 91.717 | +0.00 名次持平 | 研究生级科学推理 |
| 14 | Z.ai: GLM 5.3 Flash | 智谱 AI | 91.212 | +0.00 名次持平 | 研究生级科学推理 |
展开其余 12 条(第 11–22 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 15 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 90.505 | +0.00 分 — | 研究生级科学推理 |
| 19 | Thinking Machines: Inkling Small | Thinkingmachines | 89.495 | +0.00 分 — | 研究生级科学推理 |
| 20 | Upstage: Solar Pro 4 | Upstage | 89.091 | +0.00 分 — | 研究生级科学推理 |
| 21 | Thinking Machines: Inkling | Thinkingmachines | 87.172 | +0.00 分 — | 研究生级科学推理 |
| 23 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 86.162 | +0.00 分 — | 研究生级科学推理 |
| 27 | Google: Gemini 3.5 Flash Lite | 83.838 | +0.00 分 — | 研究生级科学推理 | |
| 34 | Meituan: LongCat 2.0 | Meituan | 77.980 | +0.00 分 — | 研究生级科学推理 |
| 36 | ByteDance Seed: Seed-2.0-Code | 字节跳动 豆包 | 76.364 | +0.00 分 — | 研究生级科学推理 |
| 37 | Cohere: Command A+ | Cohere | 76.061 | +0.00 分 — | 研究生级科学推理 |
| 41 | NVIDIA: Nemotron 3.5 Lightning | NVIDIA | 74.343 | +0.00 分 — | 研究生级科学推理 |
| 45 | IBM: Granite 4.2 8B | Ibm Granite | 63.131 | +0.00 分 — | 研究生级科学推理 |
| 49 | LiquidAI: LFM2.5-2.6B (free) | Liquid | 55.758 | +0.00 分 — | 研究生级科学推理 |