长文本 / 文档处理
喂长文档、按真实职业要求交付——谁更稳
口径:AA LCR(长上下文推理)· AA GDPval(真实职业交付任务) · LCR 看长上下文推理;GDPval 是真实职业任务交付,越接近「能用」的分越高
120 个模型 · 2 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。
GDPval
Artificial Analysis
GDPval
数据日期 2026年10月9日
近 7 天
共 35 条(近 90 天发布)· 另有 20 个更早的未显示 · 最多展示前 30 条
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:真实职业交付任务的价值加权完成度 · 不代表:任务集有限,不等于所有岗位的实际表现
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Anthropic: Claude Opus 5.5 | Anthropic | 68.313 | +0.00 名次持平 | 经济价值任务 |
| 2 | Anthropic: Claude Sonnet 5.5 | Anthropic | 66.955 | +0.00 名次持平 | 经济价值任务 |
| 3 | Anthropic: Claude Fable 5.1 | Anthropic | 62.811 | -0.08 名次持平 | 经济价值任务 |
| 4 | SpaceXAI: Grok 4.7 | xAI | 60.622 | -0.15 名次持平 | 经济价值任务 |
| 5 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 59.238 | -0.08 名次持平 | 经济价值任务 |
| 6 | Meta: Muse Spark 1.3 | Meta | 59.050 | -0.16 名次持平 | 经济价值任务 |
| 7 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 58.570 | +0.00 名次持平 | 经济价值任务 |
| 8 | Z.ai: GLM 5.3 | 智谱 AI | 57.536 | -0.11 名次持平 | 经济价值任务 |
| 9 | Z.ai: GLM 5.3 Flash | 智谱 AI | 57.206 | -0.14 名次持平 | 经济价值任务 |
| 10 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 56.088 | +0.00 名次持平 | 经济价值任务 |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 11 | Anthropic: Claude Haiku 5.5 | Anthropic | 55.904 | -0.10 分 — | 经济价值任务 |
| 12 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 55.626 | +0.00 分 — | 经济价值任务 |
| 13 | Xiaomi: MiMo-V2.6-Flash | Xiaomi | 55.525 | +0.00 分 — | 经济价值任务 |
| 14 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 55.000 | +0.00 分 — | 经济价值任务 |
| 15 | StepFun: Step 5 Preview | 阶跃星辰 | 54.212 | — | 经济价值任务 |
| 16 | OpenAI: GPT-6.1 Sol | OpenAI | 53.754 | +0.00 分 ↓1 | 经济价值任务 |
| 17 | OpenAI: GPT-6 Astra | OpenAI | 52.095 | +0.00 分 ↓1 | 经济价值任务 |
| 18 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 51.670 | -0.16 分 ↓1 | 经济价值任务 |
| 19 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 47.707 | +0.00 分 ↓1 | 经济价值任务 |
| 21 | Google: Gemini 3.8 Flash | 46.776 | +0.02 分 — | 经济价值任务 | |
| 22 | OpenAI: GPT-6 Luna | OpenAI | 46.582 | -0.27 分 ↓2 | 经济价值任务 |
| 23 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 45.957 | -0.20 分 ↓1 | 经济价值任务 |
| 25 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 33.210 | +0.00 分 ↓1 | 经济价值任务 |
| 26 | Thinking Machines: Inkling Small | Thinkingmachines | 31.223 | +0.00 分 ↓1 | 经济价值任务 |
| 27 | Upstage: Solar Pro 4 | Upstage | 30.491 | +0.00 分 ↓1 | 经济价值任务 |
| 28 | inclusionAI: Ling 3.0 Flash Fin | 蚂蚁集团 | 30.254 | +0.00 分 ↓1 | 经济价值任务 |
| 29 | Upstage: Solar Mini 4 | Upstage | 29.510 | +0.00 分 ↓1 | 经济价值任务 |
| 30 | Thinking Machines: Inkling | Thinkingmachines | 28.780 | -0.16 分 ↓1 | 经济价值任务 |
| 34 | Google: Gemini 3.5 Flash Lite | 24.288 | +0.00 分 ↓1 | 经济价值任务 | |
| 36 | Meituan: LongCat 2.0 | Meituan | 18.470 | -0.16 分 ↓1 | 经济价值任务 |
LCR
Artificial Analysis
LCR
数据日期 2026年10月9日
近 7 天
共 36 条(近 90 天发布)· 另有 29 个更早的未显示 · 最多展示前 30 条
较上一批:2026年10月8日 那批
名次沿用信源原始名次;窗口外的老模型已隐藏,所以名次会跳号
信源页面
测什么:长上下文检索与推理准确率 · 不代表:只测「喂进去的长文档能不能用」,不测上下文窗口大小本身
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | MoonshotAI: Kimi K3 | 月之暗面 Kimi | 88.667 | +0.00 名次持平 | 长上下文推理 |
| 2 | StepFun: Step 5 Preview | 阶跃星辰 | 88.333 | — | 长上下文推理 |
| 3 | Xiaomi: MiMo-V2.6-Pro | Xiaomi | 86.333 | +0.00 ↓1 | 长上下文推理 |
| 4 | Anthropic: Claude Fable 5.1 | Anthropic | 85.333 | +0.00 ↓1 | 长上下文推理 |
| 5 | Anthropic: Claude Opus 5.5 | Anthropic | 84.667 | +0.00 ↓1 | 长上下文推理 |
| 6 | DeepSeek: DeepSeek V4.1 Flash | DeepSeek 深度求索 | 84.000 | +0.00 ↓1 | 长上下文推理 |
| 7 | Upstage: Solar Mini 4 | Upstage | 83.333 | +0.00 ↓1 | 长上下文推理 |
| 8 | OpenAI: GPT-6 Luna | OpenAI | 83.333 | +0.00 ↓1 | 长上下文推理 |
| 10 | inclusionAI: Ling 3.1 Flash | 蚂蚁集团 | 83.000 | +0.00 ↓1 | 长上下文推理 |
| 11 | OpenAI: GPT-6.1 Sol | OpenAI | 83.000 | +0.00 ↓1 | 长上下文推理 |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | % | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 12 | Meta: Muse Spark 1.3 | Meta | 83.000 | +0.00 分 ↓1 | 长上下文推理 |
| 15 | Anthropic: Claude Haiku 5.5 | Anthropic | 82.667 | +0.00 分 ↓1 | 长上下文推理 |
| 16 | Anthropic: Claude Sonnet 5.5 | Anthropic | 82.667 | +0.00 分 ↓1 | 长上下文推理 |
| 17 | Qwen: Qwen3.8 27B | 阿里云 通义千问 | 82.000 | +0.00 分 ↓1 | 长上下文推理 |
| 19 | Google: Gemini 3.8 Flash | 81.333 | +0.00 分 ↓1 | 长上下文推理 | |
| 20 | OpenAI: GPT-6 Astra | OpenAI | 80.667 | +0.00 分 ↓1 | 长上下文推理 |
| 21 | Qwen: Qwen3.8 Max (0902) | 阿里云 通义千问 | 80.333 | +0.00 分 ↓1 | 长上下文推理 |
| 22 | Qwen: Qwen3.8 2.4T A95B | 阿里云 通义千问 | 80.333 | +0.00 分 ↓1 | 长上下文推理 |
| 23 | DeepSeek: DeepSeek V4 Pro 0813 | DeepSeek 深度求索 | 80.333 | +0.00 分 ↓1 | 长上下文推理 |
| 24 | Z.ai: GLM 5.3 Flash | 智谱 AI | 80.000 | +0.00 分 ↓1 | 长上下文推理 |
| 25 | Z.ai: GLM 5.3 | 智谱 AI | 79.667 | +0.00 分 ↓1 | 长上下文推理 |
| 29 | inclusionAI: Ling 3.0 Flash VL | 蚂蚁集团 | 78.333 | +0.00 分 ↓1 | 长上下文推理 |
| 30 | Thinking Machines: Inkling | Thinkingmachines | 77.333 | +0.00 分 ↓1 | 长上下文推理 |
| 31 | SpaceXAI: Grok 4.7 | xAI | 76.667 | +0.00 分 ↓1 | 长上下文推理 |
| 32 | Google: Gemini 3.5 Flash Lite | 76.000 | +0.00 分 ↓1 | 长上下文推理 | |
| 33 | Thinking Machines: Inkling Small | Thinkingmachines | 75.667 | +0.00 分 ↓1 | 长上下文推理 |
| 35 | Xiaomi: MiMo-V2.6-Flash | Xiaomi | 74.333 | +0.00 分 ↓1 | 长上下文推理 |
| 36 | Upstage: Solar Pro 4 | Upstage | 74.000 | +0.00 分 ↓1 | 长上下文推理 |
| 37 | inclusionAI: Ling 3.0 Flash Fin | 蚂蚁集团 | 73.667 | +0.00 分 ↓1 | 长上下文推理 |
| 39 | Inception: Mercury 2.5 | Inception | 71.667 | +0.00 分 ↓1 | 长上下文推理 |