语音
语音合成自然度、语音识别准确率与单价
口径:合成:Arena Preference Elo(越高越好)· 识别:AA-WER Index(越低越好) · 合成看偏好 Elo;识别看 WER 指数(错误率,越低越好)
133 个模型 · 2 个榜 · 每榜前 10 名直接可见,第 11 名起折叠(点开即见,不是删掉)。 数据日期见各榜榜头;完整榜单原样收录,不做跨源加权。
跳到榜单: Arena Preference Elo(人类偏好) · AA-WER Index(词错误率,越低越好) (同一场景的多个榜是要横向对比的,所以用锚点跳转而不是页签把它藏起来)
Arena Preference Elo(人类偏好)
Artificial Analysis 语音合成榜
Arena Preference Elo(人类偏好)
数据日期 2026年10月9日
近 7 天
共 97 条(近 90 天发布)· 另有 0 个更早的未显示 · 最多展示前 30 条
较上一批:本榜无历史可比(整批快照,不是每天跑)
信源页面
测什么:人类盲测偏好分(语音合成) · 不代表:偏好高不等于适合你的业务音色与语种
| # | 模型(榜单原样) | 厂商 | Elo | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | Eleven v4 Turbo | — | 1329.000 | — | 语音合成(TTS) |
| 2 | Eleven v4 | — | 1326.000 | — | 语音合成(TTS) |
| 3 | Qwen-Audio-3.1-TTS-Plus | — | 1298.000 | — | 语音合成(TTS) |
| 4 | Sonic 3.6 | — | 1281.000 | — | 语音合成(TTS) |
| 5 | Gemini 3.8 Flash TTS | — | 1275.000 | — | 语音合成(TTS) |
| 6 | Qwen-Audio-3.0-TTS-Plus | — | 1267.000 | — | 语音合成(TTS) |
| 7 | Realtime TTS-2 | — | 1257.000 | — | 语音合成(TTS) |
| 8 | Simba 3.2 | — | 1244.000 | — | 语音合成(TTS) |
| 9 | Gemini 3.8 Flash-Lite TTS | — | 1243.000 | — | 语音合成(TTS) |
| 10 | Breeze TTS 2 | — | 1222.000 | — | 语音合成(TTS) |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | Elo | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 11 | Luna TTS | — | 1222.000 | — | 语音合成(TTS) |
| 12 | Realtime TTS-2 Flash | — | 1219.000 | — | 语音合成(TTS) |
| 13 | StepAudio 2.5 TTS (Aug 2026) | — | 1212.000 | — | 语音合成(TTS) |
| 14 | Gemini 3.1 Flash TTS | — | 1210.000 | — | 语音合成(TTS) |
| 15 | v3 Conversational | — | 1206.000 | — | 语音合成(TTS) |
| 16 | Sonic 3.5 | — | 1192.000 | — | 语音合成(TTS) |
| 17 | StepAudio 2.5 TTS | — | 1182.000 | — | 语音合成(TTS) |
| 18 | Soniox TTS Real-Time v2 | — | 1180.000 | — | 语音合成(TTS) |
| 19 | Eleven v3 | — | 1177.000 | — | 语音合成(TTS) |
| 20 | Speech 2.8 HD | — | 1174.000 | — | 语音合成(TTS) |
| 21 | Lightning V3.1 Pro (Jul 2026) | — | 1171.000 | — | 语音合成(TTS) |
| 22 | Gradium TTS (Sep 2026) | — | 1170.000 | — | 语音合成(TTS) |
| 23 | Falcon 2 | — | 1153.000 | — | 语音合成(TTS) |
| 24 | Gradium TTS (Aug 2026) | — | 1152.000 | — | 语音合成(TTS) |
| 25 | Speech 2.8 Turbo | — | 1152.000 | — | 语音合成(TTS) |
| 26 | Fish Audio S2.1 Pro | — | 1141.000 | — | 语音合成(TTS) |
| 27 | SpaceXAI TTS | — | 1139.000 | — | 语音合成(TTS) |
| 28 | Step TTS 2 (Mar 2026) | — | 1137.000 | — | 语音合成(TTS) |
| 29 | Async Flash v1.5 | — | 1135.000 | — | 语音合成(TTS) |
| 30 | Azure HD 2.5 | — | 1132.000 | — | 语音合成(TTS) |
AA-WER Index(词错误率,越低越好)
Artificial Analysis 语音识别榜
AA-WER Index(词错误率,越低越好)
数据日期 2026年10月9日
近 7 天
共 36 条(近 90 天发布)· 另有 0 个更早的未显示 · 最多展示前 30 条
较上一批:本榜无历史可比(整批快照,不是每天跑)
信源页面
测什么:词错误率(越低越好,语音识别) · 不代表:只在测试集上,嘈杂环境与专业术语另说
| # | 模型(榜单原样) | 厂商 | 指数(越低越好) | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 1 | StepAudio 3 ASR | StepFun | 0.017 | — | 语音识别(STT)· 错误率越低越好 |
| 2 | MAI-Transcribe-2 | Microsoft AI | 0.020 | — | 语音识别(STT)· 错误率越低越好 |
| 3 | Scribe v2 | ElevenLabs | 0.022 | — | 语音识别(STT)· 错误率越低越好 |
| 4 | Grok Voice Transcribe 2.0 | SpaceXAI | 0.023 | — | 语音识别(STT)· 错误率越低越好 |
| 5 | MAI-Transcribe-1.5 | Microsoft AI | 0.024 | — | 语音识别(STT)· 错误率越低越好 |
| 6 | Smallest AI Pulse Pro | Smallest.ai | 0.024 | — | 语音识别(STT)· 错误率越低越好 |
| 7 | Gemini 3.5 Transcribe | 0.026 | — | 语音识别(STT)· 错误率越低越好 | |
| 8 | Voxtral Small | Mistral | 0.028 | — | 语音识别(STT)· 错误率越低越好 |
| 9 | Gemini 3.1 Pro Preview (High) | 0.028 | — | 语音识别(STT)· 错误率越低越好 | |
| 10 | Gemini 3 Flash (High) | 0.029 | — | 语音识别(STT)· 错误率越低越好 |
展开其余 20 条(第 11–30 名;与上表同列,未删减)
| # | 模型(榜单原样) | 厂商 | 指数(越低越好) | 较上一批 | 备注 |
|---|---|---|---|---|---|
| 11 | Solaria-3 | Gladia | 0.032 | — | 语音识别(STT)· 错误率越低越好 |
| 12 | GPT Transcribe | OpenAI | 0.033 | — | 语音识别(STT)· 错误率越低越好 |
| 13 | Resonant-1 | Reson8 | 0.034 | — | 语音识别(STT)· 错误率越低越好 |
| 14 | Gemini 3.1 Pro Preview (Low) | 0.036 | — | 语音识别(STT)· 错误率越低越好 | |
| 15 | Voxtral Mini Transcribe 2 | Mistral | 0.036 | — | 语音识别(STT)· 错误率越低越好 |
| 16 | Soniox v5 Async | Soniox | 0.038 | — | 语音识别(STT)· 错误率越低越好 |
| 17 | Inworld STT 1 | Inworld | 0.039 | — | 语音识别(STT)· 错误率越低越好 |
| 18 | GPT-4o Transcribe | OpenAI | 0.040 | — | 语音识别(STT)· 错误率越低越好 |
| 19 | Grok Voice Transcribe 1.0 | SpaceXAI | 0.040 | — | 语音识别(STT)· 错误率越低越好 |
| 20 | Enhanced | Speechmatics | 0.040 | — | 语音识别(STT)· 错误率越低越好 |
| 21 | Whisper (L, v3), fal.ai | OpenAI | 0.041 | — | 语音识别(STT)· 错误率越低越好 |
| 22 | Amazon Transcribe | Amazon | 0.041 | — | 语音识别(STT)· 错误率越低越好 |
| 23 | Modulate STT Batch English VFast | Modulate | 0.042 | — | 语音识别(STT)· 错误率越低越好 |
| 24 | Canary Qwen 2.5B, Replicate | NVIDIA | 0.043 | — | 语音识别(STT)· 错误率越低越好 |
| 25 | Chirp 3 | 0.043 | — | 语音识别(STT)· 错误率越低越好 | |
| 26 | Smallest AI Pulse | Smallest.ai | 0.044 | — | 语音识别(STT)· 错误率越低越好 |
| 27 | GPT-4o Mini Transcribe | OpenAI | 0.045 | — | 语音识别(STT)· 错误率越低越好 |
| 28 | Whisper Large v3, together.ai | OpenAI | 0.045 | — | 语音识别(STT)· 错误率越低越好 |
| 29 | Parakeet TDT 0.6B V3, Togetherai | NVIDIA | 0.046 | — | 语音识别(STT)· 错误率越低越好 |
| 30 | Cohere Transcribe 03-2026 | Cohere | 0.046 | — | 语音识别(STT)· 错误率越低越好 |