公共语音 AI 基准测试越来越显示,模型的表现已达到人类水平。然而,这些分数并不总能反映模型在现实世界中的工作方式。由于公开基准测试开放且应用广泛,模型也可能逐渐针对测试本身进行优化。它们的分数提升,可能是因为学会了特定于基准测试的模式,而不是因为底层任务能力真正增强。
其中一个原因是,传统基准测试忽略了许多决定语音系统在实践中是否可靠、自然、符合语境且有效的条件和特性。因此,我们最近在 Real World VoiceEQ、Open-ASR Leaderboard 和 Far-field ASR Leaderboard 中引入了保留测试集(held-out sets),以衡量更多现实世界应用中真正重要的因素。
然而,仅仅扩大测量范围并不能解决这一问题。这种现象有时被称为基准测试优化(benchmark optimization)或“刷榜”(benchmaxxing),在机器学习领域经常被讨论,但在语音识别领域却一直难以量化。
我们最新的研究引入了三项测试,帮助量化这一现象。我们评估了 11 个广泛使用的开源自动语音识别(ASR)模型,发现其中一些得分最高的系统复现了 VoxPopuli 英语数据集和 LibriSpeech(clean、other)数据集中的基准转写结果——即使音频内容与转写相矛盾、相关词语被静音,或者音频同样支持两种不同的书面表达形式。
在某些情况下,模型似乎不仅依赖语音内容,还依赖细微的声学线索来判断自己正在接受哪个基准测试。因此,它们的得分夸大了自身在更广泛语音转写任务上的能力。
参考转写不一致(VoxPopuli 案例研究)
众所周知,VoxPopuli 包含大量转写错误(这也是 Artificial Analysis 发布清理版本的原因)。我们的共识不一致探测测试了领先 ASR 模型遇到这些错误时的表现:它们会准确转写音频中的内容,还是会复现基准测试中错误的参考转写?
为了大规模开展测试,我们使用了一个由多个独立模型组成的集成模型,这些模型根据较低的音素错误率(PER)进行筛选。PER 衡量书面转写与音频中语音之间的匹配程度,因此可以作为模型是否忠实转写所听内容的有效代理指标。集成结果可以帮助我们标记模型一致不同于基准参考转写的案例。随后,我们将其中一部分标记案例与人工标注结果进行比较,以验证修正后的转写。
例如,一段 VoxPopuli 音频中清晰地包含“Thank you, Mr. President”这一短语,但参考转写省略了“Thank you”。在我们测试的 11 个模型中,有 6 个复现了基准测试中的错误转写——尽管这一答案与音频内容相矛盾,它们仍给出了“预期”答案。在这段真实音频中,格式也遵循相同模式:省略“Thank you”的模型同样复现了基准测试的标点风格,将“Mr”写成不带句点的形式;而包含该可听短语的模型通常会写成带句点的“Mr.”。
当我们使用从欧盟议会录音中新采集的声音,或使用通用声音呈现相同内容时,这种行为往往会减弱或消失。在下面的样例中,除一个模型外,所有模型在一段新议会录音的克隆音频上都恢复为忠实于音频的转写。这表明,模型可能在响应有助于识别基准测试归属的声学线索,从而生成预期的转写,即使该转写与音频内容相矛盾。
这段音频的参考转写为:“Mr President, I have another complaint about this procedure, which is that it is not secret.”但下面三段音频实际上说的是同样的内容,只是在开头都加上了一个清晰可听的“Thank you,”——这些克隆音频是对这句真实话语的文本转语音(TTS)演绎,因此三段音频中都能听到这句致意。绿色高亮和 ✅ 表示转写包含了可听到的“Thank you”;红色高亮和 ❌ 表示转写复现了基准测试中错误省略该短语的结果。所有转写均为模型未经任何规范化处理的原始输出——大小写和标点完全按照模型生成的形式保留,包括部分模型输出的小写文本。
原始 VoxPopuli 录音
同一说话人的声音克隆
在所有模型训练截止日期之后录制的议员发言人克隆音频
| 模型 | 真实音频 | 同一说话人克隆音频 | ep-fresh 克隆音频 |
|---|---|---|---|
| CohereLabs/cohere-transcribe-03-2026 | ❌ Mr President… | ❌ Mr President… | ✅ Thank you, Mr President… |
| nvidia/canary-qwen-2.5b | ❌ Mr President… | ❌ Mr President… | ✅ Thank you Mr. President… |
| ibm-granite/granite-speech-4.1-2b | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| microsoft/Phi-4-multimodal-instruct | ❌ Mr President… | ❌ Mr President… | ❌ Mr President… |
| nvidia/parakeet-tdt-0.6b-v2 | ❌ Mr President… | ✅ Thank you, Mr President… | ✅ Thank you, Mr. President… |
| bosonai/higgs-audio-v3-8b-stt-v2 | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| Qwen/Qwen3-ASR-0.6B-hf | ✅ Thank you, Mr. President… | ✅ Thank you, Mister President… | ✅ Thank you, Mister President… |
| mistralai/Voxtral-Mini-3B-2507 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| moonshotai/Kimi-Audio-7B-Instruct | ✅ Thank you, mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, mr. President… |
| openai/whisper-large-v3 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| moonshine-ai/moonshine-streaming-medium | ✅ thank you mr president… | ✅ thank you mr president… | ✅ thank you mr president… |
| 11 个模型中省略致意语(❌)的数量 | 6 | 5 | 1 |
Parakeet 是唯一一个在真实音频上复现基准测试结果、而在同一说话人的克隆音频上正确转写的模型。Phi-4 是唯一一个在 ep-fresh 克隆音频上仍然省略致意语的模型。当我们改用与任何议会录音都无关的通用 TTS 声音重新合成这句话时,11 个模型全部……