Hugging Face 用三项测试衡量语音识别中的基准优化
Measuring benchmark optimization in speech recognition
Hugging Face 提出三项测试,评估 11 个开源语音识别模型是否针对公开基准优化,而非提升通用转写。
三项测试显示,部分模型在公开语音基准上的高分,与其识别数据集线索并复现参考文本有关,单一词错误率因此不足以代表通用转写能力。
公开的语音 AI 基准测试越来越表明,模型的表现已达到人类水平。然而,这些分数并不总能反映模型在现实世界中的工作方式。由于公开基准是开放且被广泛使用的,模型也可能针对测试本身被优化。它们的分数可能提高,是因为学会了基准特有的模式,而不是因为在底层任务上变得更好。
原因之一是,传统基准忽略了许多使语音系统可靠、自然、符合语境并在实践中有效的条件与品质。正因如此,我们最近在 Real World VoiceEQ、Open-ASR Leaderboard 和 Far-field ASR Leaderboard 中引入了留出集:以便衡量更多在实际使用中真正重要的方面。
然而,仅靠更广泛的测量并不能解决这个问题。这一现象有时被称为基准优化或“benchmaxxing”,在机器学习中常被讨论,但在语音识别中一直难以衡量。
我们的最新研究引入了三项测试来帮助量化它。我们评估了 11 个广泛使用的开源 ASR 模型,发现若干得分最高的系统会复现 VoxPopuli 英语和 LibriSpeech(clean、other)数据集中的基准转写——即使音频与之相矛盾、相关词语已被静音,或音频对两种不同书面形式的支持程度相同。
在某些情况下,模型似乎不仅依赖所说的内容,还依赖表明它们正在接受哪一项基准测试的细微声学线索。因此,它们的分数夸大了它们更普遍地转写语音的能力。
参考分歧(VoxPopuli 案例研究)
VoxPopuli 以包含大量转写错误而闻名(这也是 Artificial Analysis 发布清理版本的原因)。我们的共识分歧探针测试的是,当领先的 ASR 模型遇到这些错误时会发生什么:它们是准确转写音频所说的内容,还是复现基准中不正确的参考转写?
为了大规模测试这一点,我们使用一组因音素错误率(PER)较低而被选出的独立模型集成。PER 衡量书面转写与音频中声音的接近程度,因此可作为模型忠实转写其所听内容的有用代理。集成结果可用于标记各模型一致不同意基准参考转写的情况。随后,我们将这些被标记情况的一个样本与人工标注进行比对,以验证修正后的转写。
例如,一段 VoxPopuli 片段中可以清楚听到短语“Thank you, Mr. President,”,但参考转写省略了“Thank you.”。在我们测试的 11 个模型中,有 6 个复现了基准的错误转写——即便它与音频相矛盾,仍给出了“预期”答案。在真实片段中,格式也遵循同样的模式:省略“Thank you”的模型还会复现基准的标点风格,把“Mr”写成不带句点;而包含这段可听短语的模型则倾向于写成带句点的“Mr.”。
当我们用新采集的欧盟议会录音声音或通用声音呈现相同内容时,这种行为往往会减弱或消失。在下面的样本中,除一个模型外,其余模型都会转而为一份新议会录音的克隆生成忠实于音频的转写。这表明,模型响应的是有助于它们识别基准成员身份的声学线索,因而会生成预期的转写文本,即使该文本与音频相矛盾。
该片段的参考转写文本为"Mr President, I have another complaint about this procedure, which is that it is not secret."下面三个片段的音频实际上说的是同一句话,前面都有可听见的"Thank you,"——这些克隆是该真实句子的文本转语音呈现,因此三段中都能听到这句客套话。绿色高亮和 ✅ 标记包含可听见的"Thank you"的转写;红色高亮和 ❌ 标记复现基准测试错误遗漏的转写。所有转写均为模型原始输出,未经任何规范化——大小写和标点均按生成结果原样保留,包括部分模型的全小写输出。
原始 VoxPopuli 录音
同一说话人的声音克隆
在所有模型训练截止日期之后录制的议会发言人克隆
| 模型 | 真实片段 | 同一说话人克隆 | ep-fresh 克隆 |
|---|---|---|---|
| CohereLabs/cohere-transcribe-03-2026 | ❌ Mr President… | ❌ Mr President… | ✅ Thank you, Mr President… |
| nvidia/canary-qwen-2.5b | ❌ Mr President… | ❌ Mr President… | ✅ Thank you Mr. President… |
| ibm-granite/granite-speech-4.1-2b | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| microsoft/Phi-4-multimodal-instruct | ❌ Mr President… | ❌ Mr President… | ❌ Mr President… |
| nvidia/parakeet-tdt-0.6b-v2 | ❌ Mr President… | ✅ Thank you, Mr President… | ✅ Thank you, Mr. President… |
| bosonai/higgs-audio-v3-8b-stt-v2 | ❌ mr president… | ❌ mr president… | ✅ thank you mr president… |
| Qwen/Qwen3-ASR-0.6B-hf | ✅ Thank you, Mr. President… | ✅ Thank you, Mister President… | ✅ Thank you, Mister President… |
| mistralai/Voxtral-Mini-3B-2507 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| moonshotai/Kimi-Audio-7B-Instruct | ✅ Thank you, mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, mr. President… |
| openai/whisper-large-v3 | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… | ✅ Thank you, Mr. President… |
| moonshine-ai/moonshine-streaming-medium | ✅ thank you mr president… | ✅ thank you mr president… | ✅ thank you mr president… |
| 11 个中丢掉客套话(❌) | 6 | 5 | 1 |
Parakeet 是唯一在真实片段上复现基准结果、而在同一说话人克隆上转写正确的模型。Phi-4 是唯一仍在 ep-fresh 克隆上丢掉客套话的模型。当我们改用与任何议会录音都无关的通用 TTS 声音重新合成该句子时,全部十一个模型都恢复了这句客套话。
结果表明,这一问题既普遍又有实际意义。我们的方法在所分析的 VoxPopuli 测试片段中,有 40% 被标出潜在的参考文本错误,大约影响了全部参考词的 3%。
表现出基准优化行为的模型在 18–30% 的情况下会复现错误的参考转写。下方散点图将横轴上的 VoxPopuli 词错误率(WER)与每个模型复现该基准错误参考文本、而非共识修正的比率进行比较。WER 最低、因而所报告基准表现最强的模型,也最有可能复现这些错误。
掩码实体检索
为了在共识分歧探测的基础上更进一步,我们故意将测试数据集音频样本中的数字静音,并要求模型转写它所听到的内容。该数字实际上并不存在于音频中,因此模型不应输出任何数字,更不应输出文本中的那个确切数字。
其中一些数字是半可预测的(尽管模型仍不太可能预测出来),另一些则相当出人意料。下面这一片段结合了两种探测,既展示模型如何复现参考转写错误(包括一个错误数字),也展示有一个模型甚至在年份被静音的情况下仍自动补全了一个相对随机的年份(2011)。在下方每个模型对应的行中:
- 带删除线的绿色高亮标出模型正确地没有复现的参考转写词(忠实于音频);
- 带下划线的绿色高亮标出一处正确且忠实于音频的插入,用以替换参考文本中的错误措辞;
- 红色高亮(纯文本)复现了参考转写中错误且音频不支持的内容:保留“主席先生”,在音频说的是“一千六百”的地方写成“超过 1 项修正案”,补上被静音的年份“2011”,或以“全体会议”结尾。
2011 预算草案(数字已掩码)
| 参考 | 主席先生,在预算委员会,我们表决了超过1项对2011预算草案的修正案……在全体会议中表决。 |
|---|---|
| 音频所说 | 在预算委员会,我们表决了超过一千六百项对⟨silenced⟩预算草案的修正案……在……中表决。 |
| CohereLabs/cohere-transcribe-03-2026 | 主席先生,在预算委员会我们表决了超过1项对2011预算草案的修正案……在全体会议中表决。 |
| nvidia/canary-qwen-2.5b | 主席先生,在预算委员会我们表决了超过一项对 |
| ibm-granite/granite-speech-4.1-2b | |
| microsoft/Phi-4-multimodal-instruct | |
| nvidia/parakeet-tdt-0.6b-v2 | |
| bosonai/higgs-audio-v3-8b-stt-v2 | |
| Qwen/Qwen3-ASR-0.6B-hf | |
| mistralai/Voxtral-Mini-3B-2507 | |
| moonshotai/Kimi-Audio-7B-Instruct | |
| openai/whisper-large-v3 | |
| moonshine-ai/moonshine-streaming-medium |
恢复率在公开基准上最高,在留出或新采集的音频上较低(下文的 ep-fresh 和 libri-fresh)。在 LibriSpeech 上,一些基准表现最强的模型在大约 30–40% 的样本中复原了被遮盖的数字,尽管数字本身已被移除。对若干模型而言,这一效应在新采集的数据上有所减弱,表明周围与基准相关的音频——而不仅仅是文本自动补全——帮助这些模型恢复了参考文本。
正字法切换
我们的正字法切换探针测试模型是否会复现基准参考转写中使用的确切拼写,尽管音频中并不明确。正字变体是语义和语音相同、但可以有不同拼法的词(1 vs one、Mr. vs mister、John vs Jon、Honor vs Honour 等)。理论上,模型应始终偏好某一种拼写,或以大致随机的比率在它们之间交替。如果模型系统性地切换以匹配每个基准参考转写中的拼写,则表明模型在捕捉测试所期望的拼写。
转写:“I URGED ON THE BOYS THAT WHATEVER HAPPENED WE SHOULD NOT SHOOT ANY ONE”——使用“any one”的模型:6/11,使用“anyone”的模型:5/11
转写:“CAMOUFLAGE WAS NOT A WORD THE CAPTAIN OR ANYONE ELSE OF HIS TIME YET UNDERSTOOD”——使用“any one”的模型:2/11,使用“anyone”的模型:9/11
在 LibriSpeech 中,我们测试了一种涉及较旧空格惯例的数据集内切换:一些参考转写使用 "any one",而另一些使用 "anyone."。我们衡量给定变体的最低准确率,称之为 "switch rate"。如果模型只使用一种变体,其切换率将为 0%;随机选择的模型预期切换率为 50%。若模型知道在每个测试样本中应使用哪种变体,则可获得 100% 的切换率。
我们的第二项探针测试一种数据集间切换,其中每个基准在其整个测试语料中始终使用各自不同的拼写惯例。例如,VoxPopuli 使用缩写 "Mr.,",而 LibriSpeech 则完整拼出 "Mister."。
多个模型超过了 50% 的随机选择基线,有些达到约 90% 的切换准确率。这表明模型能够识别音频样本来自哪个数据集,并选择该基准所期望的拼写惯例,尽管两种形式听起来完全相同。
定位这些切换
为检验这些行为是否能泛化到公开基准之外,我们还收集了来自相同来源领域、但处于模型训练截止日期之后的新数据:供 VoxPopuli 使用的近期欧洲议会录音,以及供 LibriSpeech 使用的新近活跃 LibriVox 朗读者的录音。然而,当呈现来自同一领域的近期收集数据时,许多模型不再匹配参考转写,而是回归到更忠实于音频的转写。
其他干预也指向同一结论。音频中存在、但在参考转写中被省略的短语,会在要求模型翻译该音频、或将其注意力限制在相关帧上时重新出现。去掉周围的基准上下文,或追加普通的对话音频,也可以恢复忠实的转写。追加 VoxPopuli 音频则可能产生相反的效果,使原本忠实的合成或挖掘样本更有可能与基准参考相匹配。
综合来看,这些结果表明模型能够忠实地转写实际说出的字面词语,但会利用周围的声学上下文来决定是遵循音频,还是遵循特定于基准的转写策略。
结论
我们的发现表明,在两个主要开源数据集上,一些模型会检测与数据集相关联的声学线索,并相应调整其转写行为。具体来说,模型可能会复现音频中没有、但参考转写中存在的词语,以更高比率恢复被静音的数字,或利用周围声学上下文来选择特定基准所期望的书面变体。
对于选择模型的人来说,这些发现凸显了使用完全留出的评估集的重要性,正如 RW-Voice-EQ Bench 和 Open ASR Leaderboard 所做的那样,同时也凸显了不应只看单一公开基准上的词错误率。为此,Open ASR Leaderboard 新增了一个 "Benchmark fitting" 标签页,其中包含上述两项覆盖所有模型的分析:量化 (1) 来自 VoxPopuli 的参考错误率,以及 (2) 所有公开数据集上的正字法切换。相关脚本已在 GitHub 上开源,未归一化的模型输出 亦是如此。
我们的研究结果还表明,基准开发者应避免简单的独立同分布测试划分,转而采用基于时间、说话人或其他元数据的分离方式。提高训练数据和模型选择流程的透明度,也有助于研究人员理解这些行为是如何产生的。
公开基准仍然有价值:它们透明、可重复、易于运行,并且为研究界所熟知。但只有当我们能够区分真正的转写改进与无法泛化到新音频的基准特定收益时,它们才最为有用。
如需了解更多信息,我们建议您阅读我们的完整报告。
来源:Hugging Face Blog · huggingface.co