コンテンツにスキップ
メインサイト ニュース コンソール

音声認識におけるベンチマーク最適化の評価

· Hugging Face 翻訳済
教程模型卡

公開音声 AI ベンチマークでは、モデルの性能が人間の水準に達していることが、ますます示されるようになっています。しかし、こうしたスコアが、モデルが現実世界でどのように動作するかを必ずしも反映しているとは限りません。公開ベンチマークはオープンで広く利用されているため、モデルがテストそのものに対して徐々に最適化される可能性もあります。スコアが向上していても、それは基盤となるタスク能力が本当に向上したからではなく、ベンチマーク固有のパターンを学習した結果かもしれません。

その理由の一つは、従来のベンチマークが、音声システムの信頼性、自然さ、文脈適合性、実用性を左右する多くの条件や特性を見落としていることです。そこで私たちは最近、Real World VoiceEQ、Open-ASR Leaderboard、Far-field ASR Leaderboard に保持テストセット(held-out sets)を導入し、現実世界のより幅広い用途で本当に重要となる要素を測定できるようにしました。

しかし、測定範囲を広げるだけでは、この問題は解決できません。この現象は、ベンチマーク最適化(benchmark optimization)や「ベンチマックス」(benchmaxxing)と呼ばれることがあり、機械学習分野ではたびたび議論されていますが、音声認識の分野ではこれまで定量化が困難でした。

今回の最新研究では、この現象の定量化に役立つ3つのテストを導入しました。広く利用されているオープンソースの自動音声認識(ASR)モデル11種類を評価したところ、その一部の高スコアなシステムは、音声の内容と文字起こしが矛盾している場合、該当する単語がミュートされている場合、あるいは音声が2種類の異なる書き言葉の表現を同じ程度に支持している場合でさえ、VoxPopuli の英語データセットや LibriSpeech(clean、other)データセットに含まれるベンチマークの正解文字起こしを再現していることが分かりました。

場合によっては、モデルは音声の内容だけでなく、どのベンチマークで評価されているかを判断するための微細な音響的手がかりにも依存しているようです。その結果、より広範な音声文字起こしタスクにおける能力が、スコアによって過大に評価されている可能性があります。

正解文字起こしとの不一致(VoxPopuli ケーススタディ)

VoxPopuli には多数の文字起こしミスが含まれていることが知られています(これが Artificial Analysis がクリーニング済みバージョンを公開した理由でもあります)。私たちのコンセンサス不一致検出テストでは、主要な ASR モデルがこうした誤りに遭遇した際の挙動を検証しました。モデルは音声に含まれる内容を正確に文字起こしするのでしょうか。それとも、ベンチマークに含まれる誤った正解文字起こしを再現するのでしょうか。

大規模なテストを行うため、複数の独立したモデルからなるアンサンブルを使用しました。これらのモデルは、音素誤り率(PER)が低いものを基準に選別されています。PER は、書き起こされたテキストと音声内の発話との一致度を測定する指標であるため、モデルが聞こえた内容を忠実に文字起こししているかどうかを示す有効な代理指標として利用できます。アンサンブルの結果は、モデルがベンチマークの正解文字起こしと一貫して異なるケースを特定するのに役立ちます。その後、特定されたケースの一部を人手によるアノテーション結果と比較し、修正後の文字起こしを検証しました。

たとえば、ある VoxPopuli の音声には「Thank you, Mr. President」というフレーズが明瞭に含まれていますが、正解文字起こしでは「Thank you」が省略されています。今回テストした11モデルのうち6モデルは、ベンチマークの誤った文字起こしを再現しました。音声の内容と矛盾しているにもかかわらず、「期待される」答えを出力したのです。この実音声では、形式も同じパターンに従っています。「Thank you」を省略したモデルは、ベンチマークと同じ句読点のスタイルも再現し、「Mr」をピリオドなしで表記しました。一方、この聞き取れるフレーズを含めたモデルは、通常「Mr.」のようにピリオド付きで表記しました。

EU 議会の録音から新たに収録した音声を使用した場合や、同じ内容を一般的な音声で再現した場合には、この挙動は弱まるか、消失することが多くなります。以下の例では、1モデルを除くすべてのモデルが、新しい議会録音のクローン音声に対して、音声に忠実な文字起こしへと戻りました。このことは、モデルがベンチマークの出所を識別するのに役立つ音響的手がかりに反応し、それによって、音声の内容と矛盾していても期待される文字起こしを生成している可能性を示しています。

この音声の正解文字起こしは「Mr President, I have another complaint about this procedure, which is that it is not secret.」です。しかし、以下の3つの音声は実際には同じ内容を話しており、冒頭に明瞭に聞こえる「Thank you,」が追加されているだけです。これらのクローン音声は、この実際の発話をテキスト音声合成(TTS)で再現したものであるため、3つすべての音声でこの挨拶を聞き取ることができます。緑色のハイライトと ✅ は、文字起こしに聞こえる「Thank you」が含まれていることを示します。赤色のハイライトと ❌ は、ベンチマークで誤ってこのフレーズを省略した結果を再現していることを示します。すべての文字起こしは、モデルに対して正規化処理を行っていない生の出力です。大文字・小文字と句読点は、モデルが生成した形式のまま完全に保持しており、一部のモデルが出力した小文字のテキストもそのまま掲載しています。

元の VoxPopuli 録音

同じ話者の音声クローン

すべてのモデルの学習カットオフ日以降に録音された議員発言者のクローン音声

モデル実音声同じ話者のクローン音声ep-fresh クローン音声
CohereLabs/cohere-transcribe-03-2026❌ Mr President…❌ Mr President…✅ Thank you, Mr President…
nvidia/canary-qwen-2.5b❌ Mr President…❌ Mr President…✅ Thank you Mr. President…
ibm-granite/granite-speech-4.1-2b❌ mr president…❌ mr president…✅ thank you mr president…
microsoft/Phi-4-multimodal-instruct❌ Mr President…❌ Mr President…❌ Mr President…
nvidia/parakeet-tdt-0.6b-v2❌ Mr President…✅ Thank you, Mr President…✅ Thank you, Mr. President…
bosonai/higgs-audio-v3-8b-stt-v2❌ mr president…❌ mr president…✅ thank you mr president…
Qwen/Qwen3-ASR-0.6B-hf✅ Thank you, Mr. President…✅ Thank you, Mister President…✅ Thank you, Mister President…
mistralai/Voxtral-Mini-3B-2507✅ Thank you, Mr. President…✅ Thank you, Mr. President…✅ Thank you, Mr. President…
moonshotai/Kimi-Audio-7B-Instruct✅ Thank you, mr. President…✅ Thank you, Mr. President…✅ Thank you, mr. President…
openai/whisper-large-v3✅ Thank you, Mr. President…✅ Thank you, Mr. President…✅ Thank you, Mr. President…
moonshine-ai/moonshine-streaming-medium✅ thank you mr president…✅ thank you mr president…✅ thank you mr president…
挨拶を省略した(❌)モデル数(11モデル中)651

Parakeet は、実音声ではベンチマーク結果を再現した一方、同じ話者のクローン音声では正しく文字起こしした唯一のモデルです。Phi-4 は、ep-fresh クローン音声でも挨拶を省略した唯一のモデルでした。議会の録音とは無関係な一般的な TTS 音声を使ってこの発話を再合成したところ、11モデルすべてが……