コンテンツにスキップ
メインサイト ニュース コンソール

Gemini 3.5 Transcribe スマート文字起こし

· DeepMind 翻訳済
DeepMind

2026 年 8 月 26 日

最新の音声テキスト変換モデル。高精度でインテリジェントなリアルタイム文字起こしを実現するために設計されています。

Diego Melendo Casado
Gemini Audio エンジニアリング担当シニアディレクター

Luke Leonhard
Gemini Audio 責任者室長、Gemini Audio チーム代表

本日、Gemini 3.5 Transcribe を発表します。これまでで最も高精度な音声テキスト変換モデルであり、インテリジェントな音声インタラクションのために設計されています。従来の音声認識モデルは、背景ノイズや複雑な専門用語、話し言葉に含まれる言いよどみなどへの対応を苦手としていました。一方、Gemini 3.5 Transcribe は、元の音声を正確かつ読みやすく、適切にフォーマットされたテキストへ直接変換できます。

Gemini アプリや Android などの製品では、すでにこの文字起こしモデルを活用した新しい音声機能を利用できます。たとえば、Android スマートフォンの Rambler や macOS 版 Gemini アプリなどです。今回、開発者は Google AI Studio の Gemini API と Gemini Enterprise Agent Platform を通じて、Gemini 3.5 Transcribe を使った同様の機能を構築できるようになりました。

3.5 Transcribe は、音声エージェント、リアルタイム字幕ツール、通話後の分析パイプラインなど、どのようなものを構築する場合でも、開発者のワークフローにシームレスに組み込めることを目指して開発されました。このモデルは、2 つの独立した API を通じて提供されます。

  • リアルタイムストリーミング処理: Live API で gemini-3.5-transcribe-live を使用すると、インタラクティブな音声アプリケーション向けに、1 秒未満の低遅延で継続的な双方向ストリーミングを実現できます。
  • 録音済み音声の処理: Interactions API で gemini-3.5-transcribe を使用すると、録音、会議、通話記録などを文字起こしでき、話者の識別情報や単語単位のタイムスタンプも取得できます。

より高精度でインテリジェントな文字起こし

Gemini 3.5 Transcribe は、自然な話し方を捉えることで、ユーザーの意図をより正確に理解し、カスタム語彙も認識できるよう設計されています。これにより、ユーザーは音声でタスクを実行できます。

  • インテリジェントな文字起こし: 「火曜日に会いましょう——いや、水曜日に会いましょう」のような言い直しをシームレスに処理し、「えー」「あのー」などのフィラーを削除して、テキストを自動的にフォーマットします。
  • 関数呼び出し: 関数呼び出しを利用して、画像生成やファイル分析などの複雑なタスクを他の Gemini モデルに委任できます。現在、この機能は Gemini macOS アプリで提供されています。
  • より高精度な文字起こし: Artificial Analysis の測定によると、ストリーミングおよび非ストリーミングのユースケースにおける平均単語誤り率(Word Error Rate、WER)は、それぞれ 4.0% と 2.6% です。ノイズの多い現実の環境でも優れた性能を発揮し、郵便番号や注文番号などの英数字エンティティも正確に認識できます。
  • カスタム語彙: ユーザーが指定したカスタム語彙にシームレスに適応し、専門用語や独自のスペルを認識できます。
  • グローバルな言語サポート: 85 を超える言語を自動的に検出して文字起こしでき、地域ごとのアクセントや多様な方言にも柔軟に対応します。
  • 複数話者の識別: 録音済み音声に含まれる話者を正確に区別し、最大 3 人の話者について、タイムスタンプ付きの話者情報を提供します(4 人以上の話者への対応は現在も試験段階です)。

Gemini 3.5 Transcribe は、従来の文字起こしモデルである Chirp 3 と比べて大幅に性能が向上しており、新しい機能、より低い単語誤り率、そして大幅に短縮された遅延を実現しています。たとえば、Artificial Analysis の測定によると、最終的な文字起こし結果の生成にかかる時間は 70% 短縮されました。主要な言語と地域設定を幅広く含む FLEURS ベンチマークでは、多言語において高い精度を示し、Chirp 3 を上回る性能を実現しています。ストリーミングおよび非ストリーミングのユースケースにおける WER は、それぞれ 5.50% と 5.04% でした。

インテリジェントな文字起こしと高度なディクテーションを体験

Google AI Studio の Gemini API と Gemini Enterprise Agent Platform に加えて、3.5 Transcribe は標準的な音声テキスト変換の機能を超え、Google の各種サービスでの作業をより自然で直感的なものにします。Gboard、Antigravity、Gemini アプリ、Chrome など、日常的に利用するインターフェースにコンテキスト認識機能を直接組み込むことで、言葉の細かなニュアンスやユーザーの意図、テキスト内でのインライン編集を簡単に捉えられます。

  • Android 版 Gboard では、3.5 Transcribe が新しい Rambler 機能を通じて、話したアイデアを適切にフォーマットされたテキストへ変換し、フィラーを除去します。音声で編集したり、スペルミスを修正したり、文章のスタイルを変更したりすることもできます。
  • Google Antigravity では、ユーザーの許可を得たうえで、3.5 Transcribe が画面のコンテキストやチャット履歴と組み合わせて、ファイル名、エージェントの思考プロセス、現在のドキュメントなどを正確に文字起こしします。
  • Google AI Studio では、Build モードで 3.5 Transcribe を使用し、音声ですぐにバイブコーディング(vibe coding)を行えます。
  • macOS 版 Gemini アプリでは、3.5 Transcribe によって自然でくだけた音声を、整った読みやすいテキストに変換できます。さらに、音声による指示と画面のコンテキストをシームレスに組み合わせ、複雑なワークフローを実行できます。モデルはバックグラウンドで他の Gemini モデルを呼び出して複雑なタスクを処理するため、ユーザーは音声だけでローカルファイルを要約したり、複数のアプリ間でテキストを書き換えたり、カーソルの位置に画像を生成したりできます。
  • Chrome 版でも近日中にこの機能を利用できるようになります。ユーザーは任意のウェブページの入力欄に音声で入力できるため、返信を口述したり、投稿を作成したり、より自然かつ便利な方法で Chrome の Gemini に指示を出したりできます。

初期ユーザーからの評価

Gemini Live API を活用することで、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents などの開発者向けプラットフォームでは、高性能な音声駆動インターフェースを簡単に構築・デプロイできるようになっています。