2026 年 8 月 26 日
我们最新的语音转文本模型,专为精准、智能的实时转录而设计。
Diego Melendo Casado
Gemini Audio 工程高级总监
Luke Leonhard
Gemini Audio 负责人办公室主任,代表 Gemini Audio 团队

今天,我们推出 Gemini 3.5 Transcribe——迄今为止精准度最高的语音转文本模型,专为智能语音交互而设计。传统语音识别模型往往难以应对背景噪音、复杂术语以及口语中的不流畅表达,而 Gemini 3.5 Transcribe 能够将原始音频直接转换为准确、润色并完成格式化的文本。
在 Gemini 应用和 Android 等产品中,消费者已经通过这一转录模型受益于全新的语音功能,例如 Android 手机上的 Rambler 以及 macOS 版 Gemini 应用。现在,开发者可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform,使用 Gemini 3.5 Transcribe 构建类似的功能。
我们打造 3.5 Transcribe 的目标,是让它能够无缝融入开发者工作流,无论你是在构建语音代理、实时字幕工具,还是通话后分析流水线。该模型通过两个独立的 API 提供:
- 实时流式处理: 通过 Live API 使用
gemini-3.5-transcribe-live,为交互式语音应用提供延迟低于 1 秒的持续双向流式传输。 - 预录音频处理: 通过 Interactions API 使用
gemini-3.5-transcribe,转录录音、会议、通话记录等内容,并提供说话人归属和逐词时间戳。
更精准、更智能的转录
Gemini 3.5 Transcribe 旨在捕捉自然的说话方式,从而更好地理解用户意图并识别自定义词汇,让用户能够通过语音执行任务。
- 智能转录: 无缝处理自我纠正,例如“我们周二见——不,周三见”;删除“嗯”“啊”等填充词,并自动完成文本格式化。
- 函数调用: 模型可以通过函数调用,将复杂任务(例如图像生成和文件分析)委托给其他 Gemini 模型。目前该功能已在 Gemini macOS 应用中提供。
- 更精准的转录: 根据 Artificial Analysis 的测量结果,在流式和非流式使用场景中的平均词错误率(Word Error Rate,WER)分别达到 4.0% 和 2.6%。模型在嘈杂的真实环境中也展现出出色性能,能够准确识别邮政编码、订单号等字母数字实体。
- 自定义词汇: 能够无缝适配用户提供的自定义词汇,识别专业术语和独特拼写。
- 全球语言支持: 自动检测并转录超过 85 种语言,同时能够灵活处理地区口音和多样化方言。
- 多说话人识别: 在预录音频中准确区分说话人,并为最多三位说话人提供带时间戳的归属信息(对三位以上说话人的支持仍处于实验阶段)。
Gemini 3.5 Transcribe 的性能较此前的转录模型 Chirp 3 实现了重大提升,带来了全新能力、更低的词错误率以及显著更低的延迟。例如,根据 Artificial Analysis 的测量结果,生成最终转录结果所需的时间缩短了 70%。在涵盖多种主流语言和地区设置的 FLEURS 基准测试中,该模型展现出精准的多语言性能,相比 Chirp 3 实现提升;在流式模式和非流式使用场景中的 WER 分别达到 5.50% 和 5.04%。


体验智能转录和高级听写
除了 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform,3.5 Transcribe 还超越了标准语音转文本功能,让用户在 Google 各项服务中的工作更加自然直观。通过将上下文感知能力直接融入 Gboard、Antigravity、Gemini 应用和 Chrome 等日常使用界面,它能够轻松捕捉语言细节、用户意图以及文本中的行内编辑。
- 在 Android 版 Gboard 中,3.5 Transcribe 通过全新的 Rambler 功能,将口述想法转换为格式规范的文本,并过滤掉填充词。用户还可以通过语音进行编辑、纠正拼写错误以及更改写作风格。
- 在 Google Antigravity 中,经用户许可,3.5 Transcribe 会结合屏幕上下文和聊天记录,在文件名、代理思考过程以及当前文档等内容中实现精准转录。
- 在 Google AI Studio 中,用户可以在 Build 模式下使用 3.5 Transcribe,通过语音即时进行氛围编程(vibe coding)。
- 在 macOS 版 Gemini 应用中,3.5 Transcribe 不仅可以将自然、随意的语音转录为整洁且格式规范的文本,还支持将语音指令与屏幕上下文无缝结合,从而驱动复杂工作流。模型会在后台调用其他 Gemini 模型来处理繁重任务,让用户只需通过语音即可轻松总结本地文件、在不同应用之间改写文本,或直接在光标所在位置生成图像。
- Chrome 版本即将支持这一功能:用户可以在任意网页输入框中通过语音输入,从而轻松口述回复、撰写帖子,或以更自然便捷的方式通过语音向 Chrome 中的 Gemini 提示指令。
早期用户评价
借助 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,让开发者能够轻松构建和部署高性能的语音驱动界面。