双子座 3.5 转录
2026年8月26日 | 我们最新的语音转文本模型,旨在实现精确和智能的实时转录。Diego Melendo Casado,工程高级总监,Gemini Audio;Luke Leonhard,Gemini Audio的首席工作人员,代表Gemini Audio团队。 您的浏览器不支持音频元素。收听文章 [[duration]] 分钟 本内容由Google AI生成。生成式AI仍在实验中。今天,我们推出了Gemini 3.5转录,这是我们迄今为止最精确的语音转文本模型,旨在实现智能语音交互。与传统的语音识别模型在背景噪音、复杂术语和不流利性处理上存在困难不同,Gemini 3.5转录可以直接将原始音频转换为准确、完善、格式化的文本。在我们的产品,如Gemini应用程序和Android上,消费者已经受益于此转录模型的新语音功能,例如Android上的Rambler和macOS上的Gemini应用程序。现在,开发人员可以利用Google AI Studio和Gemini企业代理平台中的Gemini API与Gemini 3.5转录构建类似的功能。我们构建的3.5转录可以无缝地融入您的开发者工作流程中,无论您是在构建语音代理、实时字幕工具,还是通话后分析管道。该模型可通过两个独立的API获得: 实时流:通过Live API,使用gemini-3.5-transcribe-live为交互式语音应用提供连续的双向流媒体,延迟小于一秒。 预录音频处理:通过Interactions API,使用gemini-3.5-transcribe转录录音、会议、通话记录等,并具有发言者归属和单词级时间戳。 获得更精确和智能的转录。 Gemini 3.5转录旨在捕捉您的自然说话风格,以更好地理解您的意图并识别自定义词汇,从而使您能够用声音执行任务。 智能转录:无缝处理自我更正(如“我们周二见——不,周三”),移除填充词(“嗯”和“啊”),自动格式化文本。 函数调用:该模型能够通过函数调用将复杂任务(例如图像生成和文件分析)委托给其他Gemini模型。目前在Gemini macOS应用程序中可用。 更精确的转录:根据人工分析测量,流媒体平均单词错误率(WER)为4.0%,非流媒体使用案例为2.6%。它在嘈杂的现实环境中表现出色,准确捕捉字母数字实体,如邮政编码和订单ID。 自定义词汇:通过无缝调整转录以适应您提供的自定义词汇,识别专业术语和独特拼写。 全球语言支持:自动检测并转录超过85种语言,轻松处理地区口音和多种方言。 多发言人识别:在预录音频中准确定义发言,在最多三个发言者(支持3个以上的发言者为实验性)中提供时间戳。 Gemini 3.5转录的性能代表了我们之前的转录模型Chirp 3的重大进步,提供了新功能、改善的单词错误率和显著更好的延迟。例如,根据人工分析的测量,最终转录所需的时间提高了70%。在FLEURS基准测试中,该模型在一组主要语言和地区中提供了精确的多语言性能,提升了Chirp 3的表现,流媒体模式中的WER为5.50%,非流媒体使用案例中的WER为5.04%。 体验智能转录和先进的听写。 除了Google AI Studio和Gemini企业代理平台中的Gemini API,3.5转录使跨Google工作的体验更自然、直观。通过将上下文感知理解直接带入Gboard、Antigravity、Gemini应用程序和Chrome等日常界面,它轻松捕捉细微之处、意图和行内编辑。在Android上的Gboard,通过新功能Rambler,3.5转录将口语转换为格式良好的文本,过滤掉填充词。您还可以使用声音进行编辑,更正拼写错误,修改写作风格。在Google Antigravity上,3.5转录结合屏幕上下文和聊天历史(在您的许可下),确保跨文件名、代理想法和活动文档的准确转录。在Google AI Studio中,您可以在构建模式中访问3.5转录,实时用您的声音为应用程序编写代码。在macOS上的Gemini应用程序中,3.5转录不仅将您的自由自然语言转录为干净的格式化文本,还启用了可以与屏幕上下文无缝配合的语音命令,以推动复杂的工作流程。通过在后台调用其他Gemini模型进行繁重的工作,该模型使得总结本地文件、跨应用程序重新利用文本或即时生成图像变得轻松。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡