返回

文章详情

谷歌宣布推出Gemini 3.5 Transcribe,实现AI驱动的语音转文本

Ars Technica2026年8月26日 19:19

在我们等待(可能徒劳)Gemini 3.5 Pro发布的同时,谷歌推出了3.5系列中的另一种模型。该公司已宣布Gemini 3.5 Transcribe,这是一种旨在通过编辑掉“呃”和更正来简化语音输入的AI模型,输出经过润色的AI文本。这个模型已经为Pixel 11上的Gboard“Rambler”功能提供支持,但它即将在整个谷歌生态系统中出现。根据谷歌的说法,Gemini 3.5 Transcribe相比之前的语音转文本引擎Chirp 3速度更快,准确性更高。新的AI模型在从语音到最终转录文本的过程中应该快约70%,实时语音错误率降至5.5%。这比谷歌测量的Chirp 3的7.32%稍好一些。不过,当你使用语音输入时,修正拼写错误仍然很麻烦,所以在这里的任何改进都是有益的。新模型不仅更能听清你所说的单词;据说它也更善于理解你想要表达的核心意思。当你说话时,Gemini 3.5 Transcribe能够去除那些模糊的“呃”和“啊”,让你的思路更加清晰。如果你需要自我更正,它还可以即时编辑文本,并参考你提供的自定义词汇来处理“专业术语”。所有这些功能支持85种语言,并且可以处理最多三个讲者的预录音频。 当然,缺点是你需要依赖AI准确理解你言语的主旨。对于短文本块,该模型在清理不一致和口头失误方面表现良好(基于我对Rambler的测试),但AI确实在技术上改变了你所说的措辞,这在所有情况下可能不合适。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡