返回

文章详情

Google’s new AI transcription edits out your ‘ums’ and ‘ahs’

谷歌的新AI转录编辑掉你的‘嗯’和‘啊’

The Verge2026年8月26日 17:00

Jess Weatherbed是一名专注于创意产业、计算机和互联网文化的新闻撰稿人。Jess的职业生涯始于TechRadar,报道新闻和硬件评测。谷歌更新了Gemini Audio,推出了一些新的Gemini 3.5模型,引入了自动检测专业术语和超过85种语言的新转录功能。Gemini 3.5 Live、3.5 Live Experimental和3.5 Transcribe旨在为谷歌的语音控制AI功能提供更好的精度,能够轻松应对背景噪音或中断的讲话。Gemini 3.5 Transcribe是Gemini系列的全新加入,其推出正值我们仍在等待谷歌发布其承诺于6月推出的Gemini 3.5 Pro模型。谷歌表示,3.5 Transcribe“代表了我们之前转录模型Chirp 3的重大进步”,特别是在多语言表现和用词错误率方面。根据谷歌的说法,该转录模型允许用户“仅用声音自然编辑”,能够自动格式化文本并删除像“嗯”和“啊”这样的填充词。用户可以向该模型提供自定义词汇,使3.5 Transcribe能够自动适应独特的拼写要求和专业术语,防止这些词被手动编辑。它还可以为预录音频中的多达三名发言者分配语音,并提供逐字的时间戳。Transcribe与3.5 Live和3.5 Live Experimental同时推出,后者基于支持Gemini语音聊天模式的现有语音识别技术。Gemini 3.5 Live在处理中断发言、语言识别和实时视觉处理方面表现更好,而Gemini 3.5 Live Experimental则进一步通过在处理更复杂的任务时逐步叙述其进展来提升功能。这些Gemini Audio更新从今天开始在英语中向所有macOS Gemini应用用户推出,并在某些国家和语言的Android上推出Rambler听写功能。同时,它也通过AI Studio和Antigravity在Gemini API的公开预览中向开发者提供。谷歌表示,Chrome支持功能即将推出。关注此故事中的主题和作者,以便在个性化主页动态中查看更多类似内容,并接收电子邮件更新。Jess Weatherbed

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡