
Meta的新AI转录模型能够实时区分多位讲者和多种语言
这是Meta超级智能实验室(MSI)的最新发布。Meta推出了其首款实时音频模型Muse Voice Transcribe。该模型能够处理20多位讲者的听写和转录,并且可以同时无缝处理多种语言。Meta首席执行官马克·扎克伯格(Mark Zuckerberg)在三年未在社交平台X上发布后最近回归,他分享了该模型同时处理多位讲者和多种语言的能力示例。在视频中,转录能够自动区分多位讲者并在语言之间切换。它甚至能够捕捉到“代码切换”,并转录使用多种语言单词的句子。Muse Voice Transcribe是MSL的首个实时音频感知模型——今天正式推出。作为在流式语音转文本领域的先进技术,它在单一模型中原生处理讲者识别和端点识别。预告片中,扎克伯格解释:“该模型决定何时倾听。它对难结的单词稍微多等待一下,而对简单的单词更快地做出反应,利用自适应延迟来预测每个字符并提高准确性。”他说:“它也能应对混乱的真实音频——经过70多种语言的训练(在启动时验证了25种),处理中间句子中的代码切换,并管理20多位讲者的长达一个小时的会话。”Meta的发布距谷歌Gemini 3.5 Transcribe的发布不到一周,该模型也具备类似的功能。但虽然谷歌正在将其音频模型集成到Android和(最终)Chrome中,尚不清楚Meta是否计划将Muse Voice Transcribe集成到其旗舰服务中。不过,目前人们可以体验到新模型在Meta最近发布的Meta AI Mac应用中的功能。由于Mac应用能够为其他应用提供语音启用的功能,Muse Voice Transcribe将为其他服务提供听写功能。该模型还可供开发者在Muse Code和Meta的模型API中使用,定价为每1000分钟音频3美元。此外,Meta的研究博客上还有Muse Transcribe的演示版本。Muse Voice Transcribe是Meta超级智能实验室(MSI)的最新发布,该实验室一直在不断推出新的AI模型和工具。在过去的几周中,该公司还推出了其首个专用编码代理、一个开放权重模型以及上述Meta AI Mac应用。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡