返回

文章详情

ElevenLabs的最新v4语音模型支持更多的表达控制和90种语言

TechCrunch2026年9月28日 14:00

ElevenLabs在周一推出了两个新的语音模型,叫做ElevenLabs v4和v4 Turbo,提供更多的表达控制、更低的语音代理延迟,以及对90多种语言的支持。该公司去年发布了v3模型,并在今年早些时候的一次活动中在华沙展示了该模型。在v4系列模型中,ElevenLabs采用了一种新的架构,使得控制更好,克隆速度更快。该公司表示,通过v4,用户只需10秒的音频即可克隆一个声音。在创意方面,该模型在处理较长文本时更好地保持声音身份。同时,在朗读时,它还会牢记文本的上下文,以改变表达。ElevenLabs在v3中引入了内联标签来定义表达,并在v4中扩展了这些标签,允许用户堆叠多个标签并让模型遵循顺序。前一版本支持70种语言,而ElevenLabs努力将这一数字提高到90种语言。该初创公司表示,它观察到了日语、巴西葡萄牙语、普通话和粤语的质量跃升最大。ElevenLabs在过去一年快速扩展了其企业呼叫业务,超过55%的业务来自大型公司。该公司表示,新模型适合语音代理,因为新版本具有更低的延迟,可以实现更流畅的对话。此外,v4可以在其后面的LLM开始生成答案时立即开始生成音频。而且,该模型还可以以不同方式处理对抗、升级和保持,以更好地解决问题。由于Cartesia、Deepgram、Fish Audio、Boson和WellSaid Labs等初创公司创建了具有表现力的语音模型,语音模型的竞争已在加剧。像谷歌和OpenAI这样的大公司也改善了他们的语音模型。ElevenLabs在今年早些时候从红杉资本筹集了5亿美元,这一轮由红杉资本主导,公司的估值达到了110亿美元。已经有关于下一轮融资估值将达到220亿美元的传闻。ElevenLabs的年化收入在年初约为3.3亿美元,现在已攀升至超过6亿美元。该公司在印度、欧洲和巴西等不同市场积极招聘,员工人数已超过800。在最近一次与TechCrunch的采访中,该公司的联合创始人兼首席执行官Mati Staniszewski表示,公司计划在“未来几年”进行首次公开募股,但没有承诺具体的时间表。当您通过我们文章中的链接进行购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。Ivan负责TechCrunch的全球消费科技动态。他驻扎在印度,曾在《赫芬顿邮报》和《下一网》等出版物工作。可以通过电子邮件im@ivanmehta.com或通过Signal的ivan.42进行加密消息联系或验证Ivan的联系。查看个人资料

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡