Fish Audio融资5000万美元种子轮,以建立AI语音模型服务于创作者和企业
AI生成的语音模型市场潜力巨大。创意使用案例要求AI语音模型更加表现力,而希望自动化客户支持和销售操作的企业则需要它们具有更强的可操控性。位于帕洛阿尔托的Fish Audio希望通过其超过15,000个自然语言控制的库来满足所有这些用例。自去年推出以来,该初创公司今天已有超过800万人使用其开放源版本或托管版本的模型,现在每年产生2100万美元的经常性收入。为了继续在这一基础上发展,该初创公司在周二宣布已融资5000万美元,此轮种子轮由Coreline Ventures和Capital Today领投。此次融资还得到了359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners和HF0的参与。Fish Audio最初是由前NVIDIA研究员Liao Shijia发起的一个小项目,他因市场上非表现力的合成语音而感到沮丧,于是利用单个GPU训练了一个语音生成模型,并进行了开源。Fish Speech库在GitHub上现在已有超过31,000个星标,被独立开发者、视频游戏设计师和创作者使用。在过去的一年中,该公司推出了五个模型:四个语音生成模型和一个语音转文本模型。它已将三个语音生成模型开源,但其最新的S2.1 Pro模型仅通过付费API提供。Fish Audio为创作者和团队提供适合的付费月度计划,解锁一定数量的生成分钟数,并提供语音克隆功能。该公司还提供其API和平台的企业版,并表示像HeyGen、Sanas和Plaud这样的组织已经在使用它。Cao说:“每个企业都有不同的用例和偏好。例如,像HeyGen这样的公司使用我们的声音来为AI头像提供动力,想要声音的真实感;游戏工作室会希望为他们的角色提供表现力;而像LiveKit这样的语音代理公司需要更自然的低延迟声音,能在通话中表现出足够的表现力。”该初创公司通过请求用户提交自己的声音来训练其模型,并在使用他们的声音时给予补偿,从而建立了自己的声音库。然而,这几个月来,部分创作者宣布他们的声音在未征得同意的情况下上传到Fish Audio,引发了一些麻烦。该初创公司设立了DMCA内容下架流程来解决这样的担忧,但下架本身花费了很长时间。Fish Audio的首席执行官兼联合创始人Rissa Cao告诉TechCrunch,公司的下架流程现在已实现自动化。创作者可以轻松提交一段短语音样本或合同,以证明上传的声音属于他们,她说,他们的声音将在不到3分钟内从该初创公司的平台上移除。不过,这并不防止其他人在未告知艺术家的情况下上传其声音。在艺术家发现之前,他们的声音将继续在平台上使用,直到他们申请下架。Coreline Ventures的合伙人Oskue Honda表示,社区驱动模型只有在创作者信任平台时才能奏效。“以社区为中心的方法只有在创作者信任平台的情况下,才能成为持久的优势。这意味着同意、透明度和归属必须融入产品,而不是作为事后考虑。我相信行业需要朝着验证语音所有权、明确许可条款、简易报告和下架流程,以及最终收入共享模型发展,让创作者在其声音被授权或商业使用时获益。”Cao表示,当该初创公司仅将其产品作为开放源项目并计划面向创作者时,运行效率良好,并不需要资金。但它希望开发更高级的模型,并希望迎合企业,因为投资者的兴趣正在上升,这促使它寻求资金。展望未来,Fish Audio计划在今年发布一个音频理解模型。它还在构建一个语音到语音模型。语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(以前的Podcastle)和Krisp等公司都在争夺创作者和企业的市场份额。359 Capital的合伙人Rico Mallozzi表示,开发者的细粒度控制和成本高效的模型训练将提高Fish Audio与大型AI实验室的竞争力。“我认为,考虑到他们能够构建的尖端模型,以及他们的团队与其他一些资金雄厚的AI实验室或公司相比,这真是不可思议。这显示了他们在缩小人工合成与人类般声音之间的差距方面的技术能力,”Mallozzi在一次电话中告诉TechCrunch。通过我们文章中的链接进行购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡