启动 HN: Speko (YC S26) – 语音 AI 的 OpenRouter
嗨 HN!我是 Bek,Speko 的创始人,这是一个在您给定的约束条件下,在我们所有公共基准选项中找到最佳语音识别、LLM 和语音合成模型组合的平台,并告诉您原因。演示: https://youtu.be/no2LY2gRh-c 典型的生产语音代理是三个模型的组合:STT、LLM 和 TTS。每一层都提供十几个可信的供应商,每个月市场上都有新模型。几乎每个人都会评估一次,选择他们的技术栈,然后就再也不会检查,因为从一个供应商切换到另一个供应商意味着又一次集成和与数字的争论。结果是,您使用的语音代理仍在运行上个季度的模型,而更好、更便宜的选项已经可以使用。在创办 Speko 之前,我花了四年时间作为共同创始人和首席技术官,帮助亚洲各地的企业构建支持 10 多种语言的语音代理。每当新的语音模型出现时,我们就会重复同样的仪式:招聘以母语为基础的评估员,对其进行基准测试,并在其改善时更新生产。Speko 将这个过程转变为一个 API。一个每天处理数千通电话的团队告诉我们:“我们可以直接去这个仪表盘,切换模型,这样它就会为我们做好。”它是如何工作的:您发送请求,附带您的优化标准(准确性、延迟、成本或平衡)、语言和地区。路由器过滤我们为特定约束组合测量的模型,对其进行基准测试,选择赢家,并返回包含提供方、模型名称和分数的响应。网关会预取已签名的会话计划,因此新的会话直接从内存中拨打提供方的电话;在呼叫者等待的过程中没有控制平面往返。故障转移仅在连接设置阶段发生:如果提供方拒绝连接尝试,我们会开始连接到备选提供方。一些客户故事:一位创始人来找我们时完全不知道该选择什么:他给了我们他的用例,现在通过平台路由所有内容。一家物业管理 AI 使用 Python 运行 LiveKit,并且自上线以来没有更新 STT 或 TTS:他们不知道他们的 STT 在通话中存在高错误率,存在更好的选项,而替换总是看起来像是一个研发项目。一支团队不知道如何为西班牙语选择模型。一支医疗团队不知道哪个 STT 最好处理医学词汇。在每种情况下,我们都帮助找到基准中的最佳技术栈,现在他们通过我们进行路由。测量部分是公开的:我们将相同的输入传递给一个区域中每个模型的不同日期的运行,并发布排行榜,包括我们的选择表现不如替代方案的那些。启动演示回答哪个 30 秒的片段听起来更好;生产询问哪个模型在第八分钟坚持下去,因此我们测试自发演讲、金钱和日期、十分钟录音,排名会变化。我们为 TTS 自然性训练了一个自动评分器,在我们盲测的面对面听众投票中;对于它从未见过投票的提供商,它选择的赢家与我们的评估者一样多,约有评估者之间的共识。我们不自己培训或销售模型,这正是我们保持排名公正的原因。我们还开源了网关,供希望避免在音频路径上额外网络跳跃并且不想与我们的云共享密钥的团队使用(https://github.com/SpekoAI/gateway,MIT):一个 Go 二进制文件,作为您的代理容器中的边车运行,使用 Unix 套接字上的一个本地协议,固定提供方主机并附加您的密钥。在 BYOK 模式下,它根本不与我们通信。请注意,默认情况下启用了匿名、无内容的遥测,设置一个环境变量即可禁用它。费用:网关和 BYOK 设置将永远免费,我们会对托管路由器和管理密钥收取费用,并提供合并账单。自我们在 6 月底开始批量以来,外部使用量平均每周增长约 25%,在启动周的使用量前置。我们希望得到社区的反馈:您现在如何选择语音模型?是什么让您信任第三方基准?
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡