Kog 正在深入研究,以从 GPU 中挤出更多推理能力
更快 AI 推理的竞争已经开始,市场在 5 月对 Cerebras 及其专用芯片的首次公开募股表示热烈欢迎。然而,法国初创公司 Kog 正在押注,与传统 GPU 相关的性能潜力仍有很多可供挖掘。该初创公司在 5 月份以技术预览的形式登上 Hacker News 的头版,旨在证明在企业已经拥有的标准数据中心 GPU 上可以实现 '极快的单请求解码' — 例如它在演示中使用的 AMD MI300X 和 NVIDIA H200 GPU。虽然有人对这种能力未能延伸到我们笔记本里的 GPU 感到失望,但其他人则看到了潜力。由于推理速度和成本现在成为关键瓶颈,Kog 对现有硬件进行软件优化以释放新功能的承诺吸引了超过旁观者的关注。Kog 的首席执行官 Gaël Delalleau 告诉 TechCrunch,'我们有 200 个有形的商业线索'。基于早期反馈,单一创始人预计软件工程将是第一用例。资深的 Claude Code 用户很清楚,有时他们必须等待几个小时才能获得结果。Anthropic 自身也意识到速度是有价值的,因此对 Claude 的快速模式收取了多倍的价格。Kog 希望将目标客户锁定在那些因为依赖 AI 工作流进行专业任务而被这些延迟打扰的人身上。但该初创公司还有设计合作伙伴,允许用户通过提示生成游戏和应用程序,Delalleau 表示,得益于 Kog 推理引擎(KIE)实现的更快结果将带来更多收入。公司意识到这个市场尚未完全成熟。在观察需求时,Kog 了解到潜在客户并不准备微调小型模型。'这就是我们自推出以来,完全专注于加速更大模型开发的原因,以满足我们看到的需求。'这使得 Kog 要跨越一个巨大的鸿沟,才能兑现'30 倍更快 LLM 推理'的承诺。它的演示显示每个请求达到 3000 个标记每秒(TPS)的惊人速度 — 但这是基于一个仅有 20 亿参数的专用小型模型,即现已开源的 Laneformer 2B 。Delalleau 对反对者提出的质疑充满信心,认为相同的方法同样可以有效应用于 LLM,这些模型的规模可能会对推理芯片造成挑战。'GPU 有着光明的未来,'他说。对 Kog 的首席执行官来说,认为 GPU 不适合解码的观念已经成为一种误解;更新的 GPU 拥有越来越多的内存带宽,只等待被释放。Kog 并不孤单,认为软件优化可以帮助 GPU 超越其说明书上的标称性能。来自法国的 ZML 发布了硬件无关的软件,绕过 Nvidia 的 CUDA,以支持在竞争芯片上进行快速推理。但 Delalleau 表示,Kog 更像是斯坦福大学的 Hazy Research 实验室,专注于 GPU 加速的更深层次。Delalleau 本人并不是研究人员,他的第一家初创公司 TechCrunch50 2009 毕业生 Stribe 与他新成立的公司没有任何关系 — 除了他的前联合创始人转投风险投资的 Kamel Zeroual,他的公司 Varsity VC 联合主导了 Kog 的种子轮融资。但该初创公司的深度关注源于他独特的背景。他在法国的 École Polytechnique 学习固态物理,随后从事进攻性网络安全 — 也称为白帽黑客。Delalleau 表示,这塑造了他现在鼓励团队采用的思维方式。在科学方面,'有一种理解物理法则和 GPU 法则的思维方式,以充分利用它们。'至于黑客,他是 DEF CON CTF 竞赛的四届决赛选手,表示这教会了他'以非常低的水平 — 深到汇编语言和二进制代码 — 对事物进行逆向工程,以了解其工作原理,并试图利用它实现一个并非必然设计的目标。'这种方法的缺点在于它非常实用并且耗时。'对于每个新 GPU,我们将投入几周甚至几个月的时间,深入研究细节并进行该硬件的 GPU 工程研究。' 目前,Kog 的团队人数达到 11 人,这限制了它能够处理的芯片数量,至少在可预见的未来。在更长远的情况下,Kog 希望将其方法应用于基于代理的管道,从而支持更多的芯片和模型。随着欧洲寻求在这两个领域建立自己的能力,这可能会为该初创公司增加主权利好,而它已经得到了 Scaleway 的支持,并得到了法国 Bpifrance 和法国科技 2030 项目的支持。不过,就目前而言,Kog 需要向世界证明其方法在 LLM 上确实有效。这也将是确保更多融资的关键。'一旦我们在 10 倍速度下实现了我们的第一个重大模型,我想是在 9 月,我们就可以开始展示客户的吸引力,从而进行我们的 A 轮融资,' Delalleau 说。当您通过我们的文章中的链接购买时,我们可能会赚取少量佣金。这不会影响我们的编辑独立性。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡