返回

文章详情

AMD收购初创公司Taalas以通过硅刻录模型提升推理性能

Hacker News2026年8月6日 20:23

在AMD最新尝试打破Nvidia在AI硬件中的主导地位时,Zen之家收购了AI芯片公司Taalas,该公司通过一种将模型权重直接刻录到硅中的工艺,承诺在推理性能方面提升一个数量级或更多。此交易在上周四市场收盘时宣布,似乎与Nvidia去年12月与Groq的200亿美元许可交易在同一背景下:让AI代理(如代码助手)所需的高性能“高级”推理服务更快且更便宜地运行。AMD没有透露交易条款,但根据我们的了解,这实际上是一次收购,而不是人才收购。Taalas成立于2023年,总部位于多伦多,其推理方法与传统的GPU或支撑Groq LPU或Cerebras晶圆级加速器的数据流架构截然不同。该初创公司的芯片并不依赖于高带宽存储器(HBM)来存储模型权重,而是将它们直接刻录到硅中。从某种意义上说,Taalas的芯片实际上是模型特定集成电路(MSIC)。更重要的是,Taalas的技术不仅仅是概念性的。今年2月,该初创公司揭示了其在台积电6nm工艺技术上生产的首款测试芯片,命名为HC1。初步基准测试显示,该芯片以每秒16,960个token服务Meta的Llama 3.1 8B——在去年2月宣布时,这比Nvidia的GPU快48倍,比Cerebras的加速器快8.5倍。虽然Llama 3.1在今天的标准下已经显得过时,因其早在2024年中期首次亮相,但该等距尺寸的芯片确实是用来证明概念的。Taalas对其芯片的实际工作方式保持相当保密,但我们知道其处理器由两个主要区域组成:刻录模型权重的mask-ROM召回结构,以及存储KV缓存和微调适配器的SRAM召回结构。对于计划在今夏发布的第二代HC2芯片,Taalas旨在将参数数量提升到200亿个。听起来可能不算多,但与大型模型的GPU一样,权重只是通过使用流水线并行性在多个加速器之间分配。在每个芯片200亿个参数的情况下,您只需要50个加速器来支持一个万亿参数的模型,而AMD恰好拥有能够轻松容纳这一点的机架规模计算平台和内部系统设计团队。这比Nvidia最近发布的LPX系统要更加节省空间和能源,那些系统需要数十个GPU和至少2000个Groq LPU来服务同一个模型。根据我们的了解,AMD打算将其基于Instinct的Helios机架与基于Taalas技术的芯片配对,这暗示着一个离散的架构,其中计算密集型的提示处理在GPU上进行,而token生成则转移到基于Taalas的加速器上。AMD也可能采用一种“tick-tock”节奏,客户最初在Instinct加速器上部署和验证模型,一旦对其满意,便过渡到Taalas加速器。此时我们只能进行推测,但AMD的AI高级副总裁Vamsi Boppana在一份预先准备的声明中对此表示:“AMD正在构建一个全堆栈的AI平台,使客户能够灵活地为每个AI工作负载部署合适的计算解决方案。” 您最好真的很喜欢那个模型。尽管技术非常快速,但如果您还没有想明白,这种技术具有相当大的缺点。一旦芯片部署,您就会被固定在那个模型上。任何比LoRA适配器大得多的改变都将需要重新设计芯片,这不仅昂贵而且耗时。距AI繁荣四年之久,新模型几乎每月都会推出。为了从Taalas的技术中受益,AMD的客户必须对其模型的选择非常有信心,这对某些人比对其他人要容易得多。然而,如果初创公司所言属实,情况并不像听起来那么糟糕。尽管新模型需要重新设计,但并不需要从头开始。相反,只需更改两层金属,这要便宜得多且耗时更少。话虽如此,我们强烈怀疑这项技术将主要由AI模型开发者、他们的基础设施提供者和少数推理提供者广泛采用。在与我们兄弟网站The Next Platform的采访中,该公司建议,将模型的权重刻录到硅中比训练一个前沿模型便宜100倍。AMD无疑处于谈判这些交易的有利位置。OpenAI、Anthropic和Meta都是主要的Instinct客户。考虑到模型公司和芯片设计者之间密切的工作关系,不会令人惊讶看到GPT或Claude在基于Taalas和Instinct的加速器的组合上部署。该技术还有其他的隐含意义。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡