OpenAI的Jalapeño芯片为大规模快速推理而生,基准测试显示
在周二的Hot Chips大会上,OpenAI分享了对Jalapeño的更详细的了解,包括新系统的第一批基准测试结果。在Semianalysis的InferenceX基准测试中,Jalapeño每用户的令牌数量和每千瓦的吞吐量均超过目前可用的先进推理处理器。OpenAI硬件负责人Richard Ho在新闻电话中表示:“底线是,结果显示相对于先进技术,性能有了非常显著的提升。Jalapeño可以在每单位功率下服务更多的人工智能工作,同时也能够更快地返回响应。服务大量客户非常高效,但它的延迟也可以非常低。”值得注意的是,这一比较是针对Nvidia Blackwell系统,但到Jalapeño全面部署时,竞争可能会有显著进展。Ho估计Jalapeño将在2026年底以“非常小的数量”部署,更多的显著部署将在2027年进行。Jalapeño最早于去年十月宣布,由OpenAI与博通密切合作开发,OpenAI自己的模型在开发过程中提供了支持。公司计划将Jalapeño打造成一个多代平台,使人工智能产品、模型、芯片和内存得以协调发展。由于这种全栈方法,OpenAI能够解决推理过程中经常导致摩擦的特定阶段。特别是,Jalapeño旨在最小化处理过程中预填充和通信阶段的延迟,OpenAI表示这些阶段通常会成为瓶颈。“我们设计Jalapeño以最小化数据移动和通信延迟,”该公司在发布结果的博客中表示。“这意味着在生成响应时使用的KV缓存等模型状态可以被明确地放置并保持本地,同时系统为每个推理阶段激活适当的计算、内存和网络组合。”当您通过我们文章中的链接进行购买时,我们可能会获得少量佣金。这不会影响我们的编辑独立性。Russell Brandom自2012年以来一直在报道科技行业,专注于平台政策和新兴技术。他曾在The Verge和Rest of World工作,并为Wired、The Awl和MIT技术评论撰写过文章。可以通过电子邮件russell.brandom@techcrunch.com或通过信号412-401-5489与他联系。查看简历
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡