返回

文章详情

Hetzner正在开发LLM推理

Hacker News2026年7月24日 09:24

Hetzner正在实验LLM推理。这并不是我预期会写的句子,但我认为这很有趣 :) 在任何人将其生产AI工作负载迁移到Hetzner之前:这非常只是一个实验。没有计费,没有服务水平协议(SLA),没有生产保证,当前只有一个模型。Hetzner表示,它想要了解人们是否真正需要这个,系统如何扩展,哪些功能重要,以及它可以处理什么样的负载。因此,这不是一个已完成的产品发布。这是Hetzner将一些东西早期展示给用户,看看会发生什么。我真的很喜欢这种方法。 什么是Hetzner推理?Hetzner推理是一个与OpenAI兼容的API,运行在Hetzner自己的基础设施上。你可以在实验面板中创建一个API令牌,将OpenAI客户端指向Hetzner的基础URL,并像使用大多数其他推理API一样使用它。目前,唯一可用的模型是Qwen/Qwen3.6-35B-A3B-FP8。它是一个拥有350亿参数的专家混合模型,有30亿个活跃参数。它接受文本和图像,具有262K的上下文窗口,并使用FP8量化权重。对于一个实验来说,这是一个完全合理的模型。它足够小,可以在没有荒谬的GPU集群的情况下服务,但仍然有足够的实用性来测试API以应对真实工作负载。如果你想尝试而不编写任何代码,Hetzner还发布了一个简短的教程,用于连接OpenCode到API。 我尝试了它,因为API与OpenAI兼容,所以集成几乎没有什么特别之处:enable_thinking选项值得一提。没有它,模型可能会在返回可见答案之前花费相当多的完成预算进行推理。该选项在我的测试中有效,但Hetzner并没有对此进行文档记录,因此我还不打算围绕该请求形状构建任何重要的东西。我在2026年7月23日做了一些小测试。我不想将此帖子变成一个巨大的基准报告,因为该产品是实验性的,对它的基准测试也可能会随着时间的推移而失去效用。但粗略的数字是:七个简短请求的首个令牌的中位时间为153毫秒,五个较长生成的输出速率为每秒224个令牌,限制为512个令牌。速度很快!这也是只是一个客户在一个时点的测试。这不是一个服务水平协议(SLA),也几乎没有关于许多人同时使用该服务时会发生什么的信息。模型本身大致是我所期待的。它遵循大多数格式化和检索指令,正确处理了图像,并且在两个非常简单的算术问题上失败了。所以:一个小的、稍微有点糟糕的LLM :D 产品比模型更有趣Qwen端点很好玩,但我认为当前模型并不是有趣的部分。有趣的部分是Hetzner为何首先测试推理。这之后的内容全部是我的推测。我没有内部信息,也没有人告诉我Hetzner他们的计划。我只是看着产品,试图连接一些点。开放权重推理是一个商品市场。每个人都可以下载相同的权重,运行或多或少相同的服务软件,并公开一个与OpenAI兼容的API。切换提供商也很容易,尤其是对那些自托管的用户使用像OpenRouter或LiteLLM这样的产品。这使得除非你有某种优势,否则很难建立巨大的利润率。通常这意味着:你可以非常便宜地购买和操作GPU硬件;你在保持硬件忙碌方面非常出色;或者你已经拥有本来会闲置等待客户的GPU。Hetzner在购买硬件、将其放入自己的数据中心以及以极具效率的成本结构运作方面非常出色。这基本上就是整个公司。如果有人可以把推理变成另一种低利润的基础设施产品,Hetzner至少是一个可信的候选者。 这里还有一个不错的利用率故事。出租的裸金属GPU属于一个客户,无论这个客户是否使用它。推理API可以在多个用户之间共享GPU容量,并保持硬件忙碌。如果Hetzner有多余的GPU容量——或者计划建立更大的GPU舰队——那么推理产品可能有助于将这一容量转化为收入。再次说明,我不知道他们是否真的在做这个。这对我来说只是经济意义上的合理。 大问题是硬件这方面我尚未信服。Hetzner目前的公共专用GPU服务器阵容使用两种GPU类型:NVIDIA RTX 4000 SFF Ada Generation,具有20 GB VRAM;NVIDIA RTX PRO 6000 Blackwell Max-Q,具有96 GB VRAM。这些都是能够的GPU,96 GB RTX PRO 6000对于小型和中型模型来说是相当不错的推理机器。Hetzner当前Qwen模型的FP8文件大小约为38 GB,实际的VRAM使用量则会根据上下文长度、缓存大小和服务设置而有所不同。但这些都是工作站GPU,而不是密集的多GPU系统,相对于重新部署它们来说,你需要更大的实力来处理。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡