返回

文章详情

Show HN: 在拥有约12个标记/秒的48GB Mac上运行104GB Qwen3.8-Flash-Next

Hacker News2026年9月1日 16:42

在无法承载Qwen3.8-Flash-Next的Mac上运行该模型。该模型为104GB(4位);slotstream从SSD流式传输,并根据您提供的内存运行,最低可至8.1GB的规划底线。一个Swift二进制文件包含常用的Ollama和OpenAI聊天/生成端点。 在48GB的Mac上,温暖解码约为12个标记/秒;冷启动到第一个标记约为3秒;最大内存32GB(自动调整;您可以限制它)。磁盘上的权重为104GB。它会在我的Mac上运行吗?磁盘是首先的瓶颈。您需要约110GB的可用空间,因此,512GB的Mac是合理的最低配置,无论它有多少内存。权重是一次性下载104GB:在快速连接下不到一个小时,在慢速连接下几个小时(见下表)。内存上,预期在8.1GB的底线以下为8GB;医生警告它将分页16GB;估计24GB时约5个标记/秒;估计32GB时约8个标记/秒;估计48GB及以上时约12个标记/秒——并且在这里自动停止在33GB,因此机器的其余部分仍然是您的。只有48GB行是在实际硬件上测量的;其余数据来自相同的测量曲线,并且较小的Mac也有较慢的SSD。运行slotstream doctor以查看您的机器可以达到什么以及您是否有足够的磁盘空间来存储权重,然后再下载任何内容。安装curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh 安装一个预构建的二进制文件到~/.slotstream/bin,并将其放入您的路径中。需要Apple Silicon和macOS 14及以上版本。重新运行相同的行以升级;使用rm -rf ~/.slotstream卸载。发布版本由CI从标记提交构建,带有签名验证,因此您可以自己检查资产,而不是信任下载:gh attestation verify slotstream-arm64.tar.gz --repo carloslfu/slotstream 或者自己构建 - 命令行工具足够,无需Xcode:git clone https://github.com/carloslfu/slotstream && cd slotstream make build 104GB下载,二进制文件很小,但是权重不是。103.8GB,共24个文件,一次性下载。在首次运行时,serve和run提供下载,slotstream pull会自动处理这个:slotstream serve 无论哪种方式,它都会打印出大小、目标和您的可用磁盘,并在传输任何内容之前等待您的确认,如果磁盘无法容纳,它会直接拒绝。Hugging Face是瓶颈,而不是您的连接。在四个连接之后,它达到饱和:4、8、16和32都在36到57MB/s之间,而hf_xet,即Hugging Face自己的最快客户端,也是如此,而同一条连接对普通主机的速率为134MB/s。因此,在大约400 Mbps之后,更多的带宽买不到东西:您的连接在400 Mbps或更快时,30-50分钟 - Hugging Face的时间,而不是您的连接;200 Mbps ~1小时10 100 Mbps ~2小时20 50 Mbps ~4小时40 25 Mbps ~9小时。在这里的实际安装花了35分钟;顶行很宽,因为Hugging Face的自身吞吐量在会话之间移动。下面的行是您满速的103.8GB的算术,因此将它们视为最佳情况。中断是安全的:它会在停止的确切字节处恢复,所有24个文件都与存储在二进制中的sha256哈希值进行校验,因此截断、大小相同或损坏的下载无法到达引擎。pull --verify在10秒内重新哈希现有副本 - 这里是7.7秒,并行哈希。使用它serve监听端口11434,并实现Ollama客户端和OpenAI SDK使用的聊天/生成子集:curl localhost:11434/api/chat -d ' {

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡