展示 HN:开源引擎在任何 M 系列 Mac 上以 2 GB RAM 运行 Gemma 4 26B
TurboFieldfare 在大约 2 GB 的 RAM 中运行 Gemma 4 26B-A4B 的推理。为任何 Apple Silicon Mac 提供的自定义 Swift + Metal 运行时,甚至是 8 GB 的机器。快速入门 · 本地服务器 · 基准测试 · 贡献结果 · 工作原理 · 实验 · 参考。内存变得昂贵。因此,我给了一个 260 亿参数的模型大约 2 GB 的预算。TurboFieldfare 在不将整个 14.3 GB 模型加载到内存中的情况下,运行指令调优的 Gemma 4 26B-A4B。它保持 1.35 GB 的共享核心和 FP16 KV 缓存在内存中,然后从 SSD 流式传输每个标记所需的专家。这个机制让模型能够在内存为 8 GB 的 Mac 上运行。运行时、流式安装程序、CLI 和本地 Mac 应用程序都是用 Swift 和 Metal 编写的。TurboFieldfare 是特定模型,而不是 MLX 或 llama.cpp 的包装器。策划的实验记录总结了 103 个跨内核、缓存、I/O、预填充和解码的测量结果。尝试它 git clone https://github.com/drumih/turbo-fieldfare.git cd turbo-fieldfare swift build -c release .build/release/TurboFieldfareMac。第一次运行时,Swift Package Manager 会下载并构建分词器所需的 Swift 包。完整的发布构建包括前台 Mac 应用程序及其同类解码服务可执行文件。当应用程序打开时,选择下载并让 TurboFieldfare 获取并重新打包固定模型(约 15 GB)。准备好后,选择加载模型,输入提示,并按生成。浏览一下指标值:模型 Gemma 4 26B-A4B IT,26B 总参数,每个标记约 3.88B 活跃参数,权重 MLX 仿射 4 位,组 64;8 位路由器;4 位共享和路由专家,内存约 2 GB 权重和 4K KV 缓存,存储约 14.3 GB 用于安装的文本模型,硬件 Apple Silicon Mac;8 GB RAM,平台 macOS 26,Metal 4,Swift 6.2,M2 测量解码 5.1-6.3 tok/s 在 8 GB M2 MacBook Air 上,M5 测量解码 31-35 tok/s 在 24 GB M5 Pro 上。测量结果是一个参考点,而不是性能上限,提示长度、生成长度、页缓存状态和硬件都会影响吞吐量。要帮助测量其他 Apple Silicon Mac,请遵循社区基准测试指南。使用 TurboFieldfare,TurboFieldfare 提供一个本地 Mac 应用程序、一个命令行界面和一个实验性环回 OpenAI 兼容服务器。它们使用相同的 .gturbo 模型目录,但一次只能运行一个拥有模型的产品。Swift 包暴露了六个产品:产品 目的 TurboFieldfare Swift 库,包含运行时和 Metal 内核,TurboFieldfareMac 本地 Mac 应用程序用于安装和生成,TurboFieldfareDecodeService 一次性本地模型和 Metal 所有者用于 Mac 应用,TurboFieldfareCLI 命令行指令聊天和原始完成,TurboFieldfareServer 环回 OpenAI 兼容的聊天完成服务器,TurboFieldfareRepack 流式模型安装程序和安装验证器。要求 Apple Silicon Mac;经过验证的目标是一个 8 GB M2 MacBook Air,macOS 26 和 Metal 4,Xcode 26 和 Swift 6.2 或更高版本,足够的可用存储用于 ~14.3 GB 模型安装,首次模型安装需要互联网连接。该包仅支持 arm64,不支持较旧的 macOS 和 Metal 版本。提示模型,Mac 应用程序将您输入的内容视为指令,并自动处理 Gemma 的聊天格式。只需描述任务并包含模型所需的任何上下文。生成的默认值是温度 0.2,Top-K 64 和 Top-P 0.95。将温度设置为 0以获得确定的贪婪输出。模型仍然可能重复或给出不正确的答案,因此请检查重要结果。TurboFieldfare 仅支持文本。应用程序和 CLI 支持用户和模型消息以及可选的系统指导;它们不暴露或执行工具。环回服务器接受功能工具声明,并返回模型生成的工具调用以供客户端授权和执行。不支持图像、音频和视频。Mac 应用程序 克隆存储库,然后从根目录运行应用程序:swift build -c release .build/release/TurboFieldfareMac。构建完整的包,以便应用程序及其兄弟解码服务均可用。当从此检出启动时,应用程序将在 scratch/gemma4.gturbo 中存储模型。安装模型在首次启动时,应用程序检查可用存储并显示下载和已安装大小。选择下载以开始。安装程序不会实现完整的源检查点。它从固定的 Hugging Face 版本流式传输所需的字节范围,并在到达时将它们直接重新打包为 .gturbo 布局。这避免了磁盘上的第二个完整检查点,并保持临时内存界限。第一次安装将大约 15 GB 通过有限的 Hugging Face 范围请求进行传输。网络速度和 Hugging Face 响应时间会有所不同,因此可能需要一些时间。完成的 .gturbo 安装占用约 14.3 GB,仅在其清单和文件哈希经过验证后接受。安装不会将模型加载到内存中。加载并生成 在安装完成后...
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡