展示 HN: Needle2: 适用于手机、可穿戴设备、智能家居和机器人的 14MB 可代理 LLM
今天我们发布了 Needle 2:一个开放的 45M 参数模型,用于工具调用、设备使用和结构化提取。整个模型是一个单一的 14MB 二进制文件,在 28MB 的 RAM 中运行完整的会话。它基于我们的简单注意力网络发现,压缩到 CQ2-bit,与 Cactus Quants 一起构建,并融入自己的引擎。在工具调用和移动设备使用基准测试中,Needle 2 在 5× 到 70× 更小的情况下与其他小型模型如 FunctionGemma 270M、LFM2.5 230M 和 Apple FM 互相竞争,以 2 位来对抗它们的 f16。Needle 在 Raspberry Pi 5 上达到 500 tokens/sec 的解码速度,在类似 Meta Quest 3S 和 Apple Vision Pro 的 VR 设备上在 400–1,500 tokens/sec 之间,在像 Samsung A 系列这样的低于 $200 的手机上范围在 300–700 tokens/sec。Needle 在峰值会话 RAM 约为 28MB 的情况下,可在较新微控制器如 ESP32-S3 上运行。Playground 让您测试 Needle 对于可穿戴设备、机器人、智能家居、手机和汽车的适用性。Needle 根据 Apache 2.0 许可证发布,权重在 Hugging Face 上;该库可助您运行。45M 参数 800+ tok/s Pi5 预填 500+ tok/s Pi5 解码 CQ2-bit 压缩 14 MB 文件大小 28 MB 会话 RAM 我们的赌注:将设备AI带到低于 $200 的设备:边缘 AI 最近意味着 Macs 和 PCs,但边缘大多是廉价硬件:超过 210 亿个连接的物联网设备与大约 15 亿台计算机相比,在新兴市场,大多数手机的发货价低于 $200。考虑到预算手机、树莓派、微控制器、可穿戴设备、小型机器人如 Reachy Mini 和连接家居设备,大约 80% 的边缘设备成本低于 $200。那正是 Needle 目标的硬件:没有 GPU,没有 NPU,数百 MB 的 RAM。函数调用和设备使用:打开灯不需要前沿模型。一块手表、一座房子、一台机器人:每一种设备已经以类型化参数的函数来展示它们的能力,因此唯一困难的部分是将一个混乱的句子映射到它们上:哪个函数,带有什么值。从这个角度看,问题不需要世界知识和开放式散文,这就是为什么 45M 参数在聊天需要数十亿的情况下已经足够。这个更小的表述是其余一切的基础。提取和结构化输出:模式是接口,同样的表述适用于文档:一个模式加一个段落返回类型化字段,一个枚举字段是分类器,一个数组字段在一次调用中收集一个列表。我们通过合同而不是约定来强制执行这一点:每个回合都被一个调用封装回答,空调用是拒绝,通过从声明的模式编译出的字节级语法限制每个标记。语法承载着语法,因此所有 45M 参数都用于选择函数并根据用户的词汇对论点进行赋值。边缘-云协作:没有小型模型覆盖一切,因此 Needle 直接说明,而不是猜测:每个响应都携带学习的置信分数,与主题无关的请求返回空调用。在您的阈值以上,行动;低于它,重新询问或升级到云。大多数设备请求是常规控制,因此升级仍然很少,默认路径保持私密、即时且免费。无损的 2bit 量化:小型模型在事后量化下崩溃,因此我们从不进行事后量化:Needle 2 从预训练到后训练都与 Cactus Quants 对抗,权重、激活和 KV 缓存一样。您部署的 2bit 模型就是经过训练的模型。这就是如何将 45M 参数适配到 14MB,而不在我们的电池上丢失任何内容。共同设计的模型与推理:每个架构选择在目标硬件上经过基准测试后才获得其参数,交付的是二者,而不是权重:一个单一的无依赖 C++ 二进制文件,在启动时探测 CPU 并选择内核,模型、分词器和语法编译器都密封在内部。一个工件可以在 Cortex-M 到 x86 到 WebAssembly 上运行。无需安装,无需下载。微调您的 Mac/PC:每个产品都有自己的工具词汇,而 45M 模型足够小,可以在其运行的地方进行再培训:该库和 Python 包可以在您自己的计算机上在几分钟到几个小时内进行调优和测试。发布一个能说出您设备工具的 Needle,而不是一个通用助手。生产 Needle 对于需要最小 RAM 占用、低延迟、隐私和离线可靠性的产品是准备好的。Pebble - 现代可穿戴设备行业的先驱 - 在 Index 01 应用程序中本地运行,以将语音请求转化为动作,而无需依赖网络连接。Pebble Index Ring 没有屏幕。因此,当您与其对话时,动作必须每次都发生,无论是否连接互联网。我们在应用中本地运行 Cactus Needle,而不是依赖于云。该模型的占用空间很小,并且性能从不让我们失望。架构图 2。简单注意力网络。每个块都携带其更新规则。此处 x̂ 是四个残差流的 RMS 标准化展平,H 是正交 Walsh-Hadamard 变换 - 一个固定矩阵,以 n log n 的时间应用,无需权重。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡