返回

文章详情

展示HN: Shoehorn – 将任何模型量化以在您的机器上运行

Hacker News2026年8月18日 14:29

让任何语言模型适应您实际拥有的内存。预设量化忽略了您的硬件:选择一个合适的,否则您将浪费数百兆的质量空间,或者在加载时发现它根本不适合。shoehorn从您实际拥有的内存开始,减去推理本身所需的部分,并解决一个每个张量的混合精度分配问题,该问题在舍入误差范围内——常规使用99.99%的预算,有时用到字节。$ shoehorn fit unsloth/Qwen3-4B-GGUF --serve weights: 519.2 MiB的519.2 MiB预算(99.998%已使用,13 KB余量)在您下载之前,什么适合您的机器?选择您的硬件,然后此页面扫描Hugging Face上下载量最多的模型,以查找适合您预算的模型——按您拥有的内存质量排名。完全在您的浏览器中运行。您的机器对话室获取shoehorn安装shoehorn需要在您的PATH中包含llama.cpp作为推理后端(Homebrew安装会为您拉取它)。然后shoehorn ui打开本地应用——选择一个模型,按一个按钮,开始聊天。brew install notactuallytreyanastasio/shoehorn/shoehorn或从源代码安装:在克隆仓库后运行cargo install --path . 所有版本该应用程序一个按钮,满足您的整个预算本地web应用程序测量您的机器,流式传输适合度,将预算作为测量带呈现,并在适合度的成本上放置一个困惑度数字,以聊天按钮结束。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡