Homebench – 基于速度、内存和质量基准测试本地大语言模型
基准测试您已安装的本地大语言模型 — 速度、内存和质量 — 作为实时终端排行榜。homebench 是一个单个命令的 TUI,能够发现您本地运行器(Ollama、LM Studio、llama.cpp、vLLM 或任何兼容 OpenAI 的服务器)中安装的模型,运行精心挑选的质量测试,测量每秒标记数、首次标记时间以及您实际机器上的内存占用,并呈现实时比较排行榜。安装命令:pip install homebench homebench 仅此而已。无需配置,无需 API 密钥,无需云服务。 之所以选择这个工具是因为有很多优秀的工具解决了这个问题的一部分,但没有本地优先的工具能同时处理两方面的任务:llama-bench(在 llama.cpp 中)只测量速度。lm-evaluation-harness 测量质量,但没有完善的笔记本电脑 UX,而且并不是围绕大多数人实际使用的模型运行器构建的。homebench 填补了这个空白:本地优先、零配置、以用户体验为导向。克隆并运行,指向您已经下载的模型,并快速回答“我的本地模型中哪个真正好,速度如何?” 它测量的指标:指标 如何 tok/s 输出标记数 ÷ 生成时间。Ollama 报告服务器端评估时间;兼容 OpenAI 的后端从标记流计算客户端时间。不包括提示处理和模型加载时间。TTFT 首个流式标记的实际时钟时间(减去运行器报告的模型加载时间)。内存 当运行器曝光时的驻留模型大小(Ollama /api/ps,LM Studio /api/v0),加上对后端进程的最佳努力的峰值 RSS 采样。质量 31 项确定性评分任务,覆盖数学、推理、事实回忆、指令跟随/结构化输出、提取和代码理解。可选的 LLM作为评判者添加开放式任务(摘要、电子邮件、俳句、解释)。安装:pip install homebench # 然后运行:homebench 想要独立安装?使用 pipx:pipx install homebench 或从源代码安装:git clone https://github.com/david-g-3654/homebench cd homebench pip install . 需要 Python 3.9 及以上版本。用法:homebench # 快速默认:3 个最小模型,快速套件(TUI) homebench --all # 基准测试所有发现的模型 homebench --full # 运行完整的质量套件(不仅仅是快速子集) homebench --no-tui # 普通实时渲染器(适用于管道/ CI) homebench -m llama3.2,qwen3:8b # 仅使用这些模型 homebench --limit 3 # 限制模型数量 homebench --provider lmstudio # 使用 LM Studio 而不是自动检测 homebench --provider llamacpp # llama.cpp 服务器(llama-server) homebench --provider vllm # vLLM homebench --provider openai --host http://localhost:5000 # 任何兼容 OpenAI 的服务器 homebench --refresh-cache # 重新计算而不是重用已缓存的响应 homebench --no-quality # 仅速度 + 内存(快速) homebench --no-speed # 仅质量 homebench --judge qwen3:8b # 启用 LLM 作为评判者(添加开放式任务) homebench --tasks mypack.yaml # 使用自定义任务包而不是内置套件 homebench --add-tasks mypack.yaml # 在内置套件上添加一个包 homebench --label "调整前" # 为此运行打标签,以便后续对比 homebench --md results.md # 同时导出 Markdown 报告 homebench --json results.json # 同时导出原始 JSON homebench list # 仅列出发现的模型 homebench tasks # 显示质量套件(添加 --tasks 预览包) homebench history # 列出过去的运行(自动保存) homebench diff # 对比最近两次运行 homebench diff 3 1 # 将第 3 次运行(基准)与第 1 次运行(新)进行对比 homebench throughput # 批处理吞吐量扫描(并发 1,2,4,8) homebench throughput --concurrency 1,8,16 --provider vllm homebench fit # 哪些热门模型适合您的硬件?运行 homebench --help 查看完整的标志列表。示例输出 在 Apple M1(16 GB)上的快速套件运行结果,通过 Ollama:最终排行榜 ┏━━━┳━━━━━━━━━━━━━━━━━━━━━━┳━━━━━━━━┳━━━━━━━━━┳━━━━━━┳━━━━━━━┳━━━━━━━━┳━━━━━━━━┓ ┃ # ┃ 模型 ┃ 参数 ┃ 质量 ┃ 通过 ┃ tok/s ┃ TTFT ┃ 内存 ┃ ┡━━━╇━━━━━━━━━━━━━━━━━━━━━━╇━━━━━━━━╇━━━━━━━━━╇━━━━━━╇━━━━━━━╇━━━━━━━━╇━━━━━━━━┩ │ 1 │ llama3.2:latest │ 3.2B │ 75% │ 6/8 │ 16.8 │ 545 毫秒 │ 2.4 GB │ │ 2 │ alibayram/smollm3 │ 3.1B │ 38% │ 3/8 │ 16.9 │ 829 毫秒 │ 2.1 GB │ └───┴──────────────────────┴────────┴─────────┴──────┴───────┴────────┴────────┘ (以上数据是该时刻在该笔记本电脑上的数据 — 请参阅限制说明。)提供者 至少需要一个本地模型运行器可访问: 提供者 --provider 默认主机 主机环境变量 备注 Ollama ollama http://localhost:11434 OLLAMA_HOST 本地 API;通过 /api/ps 报告模型内存。 LM Studio lmstudio http://localhost:1234 LMSTUDIO_HOST 通过本地 /api/v0 丰富元数据 + 内存。 llama.cpp llamacpp http://localhost:8080 LLAMACPP_HOST llama-server,兼容 OpenAI。 vLLM vllm http://localhost:8000 VLLM_HOST 如果使用 --api-key 启动,则设置 VLLM_API_KEY。 兼容 OpenAI openai — OPENAI_BASE_URL 任何 /v1 服务器(Jan,LocalAI,TGI 等);通过 --host 传递。自动检测尝试 Ollama → LM Studio → llama.cpp → vLLM(通用的 openai 提供者仅限明确指定)。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡