返回

文章详情

展示 HN:在单个 46GB GPU 上的 6M-token 可移动窗口

Hacker News2026年7月28日 04:11

查看 PDF 摘要:改善语言模型意味着重新训练它:巨大的计算需求,每个周期生成一个新的不透明模型,非确定性输出。我们采取了相反的路径:模型保持不变,经过验证的解决方案的持久记忆在其旁边不断增长。一旦一个问题家族被解决并通过独立验证步骤(从不咨询答案钥匙)通过,每个该家族的新实例在零生成 token 的情况下被准确回答,结果是比特上完全相同,确定性。跨越九个问题家族的 180 个新实例,来自四个供应商的四种架构——密集型和混合专家——在每个答案的生成 token 方面均以 180/180 的成绩结束:执行限制能力与参数扩展解耦。负控制完全归因于记忆能力:一旦清空,它什么也解决不了。相同的验证后存储合同也适用于开放式推理:在所有四个模型中,88/88 一致性门控接受,机器检查的形式证明,以及 77/80 的推理方法转移。记忆选择耗时 1.4 微秒;完整重用在 6-23 毫秒内完成,耗电 36 毫瓦时。在一个有 4,500 项验证库的情况下,近似相似性检索错误选择物品的概率为 94.3%,而精确寻址则没有错误。该库还充当工作上下文,其规模没有任何已经发布的引擎匹配:在单个 46GB GPU 上的 6,000,000-token 可移动窗口,保持平稳内存,而 vLLM 在 30,399 token 处停止,SGLang 在超过 32,000 时静默截断。在已发布基准测试中,前沿模型在从零基础推理方面远远领先于任何 12B;而对于这个系统已经解决和验证的所有内容,比较则反转:一次前沿 API 调用在每个查询上进行一次全新的生成传递,永远如此,而经过验证的重用则不需要 token,并在每次返回相同的比特。此报告伴随有一个公共测试平台,提供免费的限速访问:这个 https URL。评论:行业经验报告,共 14 页,包含 8 个图表。公共测试平台:这个 https URL;伴随的仓库带有 SHA-256 来源清单:这个 https URL。主题:计算与语言 (cs.CL);人工智能 (cs.AI);信息检索 (cs.IR);机器学习 (cs.LG);性能 (cs.PF)。引用:arXiv:2607.23806 [cs.CL](或 arXiv:2607.23806v1 [cs.CL] 针对此版本) https://doi.org/10.48550/arXiv.2607.23806 arXiv 发布的 DOI 通过 DataCite(待注册中)。提交历史:来自:Sietse Schelpe [查看电子邮件] [v1] 2026年7月26日星期日 19:08:33 UTC(1,421 KB)

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡