LoRA Speedrun – 用于微调技术的公共墙时钟排行榜
你能多快将 Qwen2.5-1.5B 使用 LoRA 微调到 GSM8K 上达到 ≥ 57% 的准确率 — 在单个 L40S 上?这是针对微调的修改版 nanogpt:一个冻结的任务,冻结的硬件,以及一个公共的墙时钟记录排行榜。每个记录在计数之前都需在相同硬件上独立重新运行 3 次,并使用新的种子。尝试和验证是免费的:官方计时在 Modal L40S 沙箱上进行,Modal 的免费每月计算积分覆盖完整运行 —— 所以任何人都可以参与,任何人都可以用一条命令重新验证任何记录。排行榜 当前记录:6m 05s,由 @Saivineeth147 创造 — 序列打包 + 仅完成损失遮罩,2 个周期。与 #0 的 LoRA 配置相同;在更高准确性下速度约 2 倍。 # 日期 作者 训练时间 GSM8K Δ 技术 0 2026-07-18 @Saivineeth147 11m 57s 59.4% — 基线:在所有线性层上使用普通的 LoRA r=16,3 个周期,余弦学习速率。没有技巧。 (报告) 1 2026-07-18 @Saivineeth147 6m 05s 61.1% −49% 序列打包 + 仅完成损失遮罩,2 个周期。与 #0 的 LoRA 配置相同;在更高准确性下速度约 2 倍。 (报告) 完整历史记录及验证报告:records/RECORDS.md 任务(冻结) 基础模型 Qwen/Qwen2.5-1.5B(基础,不是指令) — 冻结 训练数据 GSM8K 训练分割(7,473 个例子) — 唯一允许的数据 目标 ≥ 57.0% 在 GSM8K 测试中的准确匹配(0-shot,贪婪,严格 #### N 抽取) 硬件 1× NVIDIA L40S(48 GB) — Modal 沙箱,网络阻断 指标 你的训练运行的墙时钟时间。越低越好。 约束 基础权重冻结;仅 PEFT 适配器,≤ 30M 可训练参数 机器可读的规格:spec.yaml。完整规则:TASK.md。你可以控制其他的一切:LoRA 等级和位置、量化、学习率调度、序列打包、数据子集选择和排序、自定义内核、停止的时机。 如果你能清楚地提出目标,则在 1,000 个精心挑选的示例上训练 90 秒。 为什么会有这个 LoRA/QLoRA 是大多数现实世界微调的实际方式,技术空间迅速发展 — DoRA、rsLoRA、PiSSA、LoRA+、NEFTune、Unsloth 内核、等级自适应方法 — 但没有对抗性的、可以互相比拼的公共竞技场。在不同的模型、数据和硬件上,论文报告的数字不可比;没有任何东西是可以比较的。 nanoGPT 的速跑为预训练解决了这个问题,并产生了真实的科学(Muon 从中诞生)。这个仓库在参数高效微调方面做了同样的事情:一个冻结任务,一张 GPU,墙时钟时间,需提供收据。 快速开始 官方硬件运行(免费)。创建一个 Modal 账户,然后: git clone https://github.com/Saivineeth147/lora-speedrun && cd lora-speedrun pip install modal pyyaml && modal setup # 一次性浏览器认证 python harness/modal_verify.py --prefetch # 一次性:在卷中缓存模型 + 数据 # 一次针对确切规格硬件的基线的计时、评估尝试: python harness/modal_verify.py --submission submissions/000-baseline --runs 1 # 完整记录样式验证(3 个新种子,全部必须通过): python harness/modal_verify.py --submission submissions/000-baseline --runs 3 本地迭代(可选)。任何 24 GB 以上的显卡均可快速进行基线实验 — bash scripts/setup_gpu.sh,然后 python harness/run_submission.py submissions/000-baseline --runs 1。 本地时间不是官方的;排行榜时钟是 Modal L40S。然后复制 submissions/TEMPLATE/,使其更快,并打开 PR。请参见 CONTRIBUTING.md。 记录的验证方式 你打开一个 PR,附带你的训练脚本、配置、笔记和自报告的数字。CI 静态验证代码,并通过自动的 Claude 安全屏幕审查差异(数据外流尝试、网络使用、工具包篡改、测试集接触)并公开发布其发现。维护者会审查代码,然后评论 /verify — 这会在规范 L40S 上的网络阻断 Modal 沙箱中使用新种子重新运行你的提交 3 次。所有 3 次运行必须通过目标;官方时间为平均值。工具包审核适配器参数计数并重新验证模型/数据内容哈希(反篡改),验证报告会发布在 PR 上并提交到 records/verifications/ 附有接受/拒绝的理由。完整协议、评分标准和威胁模型:JUDGING.md · SECURITY.md。 目前还没有人提出的想法 已经被采用的:序列打包 + 仅完成遮罩(记录 #1)。1 个周期激进的学习速率调度 · 数据修剪(在最难的 2k 示例上训练?) · 块对角/变长打包注意力 · QLoRA NF4 和 bf16 的权衡 · rsLoRA / DoRA / PiSSA 初始化 · LoRA+(A/B 的不对称学习速率) · NEFTune 噪声 · 课程排序 · 等级/位置搜索(仅 MLP 与仅注意力) · torch.compile · Unsloth 内核 · Liger 内核 · 融合交叉熵 · 更聪明的短期运行热身 认领一个,击败 6m 05s,让你的名字出现在排行榜上。 常见问题解答 为什么是 Qwen2.5-1.5B?它不是在数学上预训练过吗?可能,像每个现代基础模型一样。但这无关紧要:目标是一个锚点,而不是关于数学发现的声明。比赛才是有趣的部分——这与 nanoGPT 速度竞赛的原因是相同的。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡