返回

文章详情

鸟类1.5:从自我搭建到自我改进

Hacker News2026年8月19日 14:48

今天,我们推出了鸟类1.5,这是通过端到端自我改进构建基础模型的重要一步。鸟类1.5将鸟类1.0中引入的自我搭建框架扩展为更完整的自我改进循环:模型提出新任务,生成特定任务的支架,并为强化学习生成解决方案,从而不断创造新的学习体验以供改进。鸟类1.5涵盖了三种模型规模:397B MoE,35B MoE和9B稠密。旨在在推理、代理和编码任务中实现强大的通用智能,鸟类1.5在与同类大小的开源模型的广泛基准测试中实现了最先进的性能。鸟类1.5-397B在Terminal-Bench 2.1上得分86.1,在DeepSWE上得分56.0,与Claude Opus 4.8(85.0和59.0)的性能相当,同时超越了类似规模的领先开源模型,包括GLM-5.2(82.7和46.2)和DeepSeek-V4-Flash-0731(82.7和54.4)。在另一端,鸟类1.5-9B及其量化版本鸟类1.5-9B-Mobile可以轻松部署在iPhone和Android设备上,同时显著超越更大的模型如Gemma 4-31B和Qwen 3.6-35B。在旗舰规模上,鸟类1.5-397B在Terminal-Bench 2.1和DeepSWE上分别获得了86.1和56分,在这两个基准上与Claude Opus 4.8相当,并超越了类似大小的领先开源模型,包括GLM-5.2和DeepSeek-V4-Flash-0731。鸟类1.5-35B在所有编码和代理基准测试中显著超越其类似规模的对手Qwen 3.6-35B,并且尽管每个token仅激活3B参数,但它在代理编码任务上与稠密模型(Gemma 4-31B和Meta的Muse Glimmer-30B)的表现也相差甚远(Terminal-Bench 2.1上68.5对43.4和51.7;SWE-Bench Verified上79.0对52.0和76.0)。能够边缘部署的鸟类1.5-9B也取得了相当强劲的结果,在Terminal-Bench 2.1上获得47.0,在SWE-Bench Verified上获得70.6。尽管是一个紧凑的9B参数模型,但其性能与远大于的模型如Gemma 4-31B和Qwen 3.6-35B相当或超越。通过自我生成任务、支架和解决方案实现自我改进鸟类1.5通过扩展自我改进循环,从支架和实现优化扩展到共同优化任务生成、支架构建和解决方案实施。鸟类1.5不断生成新的训练任务,发现有效的解决策略,并通过强化学习改进政策,而不是依赖固定的人类策划任务和手动设计的支架。每个训练周期分为三个阶段。在给定环境或代码库、有关任务类型的高级指令和访问模型之前的任务解决历史的情况下,系统提出逐渐更难的任务,超越模型已经解决的问题,暴露能力差距并持续推动训练边界。对于每个任务,模型生成或优化一个特定任务的支架——用于接近问题的指令、工具、分解策略和编排。根据任务和支架,政策产生解决方案。在整个三个阶段中,来自实现的奖励被传播,因此系统不仅学习产生更好的解决方案,还学习生成更有用的训练任务并构建更有效的支架。在训练中重复这一过程,形成一个封闭的自我改进循环,其中更强的政策能够生成更困难和更具信息性的任务,演变的支架发现更好的方法来引发模型的能力,更高质量的实现提供越来越有效的学习信号。鸟类1.5持续扩展自己的课程,适应其解决问题的策略,推动推理、编码和代理任务的持续能力提升。任务奖励对于问题→支架→实现的设置,我们使用三个信号定义任务奖励:有效性、边界难度和新颖性。我们让q表示生成的问题,s表示其支架,{ au_i}_{i=1}^{N}表示一组解决方案的实现。我们定义: R_{ ext{task}} = V(q,s) imes D(q,s, au) imes N(q)。这里,V测量生成的任务和支架是否形成有效和可验证的学习环境,D测量基于实现性能,该任务是否接近模型当前的能力边界,而N测量与之前生成或训练过的任务相比的新颖性。乘法的公式鼓励提议者生成同时满足这三种属性的任务:有效、适当。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡