返回

文章详情

Muse Code 和 Muse Spark 1.2

Hacker News2026年8月5日 19:15

我们很高兴发布 Muse Code(beta),这是一个由 Muse Spark 1.2 驱动的终端编码代理,这是我们最新的模型。这标志着我们向前沿迈出的下一步,预计更大、更强大的模型即将到来。在 macOS 或 Linux 上安装 Muse Code:Muse Code 能够处理大型代码库中的复杂软件工程任务:规划更改、编写代码和验证结果。它可以协调多个持久性子代理来处理每个任务,更快、更准确地解决困难问题,同时减少干预。Muse Code 异步后台代理 Muse Code 在一个简单的代理循环下与一组异步后台代理一起运行,以增强主代理的能力。这些专业的后台代理在每个会话期间保持活跃,而不是为各个任务生成,有助于避免冗余的信息收集。它们执行后续步骤并选择何时向主代理通信。它们的持久性降低了延迟,并减少在困难的多步骤任务中的引导需求。加载演示 运行时设计 Muse Code 使用本地事件日志,其中每个模型调用、工具运行、批准和编辑都被附加。这一单一真实来源使得运行时重放精确且可安全重启:在崩溃后,代理可以精确地从停止的位置恢复。这一能力使 Muse Code 能够处理长期运行的任务,而不被失败所 derail。捆绑技能 Muse Code 配备了几个默认技能。/plan 将任务转化为一个需审批的计划,/grill 在计划上进行压力测试,直到它成立,而 /goal 则朝着成功完成特定目标努力。用户将一个家庭的飞行视频作为 mp4 文件输入终端。Muse Code 解释视频并生成一个视觉丰富的度假屋营销和预订页面。Muse Spark 1.2 Muse Spark 1.2 是 Muse Spark 1.1 的编程专注更新,在代码生成、复杂调试、代码库理解和端到端开发者工作流方面都有所改进。在 Muse Spark 1.2 中,我们在编码任务上显著扩大了训练计算,并扩展了训练环境的多样性。该模型在其他关键领域(如通用代理等)也保持了其优势。有关我们评估的更多详细信息,请参见我们的报告。与 Muse Code 的联合训练 我们与 Muse Code 进行了共同培训 Muse Spark 1.2,以确保模型在配对时展示最佳性能和编码可用性。培训包括拒绝采样的鞍轨迹和目标、压缩和子代理的食谱优化,以及与 Muse Code 工具集的集成,以最大化鞍的兼容性。长时间跨度 Muse Spark 1.2 在长时间跨度的编码任务上进行了广泛的训练,包括整个代码库生成、大型端到端项目和自动研究。它利用规划对工作进行排序,使用目标条件来保持方向,并利用上下文压缩来保留持续进展所需的知识。自我改进 我们还使用 Muse Spark 1.1 生成具有挑战性的编码环境和遵循指令的模板。然后,模型对候选解决方案进行评级,以判断其满足这些要求的程度,产生了可扩展的 Muse Spark 1.2 训练数据集。这个自我改进循环帮助 Muse Spark 1.2 比其前身更精确地遵循复杂指令。案例研究:内核优化 我们测试了模型在 1000 多次工具调用(长达 24 小时)中迭代优化 GPU 内核的能力。利用 Muse Code 的代理编码环境,该模型编写、编译、分析并逐步提高相对于提供的基准实现的内核性能。我们在 NVIDIA Hopper GPU 的 KDA 和 MLA 内核上进行了基准测试。代理继续在提供的基准实现上取得显著改进。基准为 FLA Triton 的 KDA 实现。模型被禁止直接导入第三方内核库,比如 FLA;相反,它们必须应用专业的内核优化知识,将算法实现到 Triton 中,而不是包装现有的实现。Muse Spark 1.2 将一个块并行准备内核与一个顺序的块间扫描配对,将标准融合和分块与 KDA 特定的优化(如在块中点重新中心化门控累积衰减)结合在一起。可用性 Muse Spark 1.2 今天在 Muse Code 和扩展全球访问的 Meta Model API 中可用。我们有很多新计划,包括新的鞍特性和更强大的模型。我们迫不及待想看看你会构建什么!立即开始使用 Muse Code

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡