模型 4:我们迄今为止在 Mac 上本地口述和清理的最佳模型
在其历史的大部分时间里,口述意味着你的声音要传输到其他人的计算机上。我们构建了本地模式,以结束这种权衡,模型 4 是我们迄今为止最强有力的论据,表明你不必在质量和隐私之间做出选择。今天,我们推出了 Epilude 模型 4,这是本地模式背后的第四代设备模型。这是自本地模式推出以来质量提升最大的版本:下载大小仍为 1.5 GB,速度不变,但写作能力有了可度量的提升,你所说的任何内容都不会离开你的 Mac。模型 4 的本地模式直接在你的 Mac 上运行两个模型。一个语音模型将你的声音转换为文本,而一个清理模型将原始文本转变为你实际会发送的写作:它去除填充词,修正标点,解决演讲中自然出现的错误开头和句中修正,并匹配你要求的语气。模型 4 是清理模型的新一代:我们自己的微调,基于 Qwen 系列模型,专门训练用于口述清理。在这个版本中,语音模型没有变化。它们一起大小与之前相同,并在相同的硬件上以相同的速度运行。模型规格 模型 4 下载大小 1.5 GB,单次下载 硬件苹果硅 Mac 全 AI 清理 16 GB 内存或以上的 Mac 解码 贪婪,完全确定性 连接完全离线工作 唯一重要的错误是最严重的错误 平均质量并不是衡量口述模型的正确方法。一个 95% 时间内写作优美的模型,如果偶尔将“我们星期四见”变成“我们星期一见”,就比无用还要糟糕,因为你会停止信任它写的任何东西。因此,我们根据我们称之为关键错误的零容忍错误类别对我们的模型进行评分:任何更改您所说内容含义的输出,或泄漏模型指令到您的文本中。我们的发货规则是绝对的。新模型与其替换模型相比,不得引入单个新关键错误,无论平均表现有多好。我们的评估方法 我们维护一个内部基准,涵盖 90 个口述场景,涉及标点、格式、自我修正、语调控制、多语言和混合语言演讲。每个候选模型都会反复运行完整的测试套件,每个输出由前沿模型评审人员进行多次独立投票评分。只有在每次重复评审运行中通过,场景才算通过,我们对相同的输出进行重新评分,这样评分噪声就不会被误认为是模型变化。我们不发布此基准,其结果也无法与外部任何内容相比较。但这就是我们确保问责的方法,也是每个 Epilude 模型必须达到的标准才能发货。结果 在该内部基准上,模型 4 通过了比模型 3 多九个场景,关键意义错误减少了 56%:内部基准 模型 3 模型 4 通过的场景数,90 个中 69 78 关键意义错误 9 4 指令泄漏,220 输入压力测试 0 0 只有在每次重复评审时都通过,才算一个场景通过。改进集中在口述模型通常出现问题的地方:中间句子自我修正、日期和星期、混合语言演讲,以及应该保持你的保留而不是将其消除为公司平淡的随意语气。展示起来最简单的是:你说模型 4 写道“那么我们可以把会议从星期一改到其实让我们做星期四吗?” 我们可以把会议改到星期四吗? “把邀请发送给萨拉不,等一下发给索非亚” 把邀请发送给索非亚。 “我今晚分享文档,等下我们可以讨论明天” 我今晚分享文档,等下我们可以讨论明天。 “我有点觉得我们也许应该等到星期五” 我有点觉得我们应该等到星期五。 早期的版本有时会在第一句话中保留两个日期,或在第二句中使用错误的名字。第三版保持在你说的语言中,而不是被无声翻译。最后一句,经过随意风格的清理,保留了“有点”,因为你说过并且是有意的。我们在构建中学到的东西 本次发布中的两个发现将塑造我们未来训练的每个模型。首先,标签质量胜过数据量。当我们审查训练数据中最难的示例时,我们发现相当多的例子在以自动化过滤器无法察觉的方式教模型错误的教训。修复这些示例,而不是添加更多数据,解锁了上述自我修正的改进。其次,我们故意发布了一个平均值。我们训练了几个在随机种子上仅有所不同的模型 4 完全相同的运行,发现每次运行都有自己的一小组稀有失败模式。我们发布的模型是这些运行的加权平均。它的表现超过了每个单独的运行,并没有带上它们各自的个性。加权平均是一种已知的研究文献中的技术;让我们惊讶的是,它在选择赢家方面的表现有多么明显。限制
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡