返回

文章详情

Inflect-Micro-v2:在939万参数下完成语音合成

Hacker News2026年7月26日 00:36

Inflect-Micro-v2 在不超过1000万参数的情况下完成本地文本到波形的语音合成。具备固定语音的英语TTS,支持确定性种子、长文本处理,支持CPU或CUDA推理。Owen的备注:我独立构建并资助了Inflect v2。如果这个版本能够找到真正的观众,我希望继续这个项目,推出更广泛的v3,可能会包括更多语言、声音和稳定性改进。如果这个模型对您有用,请在Hugging Face上点赞,这确实能帮助更多人发现它。可部署参数:9,356,513 · 37.53 MB FP32 · 24 kHz 单声道输出。Inflect v2在两个尺寸上使用一个公共API:Micro优先考虑质量,参数低于1000万;Nano优先考虑占用空间,低于400万。探索这个模型卡 从这里开始 技术细节 听 听架构 评估 控制和长文本 选择Micro或Nano 数据和适配 在本地运行 导出和量化 包装地图 评估和原始协议 限制 部署指南 听 这些是保留的文本生成,而不是训练音频的重建。每个转录以发送到公共前端的形式准确显示。测试 精确转录 生成的音频 对话 直到后来我才意识到实际发生了什么。标点 首先,关闭窗口;第二,关掉灯;最后,锁上门。数字 包裹重为12.6公斤,于7月21日到达。名字和地点 格温多琳在卢布尔雅那外拍摄了桉树。技术 该系统运行在三个核心组件上,它们必须保持同步。评估没有单一指标可以捕捉到TTS质量。Inflect v2分别报告人类偏好、预测的自然度、多ASR可懂度、完整占用空间和运行时间,而不是将它们压缩成一个无法验证的分数。社区偏好 ↑ UTMOS22 ↑ 两个ASR的语义WER ↓ 完整的FP32权重 ↓ 4线程CPU吞吐量 ↑ 66.2% 4.395 3.99% 37.53 MB 6.28×实时。标题行始终指的是Inflect-Micro-v2。详细的竞争者结果和协议边界保持可见。比较集。结果包括KittenTTS Nano、Piper Low和Supertonic 3,它们都是被建立的紧凑或本地TTS基线,具有比两个Inflect版本更大的可部署权重占用空间。权重大小在包级别进行比较,且没有单一指标被视为整体优越性的证明。1. 人类盲偏好 Inflect-Micro-v2在最终匿名社区研究中记录了66.2%的偏好率(21胜·10负·3平)。系统是隐藏的,左右顺序是随机的,平局计作半个胜利。这是描述性的社区证据,而非正式的MOS。2. 预测自然度与占用空间 该UTMOS22运行为每个声音使用了500个相同的未见提示。KittenTTS和Piper是权重相等的两个声音均值;观察到的声音范围以须状显示。Supertonic 3步的报告低于绘制范围,而不是使其他系统的结果扁平化。Inflect-Micro-v2:4.395 UTMOS22,95%自助置信区间4.381–4.408。UTMOS22是一个学习预测器,而不是人类MOS。3. 未见文本的可懂度 标题分数是每个系统Qwen3-ASR和Nemotron 3.5语料库WER的权重均匀平均。Whisper由于在一组其他可懂的Supertonic 8步剪辑中产生大量插入幻觉而始终被排除在标题之外。它并没有被删除:完整的三ASR证据仍然保留在下面。打开完整的三ASR审计 系统/声音 Qwen3-ASR ↓ Nemotron 3.5 ↓ Whisper large-v3 ↓ Inflect-Micro-v2 2.52% 5.45% 2.73% Inflect-Nano-v2 2.79% 5.63% 2.65% KittenTTS Nano · Bruno 2.15% 3.96% 2.17% KittenTTS Nano · Hugo 2.39% 3.80% 2.11% Piper Low · Danny 2.62% 5.60% 2.55% Piper Low · Ryan 2.81% 5.51% 2.87% Supertonic 3 · M2 · 3步 3.03% 6.04% 3.22% Supertonic 3 · M2 · 8步 2.05% 3.56% 8.08% 对于Inflect-Micro-v2,单独结果为2.52% Qwen3-ASR,5.45% Nemotron 3.5,和2.73% Whisper large-v3。前述三个模型的均值,3.57%,仅保留为描述性的审计值,而不作为标题分数。打开评估者的鲁棒性和错误类别诊断 这些视图是诊断,而不是其他排行榜。它们显示了识别器不一致的地方以及哪些提示类别仍然产生可恢复的转录错误。4. CPU运行时间 两个Inflect版本在CPU上的合成速度均舒适快于实时。管理参考运行使用了Hugging Face的CPU升级实例(8 vCPU,32 GB RAM),具有四个框架线程,端到端的文本到波形时间,以及100个固定的Modern400提示。记录了三次完整的传递;排除了第一次缓存构建传递,并对表格进行了第二和第三次传递的汇总。版本 稳态RTF ↓ 音频/墙时间 ↑ Inflect-Micro-v2 0.1593 6.28× Inflect-Nano-v2 0.0933 10.72× 这些是来自公共PyTorch运行时的包级结果,并不是声称Inflect是最快的紧凑TTS系统。硬件,

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡