展示 HN:Whisper 对 70 岁老人的转录准确率高于 20 岁年轻人
语音助手正对着老年来电者,而假设的风险是语音识别不会听到他们。这一假设是错误的,它掩盖了实际上发生的失败。在 2760 条 Common Voice 片段上进行测量,以年龄段之间的口音、性别和说话者匹配,因此唯一变化的是年龄,并与第二个 3189 条片段的抽样进行对比,该抽样没有控制任何因素:单词错误率过早截止(700 毫秒) 20 多岁 n=920 6.53% 8.0% 60 多岁 n=920 5.23% -1.31pp * 19.7% +11.6pp * 70 多岁 n=920 4.67% -1.86pp * 16.6% +8.5pp * * 说话者自助引导的 95% 区间不包括零 Whisper 对老年说话者的转录准确率更高,而不是更低。并且当堆栈端点在固定静音阈值上时,这些说话者被打断的频率是年轻人的两到两倍半。这一第二发现有一个附带条件,它在发布后出现,并值得在引用这个数字之前阅读:语义转弯模型缩小了大部分差距。与 Pipecat 的 smart-turn v3 在相同片段上进行比较时,+11.6pp 变为 +5.9pp,并且不再排除零(第 3 节)。固定阈值的结果描述了一个真实且常见的配置,而不是每个配置。python3 bench/run.py 重现了这两者。没有 API 密钥,没有开支。 1. 识别惩罚不存在 大型 V3、宽带、说话者级 95% 区间:区间 n spk WER vs twenties twenties 920 606 6.53% [5.77, 7.40] 基线 60 多岁 920 240 5.23% [4.65, 5.86] -1.31pp [-2.33, -0.30] 不包括零 70 多岁 920 116 4.67% [4.12, 5.31] -1.86pp [-2.91, -0.88] 不包括零 每种错误类型随着年龄的增长而减少,因此这不是一个类别掩饰另一个类别:区间 子 删除 插入 20 多岁 5.22% 0.57% 0.74% 60 多岁 4.19% 0.41% 0.64% 70 多岁 3.67% 0.41% 0.59% 特别是删除未增加,如果安静或气音被忽略,这是你期望的结果。并没有被忽视。这不是 Whisper 的伪影。明显的反对意见是,Whisper 的解码器是一个语言模型,因此它可能在修复老年说话者的单词选择,而不是更好地听到他们。因此,使用纯 CTC 的 wav2vec2 对相同片段进行了重新运行:逐帧、贪婪,没有解码器和没有隐式 LM。 区间 Whisper enc-dec wav2vec2 CTC 20 多岁 6.53% 14.23% 60 多岁 5.23% -1.31pp 10.30% -3.94pp [-5.52,-2.40] 70 多岁 4.67% -1.86pp 10.52% -3.72pp [-5.49,-2.08] wav2vec2 的绝对 WER 要高得多(仅 LibriSpeech 训练,没有 LM),因此仅在区间之间的比较有效。效果更大,并且仍然不包括零,这使其在声学中而不是在解码器中。 2. 轮流接听惩罚很大 语音助手通过等待固定时段的静音来判断来电者是否完成。超出该阈值的发言内暂停被视为轮次结束,代理会在某人谈话中途开始说话。WER 对此盲目。模型所收到的单词可以被完美转录,而来电者却每次都被打断。包含至少与此相同长度的内部暂停的发言份额:区间 400 毫秒 500 毫秒 700 毫秒 1000 毫秒 20 多岁 23.3% 17.3% 8.0% 2.0% 60 多岁 41.5% 33.7% 19.7% 8.7% 70 多岁 37.3% 28.6% 16.6% 6.2% 所有六个年龄对基线的差异均不排除零。在 700 毫秒时,差距为 60 多岁 +11.6pp [+7.7, +15.7],70 多岁 +8.5pp [+4.0, +13.6]。机制在于时机。老年说话者的内部暂停次数是年轻人的两倍,并且在其中花费的时间是年轻人的两倍:区间 单词/发声的 暂停/片段 暂停 总计 20 多岁 2.47 1.0 240 毫秒 60 多岁 2.20 2.0 480 毫秒 70 多岁 2.20 2.0 420 毫秒 这并不是一个干净的渐变。60 多岁稍微比 70 多岁被打断,他们的间隔重叠。这显示出一种在 60 岁时出现并保持平稳的效果,而不是一条直线,并且呈现为这种方式而不是平滑的。80 多岁,单独运行,因为与他们匹配会使每个区间缩小八倍,是最明显的例子。只有 14 名说话者存在,因此间隔很宽——但这个效果仍然存在:阈值 20 多岁 80 多岁 差异 [95% CI] 400 毫秒 27.9% 49.2% +21.8% [+6.3%, +36.6%] 500 毫秒 15.6% 40.2% +24.8% [+8.9%, +38.7%] 700 毫秒 4.1% 22.1% +18.1% [+7.9%, +27.2%] 1000 毫秒 0.0% 6.6% +6.5% [+1.7%, +14.5%] 在 700 毫秒时,这是一个 5.4 倍的差距。与此同时,他们的 WER 为 6.24% 对 6.01%——+0.15pp 的差异,其间隔舒适地包含零。这两个发现随着年龄的增长而进一步趋向不同:识别保持平稳,而轮流接听则逐渐变得更糟。结果经过重新抽样。运行整个基准,未经口音匹配——3189 条片段,1434 名说话者,30 种口音而不是 8 种——几乎完全重现了截断率:20 多岁 60 多岁 70 多岁 匹配 8.0% 19.7% 16.6% 不匹配 7.5% 19.3% 16.6% 这是来自一个语料库的重新抽样,而不是独立复制:这两个样本分享了 52% 的说话者,尽管只有 18% 的片段。它表明这些数字不是某一特定抽样或口音匹配的伪影。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡