据llama.cpp的b11190版本说明,此次修正针对LFM2音频的Mel预处理。此前的处理方式会使测试语音中的贪心转写与参考实现不同:英语测试为4.5%,日语测试为6.5%;部分日语差异涉及整个词。
修正调整了对数计算、Hann窗和标准差归一化中epsilon的用法。版本说明明确指出,只有lfm2a预处理器采用这些行为,其他音频预处理器不变。
测试使用相同的16 kHz音频,分别取200条LibriSpeech英语语音和200条Common Voice日语语音,以liquid-audio fp32实现作对照。修正后,英语F16和日语F32的贪心转写均达到200/200一致;日语F16为199/200,剩余差异是一个逗号,与参考实现自身的bf16输出一致。相对于liquid-audio的Mel相对L2误差中位数,英语从3.2%、日语从3.9%降至约2e-6。
原始来源:b11190
