PVQA 1.9 发布

PVQA 1.9 发布。我们在两个公开 MOS 语料库上将它与 ViSQOL 做了对比。数据如下。

方法:从每个语料库取音频片段,用 ViSQOL 和 PVQA 分别计算每个片段的 MOS,再将预测 MOS 与语料库的主观 MOS 评分进行比较。

语料库 片段数 方法 r rho 在 ±0.5 MOS 内
NISQA 1,200 ViSQOL 0.69 0.64 48%
PVQA 0.71 0.70 55%
TCD-VoIP 384 ViSQOL 0.82 0.82 68%
PVQA 0.91 0.91 73%
both 1,584 ViSQOL 0.74 0.73 53%
PVQA 0.78 0.78 59%

r 为 Pearson 相关,rho 为 Spearman 相关,“在 ±0.5 内” 指预测 MOS 落在语料库主观评分 ±0.5 之内的片段占比。

在全部三组数据上,PVQA 在 r、rho 与「在 ±0.5 内」三项指标上均领先 ViSQOL。差距最大的是 TCD-VoIP:r 从 0.82 提升到 0.91,落在 ±0.5 MOS 内的片段占比从 68% 提升到 73%。TCD-VoIP 围绕真实 VoIP 损伤(丢包、抖动、编解码器伪影)构建,而这正是通话质量分析器真正发挥价值之处。

NISQA 更难:条件混杂、背景噪声、说话人众多、录音多样。整个行业在该语料库上都低于 0.75。PVQA 在 r、rho 与「在 ±0.5 内」上仍然胜出,只是优势幅度更小。

两个语料库均为公开数据,没有精挑细选的测试集。任何人都可以重跑这一对比。

PVQA 是 Sevana 的非侵入式感知语音质量分析器。详情请联系:info@sevana.biz。