摘要
Hume AI 发布了 Real World VoiceEQ,一个面向语音 AI「人类化交互质量」的评测基准。根据博文,该基准评估 40 多个专有及开源语音模型,覆盖 ASR、TTS、语音到语音和语音理解等任务,包含 15 个以上评测维度与 60 多项指标。
博文称,该项目基于超过 100 万份人工评分,重点考察文字转录中容易丢失的信息,例如语调、情绪、说话人身份及背景语境。其结论是:不同模型的能力趋于专门化;部分语音模型在「说」方面优于「听」;传统基准可能高估复杂真实环境下的表现;涉及主观听感的评估仍需要人工参与。
这类基准若被广泛采用,可能帮助开发者更具体地比较语音系统在噪声、口音、情绪表达与长对话中的表现,而不只依赖词错误率和延迟等指标。
原始来源:Hugging Face 博文