素材来源

YouTube 张大仙团队官方频道 & 骚白团队官方频道

我们爬取了张大仙 & 骚白的日常直播录像,从中抽取了共计14局直播对局,共计时长约5小时。

素材示例:

https://www.bilibili.com/video/BV19K411p7Pt?share_source=copy_web

https://www.bilibili.com/video/BV1g54y1B7dt?share_source=copy_web


场景特点

环境

  • 直播间

  • 环境安静,但混入较强的游戏声效,有时有BGM背景音乐

拾音设备

  • 专业麦克风,一般距离主播半臂距离左右

说话人

  • 张大仙、骚白

说话方式

  • 自然语言,语速快,带有很强烈的感情色彩和鲜明的个人语言风格,非字正腔圆。

方言

  • 普通话

内容领域

  • 游戏(大量王者荣耀相关游戏词汇)、闲聊、段子


测试结果

测试时间:2020.06

本场景后面会进行定期重测(1-2个月),关注最新滚动测试报告查看最新结果。



  • 本月开始评测中将剔除谷歌,因为根据往期结果,中文领域谷歌性能不具有参考价值。

  • “搜狗知音平台”已更名为“搜狗AI开放平台”

  • 本月开始新加入阿里的预发模型(需经过更多测试稳定后才会发布到阿里云官网),暂定名阿里云+(用户目前可以调用到的仍为“阿里云”)


简评

  • 可以看到,在直播这种更自由化场景下,各家的语音识别性能均发生大幅度下降,与场景特点中的说话方式、内容领域有较大关系。

  • 一般来说,如果语音识别的准确率低于85%甚至80%,人类阅读识别文本就会产生理解障碍,因此可以说各家的通用语音识别在该场景下,需要垂直优化。

  • 关于垂直领域定制优化的问题,是语音识别产业走向实用的重要方向。现在走得比较快的平台都在发布各种垂直领域模型和定制能力,如果读者感兴趣的话,我们后期可能会梳理一期相关内容进行介绍。

  • 预告:下一期评测场景为直播带货,是语音识别性能集体翻车的一期,与我们之前的测试场景中的优秀性能形成鲜明对比,敬请期待。