人工智能从何时开始呢?从20世纪50年代就有了人工智能的概念,从帮助人类解决数学计算问题到今天的无人驾驶汽车。越来越智能化,把冷酷的机器变的可以感知、推断、学习等。能够实现智能化,机器经历了很多的学习环节,数据自然成了学习中不可缺少的部分。我们从数据收集到数据制作来谈谈数据的KPI。
数据来自任何可以释放信息的设备上,如今是云的世界,万物互联分分秒秒都有大量的数据产生。数据科学家需要对数据分析、挖掘、聚合、标注等。数据需要用于开发模型、模型训练,随着数据量的不断增加模型会变的更精准。
我们从人工智能的一个领域来细说数据的事,就是语音识别领域需要的语音数据。语音数据大家都不陌生,无时无刻的伴随在我们身边。人的说话声、动物的吼叫声、汽车的鸣笛声、下雨声、电话铃声、音乐和电视声等等,这些声音针对语音识别都有需要吗?是的,一个智能的机器人如果不能分辩出声音的类别和识别出人的说话声,也就不能叫智能了。在语音识别领域有着很多场景应用产品研究,例如:基础语音识别、语音合成、语言特性、儿童语音、情感和情绪识别、特定场景识别等。
语音数据从自然程度上可以分为两大类,第一是普通话、方言、外语朗读式语音,第二是普通话、方言、外语对话式语音。在这两类数据上我们制作和收集语音数据的同时还要考虑数据源的类别。通常基础的语音识别系统都会使用一定量的基础数据来做模型训练和学习用,然而这些基础数据又该怎样去选择呢?数据库的种类犹如语音本身的类别会有多性,我们需要考虑实际的语音识别产品到底是用来做什么的。其次考虑语音的内容,朗读式和问答式的选择,再细一些就是内容本身体现的特征。例如:命令词、描述语音、无文本语音、情感语音等。数据库的选择直接影响到了整个语音识别系统的性能,语音数据在整个工程里的KPI占比还是很重要的。
人工智能是要让机器趋向人类的智慧,与我们人类学习的语言知识相比,目前的语音数据还只是很小的一部分。数据的收集、标注是门科学,标注完善的数据库已经为语音识别领域做出了贡献和打下了稳固的基础,然而在数据的海洋里还有海量数据没有处理和应用,数据收集后期的标注有将是一个难题。
