2019年全球语音交互市场规模达到13亿美元,预计2025年全球语音交互市场规模将69亿美元,目前以广泛应用到智能家居、车载语音、智能客服等行业和场景。

从功能机时代到智能机时代,人与机器的交互方式一直在变化。尤其是近几年来,语音交互一直是研究的热点,从天猫精灵,小爱音箱到『理解万岁』的TNT,都用到了语音交互。可以说,语音交互在生活中已经是一件非常常见的事情。


行业变革中的语音交互



四年前iphone的智能语音助手siri第一次让人们体验到通过和手机对话就能够完成很多不方便的操作。



2014年底亚马逊发布Echo智能音响,Echo依靠语音命令就可以作为智能家具的控制装置,播放在线音乐,还可以提供各种在线信息和提醒功能。预计到今年年底,亚马逊Echo的总销量将超过2200万台,虽然没有进入中国市场,但是这个数字绝对亮眼。

近几年开始国内外各大互联网公司都开始研发自己的智能音响。智能音响到底有没有价值,这到底是风口来了还是昙花一现?




1963年美国科学家恩格尔巴特用木头和小铁轮制成了第一个鼠标这为后来的windows图形界面奠定了基础。

移动互联网时代,乔布斯和iphone开创了手势触屏和Siri,鼠标键盘和手势交互可能在未来一段时间被语音交互替代。自然语言理解还需要很长的路要走,但是凭借简单的语言就能操控智能终端的使用场景,在可预见的时间内就会到来。

交互场景的变革又会带来方法论了一系列重大变化。语音交互可以增加互动速度和效率,提高个人生产力,大大解放用户和交互界面的关系,这是一场人机交互的革命。其实智能音响最核心的门槛,是语音识别的云服务平台。

尽管目前市面上的智能语音交互功能多数需要【唤醒词】唤醒应用,这使得人机交互对话被割裂,不能自然顺畅地对话交流,无法带来完整的交互体验。但不可否认,AI语音智能技术还是为生活娱乐产品的应用操作带来了极大的便利。


语音交互适合什么场景和设备?
家居场景

家庭环境比较封闭和私密,并且噪音少,是实现语音交互的很好环境。




01电视:机顶盒视为和电视同类,电视本身普及率及使用频次高,生态内容丰富使得其操作相对复杂,但又受限于遥控器这种低效的输入方式,使得电视成为最适合进行语音改造的设备,但是受囿于价格昂贵,尝鲜门槛高,所以改造的节奏相对较慢。

02平板:市面上目前流行的带屏音箱,更合适的说法应该是语音平板。

03音箱:音箱因为其低廉的成本(无需屏幕和视频资源)而率先引爆市场。




04灯:虽然指令简单,但是因其操作频繁且需要起身走到面前操作,跨空间成本高,使得灯具被语音化的诉求也较高。但是灯最适合的语音化是本地离线指令,也即通过“开灯”、”关灯”本地直接识别并控制灯具,无需加唤醒词,更简洁更快速。

05空调:空调因此相对高频的使用和较为复杂的指令,和灯具类似具备一定的语音化必要。

06冰箱:基本没有语音化必要,除非冰箱承载的功能做了极大延展,例如冰箱增加屏幕,同时作为餐厅的电视使用,那么其语音化的必要性与电视一致。


出行场景



汽车驾驶:随着车联网和智能汽车的兴起,越来越多的功能被搭载在车机上。车载语音技术的独特优势——帮助驾驶者降低对车内设备的操作依赖,增加驾驶安全系数。

车载场景相对比较私密,但是噪音相比家庭场景较高(尤其是当开窗之后)。但是因为开车时手和眼睛都被占用,语音成为交互的最佳选择,如接听电话、开关车窗、广播音乐、路线导航等语音指令,这就使得驾驶更加安全,可以更专注于路况。




智能耳机:耳机作为本身就是穿戴中的一种产品,携带方便,决定了它有更多自然的使用场景,耳机这样私人且私密化很强的产品,无论人们是在上班通勤、户外运动还是在旅行时也能保持更高的使用率。

戴在耳朵上的耳机,离人的语言器官很近,当你和耳机进行语音交互的时候,更像是和朋友交谈。使用耳机来与手机的语音交互模式连接时,是不是也可以使用一些动作来唤醒它,例如:去敲击耳机,通过这类动作去唤醒可能会比喊它更加的自然,即使在公共场合也会避免尴尬出现。


医疗场景

语音识别在医疗中的应用主要集中在直接将语音转成结构化电子病历,方便医生随时查阅,大大减轻了工作量。可以为医生节省手写病历的时间,同时也可以为医患纠纷提供材料佐证。




语音识别技术已经在以美国为首的西方国家成功运用到医院放射科、病理科、急诊室等部门中,临床中使用语音识别录入的比例已达到20%以上,并能够明显降低医生工作强度,提高工作效率,降低了医院日常运作成本。



企业场景



智能客服:智能客服分为语音呼叫中心和在线客服两块来看。在客户服务行业,当用户请求接入后,先由智能客服机器人解答80%的常见问题,剩下20%复杂问题再由真人专家客服来回答解决。智能客服机器人创造的整套流程已经完全改变了整个客服行业的劳动力结构和工作方式。


教育场景

在少儿教育场景,语音可以发挥的空间会非常大,一方面少儿的文字学习还没有非常完善,因此在信息录入和互动方面,语言是更低门槛的交互选择,另一方面,语音可以进行中英文发音的测评和纠正,对少儿的学习成长价值更大。




互动语言学习:针对语言发音,进行实时评测和纠正,提升学习效果

互动动画:在动画中插入场景化语音交互,寓教于乐,提升少儿的沉浸感。


机器人



语言交互是人类日常最常用的交互方式,机器人自然要集成语音交互的功能。机器人分为消费级机器人和商户级机器人,消费级机器人使用语音传递情感和提升交互效率,商户级机器人使用语音传递品牌感和提升服务效率。


安全与鉴权



声纹是无感知的身份识别,声纹识别的理论基础是每一个声音都具有独特的特征,通过该特征能将不同人的声音进行有效的区分。目前利用声纹来区分不同人这项技术已经被广泛认可,并且在刑侦破案、罪犯跟踪、汽车声控锁、身份证、信用卡的识别等领域中都有应用



语音交互未来趋势
无屏化

语音助手会在越来越多没有屏幕的设备上出现,或者说语音助手会朝着纯语音(VUI)的交互方式发展。

我们先确认一点,屏幕作为我们现在和智能设备交互的主要渠道,它十分重要。我们也非常习惯这种交互方式。为了更好地和屏幕进行交互,我们发明了 GUI(图形用户界面),我们创造了各种各样的交互,如:点击、滑动、触摸、长按等等。我们太习惯,太喜欢这种交互方式了。甚至看到 App 图标上的小红点就手痒痒,忍不住去点。

所以,当我们面对一个带有语音助手的手机时候,我们会去使用使用语音助手么?太难了!!

原因很简单,屏幕上几乎所有的设计都是在诱惑你去点击、滑动或者完成更复杂的『手指交互』。

那么 无屏化设备 /弱屏化设备 是最适合语音助手发展的平台,比如屏幕很小的手表、手环。或者连屏幕都没有的音响、家居助手、智能戒指等等...

这些平台的可交互性或许比屏幕低,但是这些平台的语音助手给用户更多的沉浸感,自然地更容易养成『与设备对话 』这样的用户习惯。


信息去中心化

如果今天你问一个语音助手『 帮我找一家酒店 』,它回答『 不会 』,有时候并不是语音助手不能理解酒店这个词,而是他们没有接入相关的信息,没有相关的信息可以提供,最后只能去 X 度搜一下。『 非中心信息 』或者 『 非中心功能 』现在已经是语音助手的大趋势了。Siri 开放 Api 允许部分开发者接入也是不得已的事情,因为它根本没有你微信内、滴滴内的信息,只有开放自己的 Api ,才能为 Siri 获得更多的『 非中心信息 』。


情感化的语音

首先语音相比于点击屏幕,它更加地自然。小孩儿吃不饱会哭,痛了会哭,天然地『 知道 』用声音来表达自己的需求。

另外语音代表着更快地速度。成年人口语表达 230 字/分钟非常正常,在辩论队的时候,千字三分三十秒 是标准。这样的速度比绝大多数人打字的速度都快。因为语音输入能带来效率上巨大的提高,所以现在语音输入慢慢占据消费者市场。如果你仔细观察的话,会发现现在几乎每一家的输入法上面都带有语音输入。


行业展望

在阿里达摩院的新十大科技趋势中提出,随着端云一体语音交互模组的标准化、低成本化,会说话的公共设施会越来越多,未来每一个空间都至少会有一个可以进行语音交互的触点。

我们距离实现语音识别技术的真正潜力还有一段距离。这既适用于技术本身的复杂性,也适用于融入我们的生活。此外,语音识别仍限于少数产品,但技术发展速度非常惊人。