本文总结于平线智能座舱团队-杨超在深蓝学院关于智能座舱中的多模语音交互的公开课。

智能座舱的介绍

汽车座舱是指车内的驾驶和乘坐空间,智能座舱,及智能化的汽车座舱。行业内目前还没有关于智能座舱的标准定义。我们可以简单的说,智能座舱通过配备智能化和网联化的车载产品,使得“人-车-路-云”之间的交互体验更加丰富,是集“家居,娱乐,工作,社交”功能为一体的智能移动空间。


图:智能座舱的产品展示

智能座舱的功能特点
智能座舱通常包括中控屏,液晶仪表、后座娱乐等多块屏幕,用于增加人与座舱的信息交互;基于多组摄像头和麦克风等传感器,通过智能算法实现了语音交互,主动感知等功能;利用通信网络,智能座舱实现了车云互联和车车互联,支持各类行驶和生活服务。
智能座舱的发展趋势
车机目前正从单一的中控屏转向全车智能屏,使用的芯片算力更强大,UI设计更加现代化,交互流畅性更高。
摄像头和麦克风的数量增多,精度增大,有助于算法的精确度提升,通过采用更强的智能算法,实现了面部识别,视线追踪,多模语音等功能。
自动驾驶的发展为座舱内的交互带来新的机遇。在L4自动驾驶之前,我们在设计交互方案时需要考虑驾驶员的驾驶安全性,达到L4之后,在大部分场景下不需要人去接管驾驶的,这时候需要思考车内人员之间行为的变化以及人车交互的新模式。

智能座舱的语音交互


语音交互应用的发展
首先,语音具有很广阔的应用场景,而语音交互则是语音应用中的一个很重要的方向。在上世纪90代,电话客服领域就已经有了语音交互的商业化应用,但是受制于数据,算力、算法以及硬件形态等条件,语音交互相关的应用范围比较受限,直到21世纪后智能手机助理和智能音箱的出现,极大地推动了语音交互的发展。
对于车载语音交互,在2000年左右已经有一些基础功能比如拨打电话号码支持使用语音,但主要用于高端车。在2018年之前,车载语音交互大多是基于后装产品比如智能后视镜,2018年之后,出现许多车型搭载了前装语音交互功能。


语音交互的框架
语音交互在不同产品中根据其场景特点也存在差异,因此在技术实现上存在一些区别,一是声场环境不同,比如手机助理只需要近场的识别,而音箱和车内还需要支持远场的识别。二是对话领域的不同,如在智能家电主要是设备的调节,而在车上除了对车内设备的控制外,还需要覆盖常用的音乐和导航功能。虽然存在这些差异,但是语音交互的整体流程是类似的,其系统框架往往包括:通过前端信号处理从复杂的声学环境中提取出我们需要识别的说话人声音;通过语音识别将声音转化为文本;通过语义理解解析出说话人的意图和关键信息;通过对话管理结合上下文数据、应用数据、用户数据,产生系统动作并生成响应;最终通过语音合成生成音频回复用户。
智能座舱语音交互的场景特点
在智能座舱中,声场环境相对复杂,可能包含背景人声,手机声,风噪胎噪空调等噪声;但另一方面,车内空间在设计时是确定的,更有利进行声学定位和语音分离,这是智能座舱语音交互相对于其他空间不确定场景的优势。在交互领域方面,智能座舱中最常用的场景是设备控制,导航和媒体娱乐三个方面。


智能座舱语音交互技术
智能座舱的语音交互技术可以分为语音前端和语音后端两部分,前端包括VAD(语音活动检测),回声消除,噪声抑制,声源定位,增益控制等;后端则包括了语音识别,语义理解,对话管理,语音合成等。
首先是前端信号处理技术,因为车内的环境通常比较复杂,会有音乐,聊天声等各种噪音。首先要进行预处理,消除直流部分,通过回声消除去除设备播放的声音干扰。
对于混合的人声,需要进行分离,在车内,由于各个座位位置是固定的,可以利用波束形成对各个位置的声源进行定向增强。
对于分离后的声音,可能还包含着其他噪声,需要再通过噪声抑制算法进行去除,最后使用增益调整算法调整声音能量,得到适合语音识别的音量。
语音识别技术主流技术可以分为两类,第一类方法以Kaldi为代表,基于细粒度声学单元的建模,通过多层各自建模,利用FST构建系统从声学单元序列到文字序列的转换;另一种则是以Wenet为代表,直接字级别的建模单元,使用Transformer的模型架构去构建端到端系统。由于后者的系统和流程更加简单,解码方案成熟,在10万小时以上的工业量级训练数据上性能优秀,成为了目前工业界最流行的方案。
语义理解技术是为了提取文本的意图和关键信息,工业界的常用方案是同时使用规则匹配和神经网网络模型,规则匹配可以有效的确保关键说法百分之百的召回,并且适合快速修复错误,统计模型则可以提高对泛化说法的覆盖。
对话管理是根据语义上下文以及资源去生成系统动作,由于不太容易用一套框架进行统一,所以里面有较多场景相关的硬编码的逻辑。
语言生成在学术界有很多研究,但由于基于统计模型可能会产生意想不到的结果,实际产品中用的比较多的仍是基于更可控的规则模板的方法。
语音合成在这几年取得了非常大的进展,一般会使用声学模型+声码器的两段框架,两者都采用神经网络技术,目前效果已经达到和人声无差别。

智能座舱的多模交互

在车内,除了语音的信息还有很多其他模态信息,如车内人员的视线、手势、行为、情绪和疲劳状态等。传统的人机语音交互并没有利用上这些信息,目前很多新的交互研究便是在探索如何结合这些信息来提供更好的体验。

多模交互的应用

多模态的第一个功能,是通过融合多种不同的信息,去增强感知的能力。比如利用人的嘴唇的视觉信息,可以更好地进行语音识别。除此之外,利用模态信息感知,可以将交互模式变为主动式交互。过去的交互方式往往是基于用户发起的,其流程一般是用户唤醒系统,然后向系统描述自己的需求。
而更丰富的主动感知能力支持了更丰富的主动交互场景,比如感觉到用户疲劳或者负面情绪后,可以发起交互去缓解疲劳或者负面情绪; 比如通过视觉和音频信息,可以确定车内是否有儿童以及儿童是不是在哭闹,进而主动发起针对儿童的哭闹的安抚动作; 比如感知到用户不开心,可以推荐一些轻松的歌曲或者讲一个笑话。
这些主动交互可以带来更智能的体验,但是也存在一些风险,当理解错了用户意图, 误触发了一些动作,会给用户带来不必要的困扰。由于误触发的代价很高,主动交互对算法的准确性要求非常高,所以目前这类主动交互技术还在探索中,落地相对谨慎。
多模交互的信息
1、视线
视线在座舱内有两类应用,一是用于安全驾驶,通过视线信息检测驾驶员是否分神,二是用于交互控制,比如通过关注视不同的车窗来指示要操作的具体车窗。视线估计算法一般采用基于眼球物理模型的方法或基于标注数据的神经网络方法。最终的注视位置,需要通过人眼位置估计,视线估计和空间标定三者结合来确定。
2、手势
手势在触屏交互中应用广泛,在座舱交互中,手势一般指基于视觉信息的隔空手势(非接触手势),手势分为静态和动态手势,如比心,点赞等保持不动的手势是静态手势,动态手势则是一个变化的动作,如向左挥手。
3、行为
相比于手势视线这类细粒度的模态特征,还有一些很有价值的特殊场景行为,比如抽烟,打电话等,通过对其进行感知,可以提高驾驶安全性和进行主动关怀。比如当检测到驾驶人在吸烟,系统可以提供语音提示,要求驾驶人注意安全,同时开窗通风;当检测到车内有人在打电话时,可以主动降低音乐音量。
4、情绪
视觉信息具有不可替代性,文字的表达最丰富但存在歧义,语音则对情绪的强度判断很有效,结合三者可以更准确的估计人的情绪。目前的情绪检测主要用于一些激烈或者明显的情绪,对于细微的情绪检测,挑战仍然很大。
5、疲劳
可以利用通过眼部和嘴部的特征,如眨眼频率、眯眼时间和打哈欠等去判断,但是疲劳并不总是会展现这些明显特征。疲劳检测也会面临一些干扰,比如吃东西或者摸嘴会被误当做打哈欠,对算法产生干扰。
座舱交互面临的各种挑战
1、驾驶安全性
在交互设计上必须考虑驾驶安全的要求。主驾的视线不能够离开正前方太久,手也不应该离开方向盘,当考虑这些要求进行交互设计时,一些视线手势的算法的落地应用就受到了限制。另外语音交互系统不应该被车外语音控制,否则会有极大的安全隐患,可以利用多模态和声纹的技术,通过感知增强和身份验证的方式去解决。
2、端侧计算能力
法规对私人数据安全要求越来越规范,大部分信息尤其是视觉数据是不允许上传云端的,所以一定要做纯离线的AI方案。由于存在大量的感知算法,对AI芯片算力,算法性能有极高的要求,甚至需要进行软硬一体化的优化。
3、主动交互的风险
多模态感知带来了主动交互能力,但是如果不够准确,反而会给用户带来更糟糕的体验,这对于算法和设计都是一个挑战。