本文由香港中文大学、清华大学合作,研究面向语音情感识别的神经网络架构搜索,提出了一种均匀路径丢弃(uniform path dropout)的训练策略以改进神经架构的搜索速度,有效地提升了神经网络的情感识别准确率,也降低了模型的参数量。


扫描下方二维码或复制链接阅读论文:

https://arxiv.org/abs/2203.16928


背景动机

语音情感识别(speech emotion recognition,SER)是构建和谐人机交互的基础技术,使得机器可以根据交互环境中用户的不同情绪生成适当的响应。

随着深度神经网络的应用,语音情感识别研究在过去十年中取得了长足的进步。但运用于语音情感识别的神经模型的架构设计通常依赖于专家知识和经验(试错)评估。由于架构设计的显式训练和评估通常是非常耗时的且资源耗费巨大,因此研究者提出探索神经架构搜索(neural architecture search,NAS)技术以自动化神经架构的设计过程。NAS 算法旨在基于某些评估指标通过组合来自预定义空间的操作来搜索架构。目前已经有多种搜索算法得到很好的效果,包括基于强化学习(reinforcement learning)、演化算法(evolution)、贝叶斯优化(Bayesian optimization)等的搜索算法。但是这些算法都需要大量的计算资源。近来,可微架构搜索(differentiable architecture search,DARTS)引起颇多关注,相比于传统方法基于离散空间搜索,DARTS能在连续空间上搜索,候选网络操作通过softmax函数来选取,从而将架构搜索的问题转化为用梯度方法优化softmax函数的问题,这极大地降低了计算复杂度。

DARTS算法优化一个过参数化的超级网络(over-parameterized supernet)中的网络候选操作与softmax参数(又称架构参数),达到同时收敛。但是存在的问题是,某些次最优(sub-optimal)的候选操作会在训练的初期阶段占据了大部分的softmax权重,从而使得最优的候选操作最后不能被成功选出。为了促进多种候选操作同时被优化,之前的研究提出了操作丢弃(operation dropout)和均匀路径采样(uniform path sampling)等方法。但是丢弃候选操作可能会使网络训练变得不稳定,而运用采样方法每个迭代步骤只能优化一个路径上的相关操作导致收敛较慢。

贡献

NAS技术已经被成功应用到语音合成和语音识别的研究中,目前在语音情感识别(SER)任务上的研究还比较少。本文探讨NAS在SER上的应用,结合SER任务数据量稀少的特点,着重提升DARTS算法的收敛速度,提升识别准确率,并降低搜索得到的架构的参数量,降低过拟合风险。本文提出了均匀路径丢弃(uniform path dropout)的策略,使得每一步迭代都能同时优化多条路径,并迫使模型降低对某个次优的操作的依赖。基于前人的研究工作中提出的两种不同的网络架构,分别基于注意力机制(attention mechanism)和胶囊网络(capsule network),本文发现运用NAS以及所提出的均匀路径丢弃策略可以有效提升SER的识别性能,并降低模型参数量。

解决方案

本文选用DARTS算法优化一个过参数化的超级网络。如图1所示,在超级网络的每一层中,多个候选的网络操作(绿色方块),如卷积、全连接等,通过不同的架构权重(橙色圆形)被加权整合起来,作为该层的输出。


图1:超级网络(supernet)中网络层内部结构示意图

联合优化(joint optimization)

DARTS可以联合优化网络操作参数和架构权重参数这两部分,如公式(2)所示,


其中A为架构权重,W为操作参数,N(A,W)为超级网络,L_train(N(A,W))为训练损失函数。优化结束后,根据架构权重选取对应权重大的网络操作组成最终的网络架构。虽然联合优化可以同时优化两部分参数,节省训练时间,但是次优操作,例如相对简单、参数量少的操作,会在超级网络训练的开始阶段占据了大量的架构权重,从而影响了最优操作的优化。

双层优化(bi-level optimization)

另一种DARTS的优化方法为分别优化网络操作参数和架构权重参数这两部分,第一层优化架构参数,如公式(3);第二层优化操作参数,如公式(4):


其中L_val为验证集损失。之前的工作运用均匀路径采样得到一条超级网络中的路径,如图2(a)所示,并对这个路径上的操作参数进行优化。由于每一个迭代步都采样到不同的路径,经过多个迭代步后,不同路径上的操作都会被均匀的进行优化,从而可以提供公式(4)的近似解。基于该近似解,进行架构权重的优化,即公式(3)。但均匀路径采样每次只选取一条路径,即每一层只有一个操作被挑选到并被优化,这使得训练的收敛速度较慢。


图2:(a)均匀路径采样(uniform path sampling)与(b)均匀路径丢弃(uniform path dropout)比较

均匀路径丢弃(uniform path dropout)

为了提高训练效率,本文提出了一个简单而有效的方法,称为均匀路径丢弃(uniform path dropout)。该方法每次只丢弃一个层中的一个操作,这等价于每个迭代步丢弃了一组路径,而选取了余下的多条路径,而非仅选取一条路径,这就使得每一层的多个操作可以被同时优化。而且每一层都有丢弃操作,也破坏了超级网络在训练初期对某个非最优的操作的严重依赖。

实验验证

本文基于两个之前的研究工作中的SER模型,CNN_GRU_att和CNN_SeqCap,进行神经网络架构搜索。CNN_GRU_att包含了卷积网络、循环网络和注意力机制,而CNN_SeqCap则包含了卷积网络和胶囊网络。这两个网络结构本身都具有良好的情感识别性能。本文希望通过NAS提升识别性能的同时,进一步降低网络的参数量。具体地,本文搜索了卷积层的不同核函数,注意力模块的不同维度和前向网络的不同维度作为不同的候选操作,如表1所示。

实验设置

本文在IEMOCAP数据集上进行实验,选取了中性、高兴、愤怒、悲伤四个情感类别的数据。采用5分交叉验证,将其中的4个session作为训练集,最后一个session中的两个说话人分别作为验证集和测试集。训练集用于操作参数的训练而验证集用于架构权重的训练。在测试集上计算加权准确率(weighted accuracy,WA)和非加权准确率(unweighted accuracy,UA)以评估搜索得到架构的有效性。WA为测试集中所有样本的平均识别准确率,UA为测试集中不同类别识别准确率的平均值。

实验结果

为了验证本文所提方法的性能,我们对比了两个基线系统:其一是没有采用任何NAS的原始结构(表2中“×”所示),其二是从超级网络的每一层随机选取一个操作组成的结构(表2中“Random”所示,很多研究表明,这是一个很强的基线系统)。

实验结果如表2所示,在两个结构上,采用了NAS方法得到的结构,语音情感识别的性能普遍优于两个基线系统。而相比于联合优化(表2中“Joint”所示)和均匀路径采样(表2中“Sampling”所示),采用均匀路径丢弃(表2中“Dropout”所示)的方法能够取得更好的识别性能,同时能够稍微减少参数量。


表1:超级网络中不同的候选操作,C、D、K和W分别代表通道数、维度、核形状和池化窗口


表2:不同系统性能比较

实验分析

为了更进一步分析均匀路径丢弃方法在模型优化上的有效性,本文对比了Joint,Sampling和Dropout三种优化方法的损失函数,如图3所示。图a展示了每层随机选取一个操作组成的候选架构的损失曲线,可以发现,Joint曲线远高于Dropout和Sampling,说明Dropout和Sampling能够比Joint更有效优化操作参数。b展示了三种不同方法优化下超级网络的训练集损失函数,可以发现,Dropout的损失曲线远低于Sampling的损失曲线,接近于Joint的曲线,这表明,Dropout更能够同时优化每一层中的多个操作,从而使得超级网络总体的损失曲线更低,收敛更快(Joint可以看做0-dropout)。


图3:CNN_SeqCap的训练损失函数

结论

本文研究了面向语音情感识别的神经架构搜索,以提高语音情感识别性能并减少模型参数量。实验结果表明了传统的均匀路径采样和所提出的均匀路径丢弃搜索策略的有效性。均匀路径丢弃策略可以通过随机丢弃路径来鼓励所有架构操作同等优化,并通过在每一步选择多条路径来提高训练效率。未来,我们将研究更多样化的搜索空间和找到的架构的可迁移性。


更多实验结果请扫码 或复制下方链接至浏览器 或点击阅读原文

https://arxiv.org/abs/2203.16928