近日,IIP-HCI实验室关于基于脑电的想象语音重建的最新研究成果被国际学术期刊 ACM TAAS 接收。期刊全称为 ACM Transactions on Autonomous and Adaptive Systems,由国际计算机学会(Association for Computing Machinery,ACM)出版,主要关注自主与自适应系统领域的理论、方法及应用研究,其被中国计算机学会列为B类国际学术期刊。
DA2Mel: A Dual-Dynamic Adaptive Network for EEG-to-Mel Spectrogram Reconstruction
作者信息:范存航,吕慧垚,章胜,周健,李心慧,孙长银,吕钊*(通讯作者)
单位: 安徽大学光电信息获取与防护技术全国重点实验室、安徽大学脑机接口研究院
01 研究背景
脑机接口(Brain-Computer Interface,BCI)通过直接解析脑神经活动,为语言功能恢复和新型人机交互提供了新的技术路径。相比侵入式脑机接口,以脑电信号(EEG)为代表的非侵入式技术具有安全、便捷等优势,更具广泛应用潜力。近年来,相关研究逐渐由元音、音节和词语等离散类别识别向连续声学特征重建发展,其中Mel频谱能够同时表征语音的时间与频率结构,为更加精细的语音重建提供基础。
然而,EEG具有低信噪比、高度非平稳和显著个体差异等特点。一方面,不同受试者之间存在明显差异,同一受试者的神经状态也会随时间动态变化;另一方面,与语音相关的关键神经表示往往具有稀疏性,容易受到背景噪声干扰。传统静态个体建模和标准注意力机制难以同时适应上述变化,限制了连续EEG到精细声学特征的稳定重建。
02 方法介绍
针对上述问题,本文提出DA2Mel双动态自适应网络,如下图1所示,核心组件包括:

图 1 所提出方法的总体框架
1. 动态受试者特异性记忆整合器(DSSM)
针对EEG的跨受试者差异和受试者内部动态变化,DSSM构建由局部记忆和全局记忆组成的双尺度记忆结构,分别学习个体特异性模式和跨受试者共享模式,并通过自适应门控进行融合。同时,引入基于动量的记忆更新机制,在保留历史稳定信息的基础上持续吸收当前神经状态变化,从而增强模型对EEG非平稳性的适应能力。
2. 双路径空间—通道处理器(DP-SCP)
针对多通道EEG中不同空间区域和通道贡献不均衡的问题,DP-SCP采用空间分支与通道分支并行建模。空间分支通过多尺度空洞卷积提取不同尺度的空间信息,通道分支利用Squeeze-and-Excitation机制动态调整各EEG通道的重要性,从而突出与语音重建相关的有效神经特征,并为后续细粒度建模提供稳定的结构信息。
3. 堆叠式细粒度模块(SFGM)
针对低信噪比条件下语音相关神经信息稀疏的问题,SFGM引入Adaptive Partial Native Sparse Attention(AP-NSA),将长序列划分为连续时间块,并根据输入动态选择关键表示,使模型更加关注与语音重建相关的神经活动。同时结合全局特征校准与多层堆叠,在抑制背景噪声的同时保留长程神经动态,从而提升Mel频谱的精细重建能力。
03 结果介绍
(1)和其他基线模型对比试验
本文在公开的SparrKULee数据集上开展实验。该数据集包含85名受试者的64通道EEG记录,每名受试者接受约90至150分钟的连续自然语音刺激。实验分别设置Held-out Stories与Held-out Subjects两种场景,前者用于评价模型面对未见语音内容时的泛化能力,后者则使用1—70号受试者进行训练和验证、71—85号受试者进行测试,用于评价模型面对完全未见受试者时的跨个体泛化能力。
实验结果表明,DA2Mel在两个场景下均取得了最优性能。在Mel频谱重建任务中,DA2Mel在Held-out Stories场景下取得0.081 Pearson r,相比此前表现最好的DMF2Mel(0.074)提升9.46%;在更加困难的Held-out Subjects场景下取得0.050 Pearson r,相比DMF2Mel(0.048)提升4.17%。此外,在语音包络重建任务中,DA2Mel同样取得0.238和0.135的最优结果。

表1 不同模型在SparrKULee数据集上的指标对比结果
进一步的受试者级统计分析表明,DA2Mel不仅在整体平均性能上优于HappyQuokka、SSM2Mel和DMF2Mel,在不同受试者上的相关性分布也表现出更好的稳定性;其中Mel频谱重建相对于多个主要基线的性能提升具有统计显著性。

图 2 不同模型在Held-out Stories数据集上结果比较
(2)消融实验
为验证DA2Mel各核心模块的有效性,本文进一步进行了系统的消融实验,如表2所示。当分别移除DSSM、DP-SCP和SFGM后,Pearson r由完整模型的0.081分别下降至0.066、0.074和0.063,对应18.52%、8.64%和22.22%的性能下降。其中移除SFGM造成的性能下降最为明显,说明细粒度稀疏神经信息建模对于EEG到Mel频谱重建具有重要作用,同时也验证了三个模块协同设计的有效性。

表2 DA2Mel各核心模块的消融实验结果
此外,研究进一步围绕DSSM的记忆更新策略、DP-SCP的串并行结构以及SFGM中的注意力机制进行了深入分析。实验表明,将DSSM替换为已有ESM模块后性能下降7.41%;将DP-SCP改为串行结构后下降6.17%;将AP-NSA替换为传统MHSA后下降8.64%。这些结果进一步证明了DA2Mel各项核心结构设计的合理性。

表3 DA2Mel不同模块设计的消融实验结果
针对关键超参数的实验进一步发现,DSSM在动量系数β=0.2时达到最佳效果,即每次更新保留80%的历史记忆并注入20%的当前神经特征,从而在长期个体先验与瞬时状态变化之间取得较好的平衡;AP-NSA则在block size=8时取得最佳表现,在保持长程时间依赖与过滤无关噪声之间实现较优权衡。

图3 DSSM关键超参数的消融实验结果
04 结论
本文提出了一种面向非侵入式EEG到Mel频谱重建的双动态自适应网络DA2Mel,通过DSSM、DP-SCP和SFGM分别从个体动态适应、空间—通道结构建模和细粒度稀疏信息提取三个层面提升EEG到声学表征的映射能力。在SparrKULee公开数据集上的实验结果表明,DA2Mel在Held-out Stories和Held-out Subjects两种设置下均取得领先性能,验证了双动态自适应建模机制在连续神经语音解码中的有效性与泛化能力。
未来工作将进一步探索更加有效的神经表征学习与跨受试者泛化方法,提升非侵入式EEG语音重建的准确性与稳定性,为脑机接口从声学特征解码进一步迈向自然、连续的语音重建提供技术基础。
