随着听力健康需求日益增长,助听器已成为改善听障人士生活质量的关键设备。传统封闭式助听器虽能有效隔绝外界噪声,但长期佩戴易产生“堵耳效应”,佩戴体验较差。
开放式助听器凭借佩戴舒适、聆听自然的优势备受关注。然而其泄压通风孔会带来声学泄漏问题:外界噪声直接渗入耳道,既降低输出信噪比,泄漏的目标语音还会与助听器输出信号发生干涉,产生梳状滤波等失真伪影,严重制约双耳语音增强算法发挥作用。

图1 半开放耳助听器中的声学泄漏现象。外部麦克风(空心圆圈)为双耳语音增强算法提供输入信号,经过增强处理的信号由内部扬声器播放。但外界噪声信号会通过通气孔泄漏进入耳道,污染已经增强的语音信号;放置在耳道深处的误差麦克风(实心圆圈)可以采集到该被污染后的信号。
针对这一痛点,内蒙古大学研究团队提出 ABSE‑NET,一套将双耳最小方差无失真响应(BMVDR)波束形成器与轻量化神经网络(LNN)相级联的主动双耳语音增强框架,可同时实现声学泄漏抵消与波束成形带来的语音失真补偿。该研究成果已发布于 arXiv 预印本平台,项目代码同步开源。
分级处理架构
ABSE-NET 采用两级处理流水线,左右耳通道独立运算。

图2 本文提出的 ABSE‑NET 网络:(a) ABSE‑NET 整体流程框图;(b) 时频依赖学习块(F‑TDL)内部结构;(c) 卷积注意力块(ConvAtt)内部结构。
第一级依靠 BMVDR 波束形成器完成粗粒度双耳语音增强,抑制干扰噪声的同时保留声源空间方位线索。该方法计算开销低、物理逻辑清晰,但存在固有局限:一方面无法处理通风孔带来的声学泄漏;另一方面算法依赖的声学传递函数(ATF)真实值在现实环境无法获取,估计偏差会引发语音失真与空间线索畸变。
第二级轻量化神经网络作为后处理模块,针对性弥补上述缺陷。网络输入包含两部分:BMVDR 的增强输出,以及助听器外部参考麦克风采集的带噪原始信号。模型一方面生成反相信号抵消声学泄漏,另一方面修正波束成形引入的语音畸变。引入原始带噪信号的目的,是规避 BMVDR 容易过度降噪的问题 —— 高度净化后的信号缺少噪声相关信息,不利于网络对泄漏成分做有效估计。
误差麦克风的使用策略是本方案一大亮点。传统主动双耳语音增强方案依靠自适应滤波,需要在耳道内部放置误差麦克风获取实时反馈,但耳道空间狭小,该器件硬件布置困难,还会破坏佩戴体验。ABSE‑NET 仅在训练阶段使用耳道误差麦克风构建监督学习目标;在推理、实际产品部署时不再需要这一硬件,用户佩戴无需在耳道内置麦克风。
轻量化网络设计
助听器设备对功耗、算力、延迟有着严苛约束,轻量化是 ABSE‑NET 架构设计的核心目标。
网络主体为编码器‑解码器结构,核心是堆叠 4 层的特征增强(FA)模块,模块由频‑时依赖学习块(F‑TDL)与卷积注意力块(ConvAtt)串联组成。
- F-TDL 分别从频率、时间维度挖掘语音固有时频关联。频率子块使用重参数多分支一维卷积 RMB‑Conv1D,训练采用 {1,3,5} 多尺度卷积核提取多粒度特征,推理阶段将多分支融合为单个卷积核,在不降低建模能力的前提下减少推理计算量;时间子块采用因果版本 C‑RMB‑Conv1D,仅使用当前与历史帧数据,保障算法低延迟实时运行。
- ConvAtt 分别在通道、时频两个维度计算注意力权重,避开高消耗的完整三维注意力张量。模型损失函数结合 SI‑SDR 与 STOI 加权,同步优化语音波形质量与语音可懂度。
整体模型参数量仅0.112 M,浮点运算量0.184 G FLOPs,算力开销远低于 DeepANC、ASE‑TM 等深度学习基线模型,适配助听器嵌入式硬件。
实验结果
研究团队基于 Librispeech、NOISEX‑92、Hearpiece 公开数据集构建测试集,包含 43200 条 2 秒音频样本,总时长约 24 小时;设置‑5 dB~0 dB 随机信噪比,模拟日常嘈杂低信噪比环境。

图3 不同信号处理阶段的波形与时频谱图可视化对比:(a) 干净语音;(b) 原始未处理带泄漏信号;(c) 无声学泄漏条件下 BMVDR 处理输出;(d) ABSE‑NET 模型输出结果。
对比多类模型驱动与数据驱动基线,ABSE‑NET 在 PESQ、STOI、CSIG、COVL 多项语音质量指标取得最优,双耳定位 ILD、IPD 误差优于 BMVDR 基线。它的 SI‑SDR(9.869 dB)略低于 ASE‑TM(10.45 dB),但算力仅为后者的 1/78,对于算力受限的助听器设备,该小幅性能差距属于可接受的工程取舍。
在波达方向(DOA)存在估计误差的鲁棒性测试中,当误差达到 15° 时,传统 BMVDR 性能近乎失效,SI‑SDR 跌至‑1.010 dB;而 ABSE‑NET 仍保持 6.434 dB 的 SI‑SDR 增益,在全部误差条件下均取得更低的 ILD、IPD 误差,对声学参数失配具备较强抵抗能力。
总体而言,ABSE‑NET 融合模型驱动的物理可解释性与深度学习的非线性建模能力:波束成形负责粗增强与保留空间线索,轻量化神经网络完成泄漏抵消与失真补偿,并且摆脱部署阶段对耳道误差麦克风的依赖。下一步团队将继续压缩模型计算开销,推进算法在真实助听器硬件上的落地验证。
论文信息:Hu, D., Du, X., Zhao, Q., & Si, Q. (2026). ABSE-NET: A lightweight neural model for active binaural speech enhancement in open-fit hearing aids. arXiv. https://arxiv.org/abs/2609.00966
