美东时间2026年06月30日,东南大学外国语学院博士生导师陈彧教授联合天津理工大学聋人工学院张句博士题为Perception of Synthesized Mandarin Speech Based on a Large-Scale Language Model Among Deaf Adults With Cochlear Implants的研究论文在SSCI一区期刊Journal of Speech, Language & Hearing Research发表,在美国言语语言听力学会(American Speech-Language-Hearing Association,ASLA)网站正式上线。

该研究纳入50名普通话母语者,其中包括25名成年人工耳蜗使用者和25名听力正常成人,采用普通话句子识别任务,比较自然语音与大语言模型合成语音在人工耳蜗使用者中的可懂度和加工特征。研究设置6类语音材料,包括不同语速下的自然语音,以及由大语言模型语音合成系统生成的男女声合成语音,并采用线性混合效应模型对句子识别率和反应时进行建模,考察听者类型、语音类型及语速因素对普通话句子感知的影响。

研究结果表明:人工耳蜗使用者在自然语音和合成语音条件下的句子识别率均显著低于听力正常成人,反应时更长,且个体差异更加明显,提示该群体在普通话连续语音理解中仍存在较高的听觉加工负荷。同时,语速变化显著影响人工耳蜗使用者的识别表现,说明语速控制是听障人群语音感知评估和康复训练中需要重点关注的因素。值得注意的是,在控制语速差异后,人工耳蜗使用者对大语言模型合成语音的识别率和反应时与自然语音之间未表现出显著差异,表明高自然度合成语音在特定条件下可达到接近自然语音的感知效果。

该研究将大语言模型驱动的语音合成技术引入人工耳蜗使用者普通话句子感知研究,证实了大模型合成语音在听障群体语音评估和康复训练中的潜在可用性。研究结果为突破传统自然语音材料说话人类型有限、制作成本较高、个性化程度不足等问题提供了实证依据,也为未来构建可控、多样、低成本的智能化听觉康复材料和个性化训练系统奠定了基础。

原文链接:https://pubs.asha.org/doi/10.1044/2026_JSLHR-25-00295

Journal of Speech, Language, and Hearing Research(JSLHR)是由国际权威学术机构American Speech-Language-Hearing Association(ASHA)出版的语言与听力科学领域顶级期刊,该期刊致力于发表与言语、语言、听觉及相关神经机制有关的高水平研究,内容涵盖语音学、言语产生与感知、语言障碍、听觉康复、神经语言学、语音病理学等方向。期刊影响因子2.8(近五年),被SSCI和SCIE收录,在言语听觉科学及语言学交叉领域具有较高的学术声誉与国际影响力,属SSCI Q1分区。

张句,天津理工大学,聋人工学院,讲师。研究方向:聋人听觉感知与语音生成机理、生成式人工智能在聋人言语康复中的应用等。

张昭,天津大学计算机学院博士研究生。研究方向:语音生成、语音信号处理。

白昱,天津理工大学硕士研究生,研究方向:聋人语音感知。

陈彧,东南大学外国语学院教授、博导、博士后合作导师。研究方向:语前聋人语音生成、感知和语言康复系统研制,语言与情绪的认知交互等。