来源丨AI音频时代

新泽西理工学院(NJIT)和纽约大学(NYU)的研究人员正在通过一项新资助的项目,共同在数字无障碍领域取得突破性进展,该项目旨在让在线视频内容对聋人和听力障碍(DHH)观众更具包容性。

在未来三年内,凭借美国国家科学基金会提供的80万美元资金,NJIT教授马克·卡特赖特和李秀妍正在帮助开发人工智能系统,该系统能够自动识别在线视频中有意义的非言语声音并为其添加字幕——从脚步声、关门声等相关的画外动作,到背景音乐,均在其列。

她们与纽约大学助理教授玛格达莱娜·富恩特斯合作的最新项目,旨在解决当前无障碍工具中长期存在的空白。

虽然自动语音识别技术已使对话字幕在YouTube等平台上几乎无处不在,但非言语音频在很大程度上仍未配字幕。根据该团队迄今为止的研究,在热门视频中,仅有4%包含了非言语声音的字幕。

对于全球超过10亿的听力损失人群来说,这一空白意味着会错过关键的背景信息和线索。

"视频中的非言语声音——如警报声、音乐提示和环境音效——传达了重要信息,但聋人和听力障碍观众往往无法获取这些信息,"NJIT信息学助理教授李秀妍表示。"这不仅损害了他们对内容的即时理解,也导致了他们在学习机会、沟通和公民参与方面的长期被排斥,而这些领域在日常生活中越来越依赖视频。我们对我们项目在弥合这一关键无障碍鸿沟方面的潜力感到兴奋。"

"当前的自动音频字幕模型旨在描述它们听到的每一种声音,就像人一样。然而,字幕用户实际上并不想要所有声音的描述,而且,如何描述某事取决于具体情况和用户需求,"同为信息学助理教授的卡特赖特补充道。"最大的挑战将是有效地利用声音、视觉和叙事背景信息,以及用户偏好,来确定哪些声音应该被加字幕以及如何描述它们。"

该团队正在设计他们的人工智能系统,使其能够根据个体观众的偏好来调整字幕风格和详细程度,这一需求是通过广泛的社区参与和用户研究揭示出来的。

专门研究以人为中心的计算(人机交互)的李秀妍领导了一项对168名聋人和听力障碍者的调查,揭示了用户需求的巨大差异。


"最具启发性的时刻之一是一位失聪受访者告诉我们:'我们希望有选择……那是梦想!'通过我们的研究,我们发现围绕非言语声音字幕的偏好——应该包括哪些类型的声音以及如何描述它们——是极其多样化的,"李秀妍解释说。"一份静态的最佳实践指南会导致一种'一刀切,谁都难适用'的解决方案。这些见解从根本上塑造了我们的设计方法。

"我们旨在构建一个由人工智能驱动的系统,该系统通过考虑多种影响因素来适应用户的个人偏好——支持个性化,并使非言语声音信息对所有DHH观众更易于获取、更有意义、更具包容性。"

卡特赖特和李秀妍正在与聋人和听力障碍参与者以及内容创作者进行访谈和合作设计研讨会,以确保该技术在现实世界中的准确性和实用性。

为了推动行业应用,该团队正在与Adobe、Google/YouTube和纽约公共电台合作。研究人员还计划公开他们的软件和数据集,以支持无障碍领域的更广泛进步。

然而,卡特赖特和李秀妍表示,该项目的前景不仅限于为聋人和听力障碍者提供无障碍服务。


"这项技术也将惠及具有各种无障碍需求的人群——例如听力下降者、神经多样性人群、在声音无法使用或不切实际的情况或环境中接触内容的个人,以及非母语人士,"李秀妍说。

在纽约大学,富恩特斯将领导项目的人工智能研究,专注于将多种类型的上下文信息整合到字幕模型中。在新泽西理工学院,李秀妍正在领导用户研究和参与式设计工作,以了解利益相关者的需求并开发面向用户的解决方案。卡特赖特将管理整个项目,监督数据收集,并领导字幕系统交互和自适应功能的开发。

"NJIT对该合作的贡献是我们在以人为中心的计算和无障碍领域的专业知识,这对于为聋人和听力障碍者创造有效的字幕解决方案都至关重要,"卡特赖特指出。

首批人工智能原型预计将在两年内完成,一个功能完善的平台计划于2028年推出。

"我们期望我们的平台能够作为字幕可能性的概念验证和新愿景,"卡特赖特补充道。"通过与公司和社区团体的合作,我们希望我们的部分方法能被实际产品和行业标准所采纳,让在线视频对每个人都更具可访问性。"