分享一场Interspeech 2025的赛事:Speech Accessibility Project Challenge。该赛事旨在推动语音识别技术在构音障碍和发声障碍方面的快速发展,并设有奖金。欢迎大家踊跃报名参加!
赛事网址:https://eval.ai/web/challenges/challenge-page/2362/overview
比赛内容
- 本次挑战的目标是快速推进构音障碍语音识别技术的发展。参赛作品将根据其在两个独立测试集(Test1 和 Test2)中正确转录构音障碍语音的能力进行评估。这些测试集的病因分布与提供给已注册团队的训练集和开发集相似。
- 模型评估包含两个指标:词错误率(WER)和语义评分。语义评分是 BERTscore、音素距离(phonetic distance)和自然语言推理概率(natural language inference probability)的加权组合。系统输出将同时与两个参考文本进行比较:一个包含非流利部分的转录和一个则不包含。每次评分时,与系统输出更接近的参考转录被用来计算最终得分。
比赛时间
本赛事已于2024年11月1日开放,将于2025年1月31日结束
如何参加
- 在https://eval.ai/上为自己创建一个账户,然后从https://cli.eval.ai/安装 eval.ai 命令行界面(CLI)。
- (Optional:) 通过下载数据使用协议https://speechaccessibilityproject.beckman.illinois.edu/conduct-research-through-the-project, 要求您的机构签署协议,并将签署的协议和一页的项目计划发送到 speechaccessibility@beckman.illinois.edu 以获取 Train 和 Dev 数据集的副本。
- 从https://github.com/xiuwenz2/SAPC-template克隆 SAPC 提交模板。
- 进行测试提交:使用 CLI 上传模板中的以下文件:
- run.sh - 指定如何初始化虚拟机(例如,使用什么版本的 Python,安装哪些包)以运行您的 ASR 模型。
- inference.py - 运行您的 ASR 模型。
- model.pt(或在inference.py 中指定的其他模型文件) - 包含由inference.py 调用的训练模型。
提交这些文件后,72 小时内,您应该在 eval.ai 账户中看到两个比赛结果。一个会显示您提交在 Test1 数据集上获得的词错误率(WER),另一个会显示您提交在 Test1 数据集上获得的语义评分。两个结果应与Leaderboard上提供的Baseline结果一致。
如何提交模型
修改 run.sh 和 inference.py 文件,并将它们与训练好的模型文件一起压缩。使用 eval.ai 命令行工具上传它们到比赛平台,例如使用以下命令:
evalai challenge 2362 phase 4675 submit --file /path/to/local/submission_file --large如果您的自动语音识别(ASR)模型在一个 A100 GPU 上运行 Test1 子集时超过 240 分钟,它将被自动终止。否则,在 72 小时内,您将在您的 eval.ai 账户和排行榜上看到提交结果。如果 72 小时内没有看到结果,请发送电子邮件至 sapchallenge@lists.illinois.edu。
奖 金
每个提交的系统都将对Test1和Test2里未共享部分的音频进行转录,并根据评估指标进行评分。Dev、Test1和Test2的未共享部分包含相同数量但并不重叠的说话者,并在不同类型的障碍分布上相似,也没有具有相同文本的音频文件。Test1的得分将在提交后立即发布。Test2的得分将在2025年2月4日发布。Test2中WER最低的团队和语义评分最高的团队将各获得5000美元奖金。
