岗位职责:
1. 负责语音识别数据pipeline构建,包括但不限于数据收集、清洗、整理等;
2. 负责语音识别各模块的效果优化,包括但不限于声学模型、语言模型、端到端模型、VAD,反正则化等;
3. 负责其他语音技术的探索及优化,包括但不限于说话人识别和分割、语种识别、声音事件检测、语音增强、语音降噪、3A音频算法、空间音频、关键词唤醒等技术研发;
4. 关注语音相关领域前沿进展技术,探索语音识别相关技术在元宇宙场景的落地。
基本要求:
1. 人工智能、机器学习、信号处理或计算机科学等相关专业研究生以上学历,基础扎实;
2. 熟悉shell & python & C++,有较强的算法实现能力;
3. 熟悉主流的语音识别模型算法,如RNN-T、conformer;
4. 熟悉WFST相关算法理论,可以熟练使用相关工具搭建HCLG / TLG;
5. 熟悉kaldi / K2 / wenet / espnet 中至少两种工具;
6. 有相关项目或实习经验,包含但不限于大规模ASR / 流式 / 热词 / 模型蒸馏;
7. 学习研究能力强,能够独立阅读英文文献,对解决具有挑战性的问题充满激情。