| 岗位职责: 1. 负责语音识别数据pipeline构建,包括但不限于数据收集、清洗、整理等; 2. 负责语音识别各模块的效果优化,包括但不限于声学模型、语言模型、端到端模型、VAD,反正则化等; 3. 负责其他语音技术的探索及优化,包括但不限于说话人识别和分割、语种识别、声音事件检测、语音增强、语音降噪、3A音频算法、空间音频、关键词唤醒等技术研发; 4. 关注语音相关领域前沿进展技术,探索语音识别相关技术在元宇宙场景的落地。 基本要求: 1. 人工智能、机器学习、信号处理或计算机科学等相关专业研究生以上学历,基础扎实; 2. 熟悉shell & python & C++,有较强的算法实现能力; 3. 熟悉主流的语音识别模型算法,如RNN-T、conformer; 4. 熟悉WFST相关算法理论,可以熟练使用相关工具搭建HCLG / TLG; 5. 熟悉kaldi / K2 / wenet / espnet 中至少两种工具; 6. 有相关项目或实习经验,包含但不限于大规模ASR / 流式 / 热词 / 模型蒸馏; 7. 学习研究能力强,能够独立阅读英文文献,对解决具有挑战性的问题充满激情。 |
← 返回热聘机会
社招&23届校招 - 语音识别算法工程师
元象唯思控股(深圳)有限公司 · 招聘
招聘全职
公司元象唯思控股(深圳)有限公司
职位类型—
工作地点深圳南山区粤海街道软件产业基地
工作类型全职
招聘人数2
薪资范围25-35k
职位描述
公司介绍
元象 XVerse(www.xverse.cn)是一家位于深圳的技术初创公司,致力于打造端云协同的 3D 内容生产与消费一站式平台,开创元宇宙(Metaverse)时代全新交互体验,以低成本、轻终端、高画质方式打造大世界,实现每个人自由“Redefine Your World”(定义你的世界)的愿景。 我们相信未来将是沉浸、智能和开放的,元象希望成为全真互联网重要的操作系统和内容提供商之一。公司正在自研端云协同的 3D技术方案,以逼真 3D 内容为载体,以大规模分布式计算和存储系统为基础,结合高实时性的云渲染、视频编解码、实时通信、流传输、认知智能、人工智能算法、数字人、大系统工程等核心技术,能适配多种终端类型,为内容消费者提供全新使用体验,为内容创作者提供实现梦想的舞台。 创始人为前腾讯高管,团队来自腾讯游戏、Adobe、微软、IBM、麦肯锡等公司,具备深厚的技术积累和敏锐的市场洞察,期待志同道合的人才加入,一起开创全真互联网的新时代。 一元到万象,即将由你开创。
