招聘岗位
多模态&大模型方向图音视
任职要求:
多模态&大模型方向-图音视、多模态交互算法-ai核身
1. 通过多模态算法进行用户的可信认知,支持十亿级支付宝用户,业务覆盖支付宝、蚂蚁国际、消金、财富、保险、生态等蚂蚁全域场景。
2. 方向一:多模态理解与推理方向,负责全面、高精、高效的多模态垂域模型研发,深耕视觉图像&视频reasoning,提升理解和推理能力,攻坚reward设计、多模态推理框架设计等核心问题。
3. 方向二:负责声纹识别、声音防伪算法以及意图理解等算法,探索声纹表征、声纹防伪、ASR、语音合成等All-In-One模型方案,研发金融级识别和防伪算法,落地与实际支付场景;
4. 方向三:声学算法部分,负责波束成形、声源定位、阵列增强、音频编解码等软硬件一体语音信号处理算法原型开发、性能优化
5. 关注多模态以及语音大模型算法前沿技术和发展动态,持续探索新一代AI驱动的、高效的、有效的、业务及产品新范式,推动业务发展、引领行业变革;
任职资格:
1. 计算机科学、人工智能、自然语言处理、数据科学、机器学习等相关专业。
2. 在多模态领域具备相关研发经验,在多模态大模型(OCR/信息抽取/caption/分割/生成/篡改伪造等方向)、多模态推理(MLLM-R1、Video-R1等)等方向有丰富经验,有顶会(NeurIPS、CVPR等)论文发表或国际比赛获奖者优先。
3. 在语音算法领域具备相关的研发经验,包括但不限于语音大模型、声纹识别、语音识别、语音合成和音频生成、AIGC音频及物理重放检测等,有语音顶会(ICASSP、INTERSPEECH、ASRU)论文发表或国际比赛获奖者优先。
4. 具备独立的算法研发、优化能力,编程开发能力强,熟练掌握Python/C++等编程语言和PyTorch等深度学习开发框架。
5. 沟通能力和逻辑表达能力,良好的团队合作精神,有创造性思维,善于解决项目开发或研发中的技术难题。
最低学历要求:本科
工作年限要求:三年以上
邮箱主题:姓名 + 申请岗位 + 语音之家推荐
工作地点:北京/上海/杭州

