Stream-Omni:中科院推出的多模态语言大模型
转载a year ago
Stream-Omni:中科院推出的多模态语言大模型

Stream-Omni是由中国科学院计算技术研究所智能信息处理重点实验室、中科院人工智能安全重点实验室及中国科学院大学联合推出的大型多模态语言模型。该模型对标GPT-4o,实现了文本、视觉、语音三种模态的无缝融合交互。 GitHub仓库:h…

18 0 0
AdaMesh:让虚拟角色“活”起来:语音驱动的人脸动画如何迈向个性化?
转载a year ago
AdaMesh:让虚拟角色“活”起来:语音驱动的人脸动画如何迈向个性化?

语音驱动的三维人脸动画旨在根据输入语音生成同步的面部运动,这项技术近年来受到了广泛关注。然而,现有方法普遍忽略了说话者的个性化风格,例如独特的面部表情和头部姿态,导致生成的人脸动画缺乏真实感和个性表达。部分工作尝试通过微调模型来建模不同人物…

12 0 0