快手旗下可灵AI正式推出其2.6版本的“音画同出”模型,这是首个支持画面、自然人声、音效及环境氛围同步生成的多模态系统。仅需一次生成,即可输出完整的音视频内容,真正实现了声音与画面的深度融合。 在创作流程上,可灵2.6提供两条高效创作路径:…
声浪
快手可灵 2.6上线,一次生成、音画同出
20 0 0
腾讯团队提出多奖励GRPO框架优化TTS韵律与稳定性,显著提升 TTS 自然度
标题:Multi-Reward GRPO for Stable and Prosodic Single-Codebook TTS LLMs at Scale 链接:https://arxiv.org/pdf/2511.21270 作者单位:…
24 0 0
阿里又上新!开源 7B 文生图模型,专治图中文字,效果媲美 20B+ 大模型!
最近阿里在开源界频出狠活,不仅放出了 6B 大小的 Z-Image-Turbo,还开源了一款 7B 参数的主打「图中文字」的文生图模型:Ovis-Image。 图中的“文字渲染”能力是它的强项,也就是生成海报、宣传图、Logo、UI 原型、…
15 0 0
AAAI 2026|KALL-E:基于下一分布预测的自回归语音合成
文本到语音(TTS)合成技术正处在一个由大语言模型(LLM)驱动的范式变革时代。目前,学界主流的“下一令牌预测”范式统一了语音生成的框架,但其依赖的“离散化”基石也带来了信息瓶颈、生成幻觉等固有缺陷。虽然已有研究开始转向连续语音表示,但又面…
24 0 0
语音大模型能读懂人的“反话”和小心思吗?中山大学和腾讯推出SLM “人类级感知” 评测新基准
标题:《HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding》 链接:https://arxiv.org/pdf/251…
26 0 0
NeurIPS2025 | 同声传译的无监督读写策略:让混合专家决定
NeurIPS(Neural Information Processing Systems)是每年十二月举行的机器学习与计算神经科学国际会议。会议汇集了来自学术界和工业界的顶尖研究人员,领域涵盖机器学习、神经网络、认知科学、计算机视觉,统计…
39 0 0
“鸡尾酒会问题”研究进展:语音分离技术、挑战与未来趋势
题目:《Advances in Speech Separation: Techniques, Challenges, and Future Trends》 地址:https://arxiv.org/pdf/2508.10830 先从摘要说起…
34 0 0
