AI圈这遍地开花的大好局面,让吃瓜群众们甚是惊喜。 自 Sora 发布以来,国内外各大科技公司和研究机构都在竞相推出“文生视频”大模型,比如生数科技的 Vidu、快手的可灵和 Runway 昨天才发布的 Gen-3 Alpha 等。 然而,…
声浪
杀疯了! 谷歌卷视频到语音,逼真音效让AI视频告别无声!
23 0 0
吴恩达:从 Agent 到 Agentic,超越基础模型的下一代 AI
“与其争论哪些工作才算是真正的 Agent,不如承认系统可以具有不同程度的 Agentic 特性。” —— 吴恩达 2024年 Snowflake 峰会开发者日上,人工智能领域的领军人物吴恩达 (Andrew Ng) 发表了题为“AI 代理…
36 0 0
字节内测「海绵音乐」,中文能力Max!“AI+音乐”赛道成抖音真正的动机!
近日,字节跳动正式宣布其AI音乐生成工具——海绵音乐,已经开启内测阶段,官网也已正式上线,预示着音乐创作和欣赏方式的全新升级。 官网:https://www.haimianyinyue.com/featured 值得一提的是,“海绵音乐”在…
26 0 0
人工智能语音转文本可以产生暴力语言的幻觉
康奈尔大学的研究人员发现,说话时如果有点断断续续或者停顿时间太长,语音转文本的转录器可能会把有害的、暴力的话语放到你的嘴里。 研究人员表示,OpenAI的Whisper(一种人工智能语音识别系统)偶尔会编造或“幻化”整个短语和句子,有时会让…
27 0 0
语音/音频处理学术速递[6.17]
今日论文合集:cs.SD语音24篇,eess.AS音频处理35篇。 本文经arXiv每日学术速递授权转载 cs.SD语音 【1】 Diffusion Synthesizer for
36 0 0
语音/音频处理学术速递[6.14]
今日论文合集:cs.SD语音34篇,eess.AS音频处理38篇。 本文经arXiv每日学术速递授权转载 cs.SD语音 【1】 DiscreteSLU: A Large Langu
23 0 0
