该工作由字节跳动 ByteBrain 团队 × 清华大学合作完成。第一作者为清华大学三年级博士生谢哲,主要研究方向为时序多模态 LLM、异常检测和根因定位。第二作者和第三作者分别为李则言和何晓,均来自字节跳动。通讯作者分别为字节跳动研究科学…
声浪
昨天,火山引擎旗下豆包团队推出的豆包·语音播客模型,以三大核心技术突破重塑播客内容生产逻辑。这一模型基于流式技术实现文本到双人对话式播客的即时转换,生成的自然语音在流畅度、情感表现和语义连贯性上均达到专业录制水准,甚至能通过深度搜索功能在5…
当置身于一场音乐会,闭上眼睛,我们仍能凭借声音判断乐器的位置;在电影院,环绕音效让我们仿佛置身于电影场景之中。空间音频,作为一种能够模拟真实听觉环境的技术,正逐渐成为提升沉浸式体验的关键。然而,现有的技术大多基于固定的视角视频,缺乏对 36…
来源丨机器之心 近日,腾讯混元与上海 AI Lab、复旦大学、上海创智学院联合提出全新研究工作 UnifiedReward-Think,构建出首个具备长链式推理能力的统一多模态奖励模型,首次让奖励模型在各视觉任务上真正 “学会思考”,实现对…
VITA 团队最新推出了突破性成果—VITA-Audio。作为一款端到端的语音模型,VITA-Audio 能在第一次前向传播中直接生成可解码的 Audio Token Chunk,大幅提升响应速度。 在 7B 参数规模下,VITA-Audi…
量子位 | 公众号 QbitAI 字节Seed首次开源代码模型!Seed-Coder,8B规模,超越Qwen3,拿下多个SOTA。 它证明“只需极少人工参与,LLM就能自行管理代码训练数据”。通过自身生成和筛选高质量训练数据,可大幅提升模型…
英伟达在5月1日发布了一款开源语音识别模型:Parakeet TDT 0.6B V2,其以 600M 参数登顶 Hugging Face Open ASR 榜单。 项目链接:
来源丨机器之心 今天,Google DeepMind 发布了 Gemini 2.5 Pro 的最新更新版本:Gemini 2.5 Pro (I/O edition)。 其最大的进步是编程能力大幅提升,不仅在 LMArena 编程排行榜上名列…
近日,一项来自 ICML 2025 的新研究《Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding》揭示了大型语…
