近日,语音 AI 初创公司 Rime 宣布完成 2400 万美元 A 轮融资。本轮由知名风投机构 M13 领投,Twilio Ventures、Corazon Capital、Unusual Ventures 和 Cadenza Ventures 参投。资金将主要用于打造承载大规模、高重要性对话的语音交互底层模型。
Rime 由三位联合创始人共同领导:Lily Clifford 拥有斯坦福语言学博士研究背景,深耕 NLP 与语言学交叉领域;Brooke Larson 为博士级语言学者,曾任职于 Amazon Alexa;Ares Geovanos 则具备斯坦福工程背景,擅长产品与工程实践。团队坚信,语音最终将成为人类与 AI 交互的核心方式,而更优质的对话体验,必须始于更出色的底层模型。

尽管大语言模型(LLM)极大推动了语音应用的发展,Rime 指出,当前人机语音对话在听觉感受和交互自然度上仍远未达到理想状态。为此,公司坚持“linguistics-first”路线,将语言学、语音学与工程能力深度融合,致力于让机器发声更接近真人的表达习惯。
在数据构建上,Rime 自建旧金山录音棚,采集包含打断、笑声、停顿及口语化瑕疵等真实对话素材。这一策略使其与传统 TTS 厂商形成显著差异,也为模型在自然度、韵律和实时交互方面的表现提供了独特支撑。
产品层面,Rime 已公开推出包括旗舰模型 Coda、以及 Arcana、Mist v3 和 Mist v2 在内的多条产品线。其中 Coda 主打企业级速度、高并发能力和更自然的音质,支持英语、西班牙语、法语、葡萄牙语、德语和日语,并提供词级时间戳以支持实时高亮、打断处理和精细化对话编排。部署方式涵盖云端、VPC 及本地环境,满足企业对延迟、合规及数据管控的多元需求。
行业拓展方面,Rime 于 2025 年在餐饮、医疗等场景实现初步落地,2026 年起进一步聚焦企业级 speech-to-speech 能力。其客户常见于客服、IVR、航空、金融等高通话频次行业。当前行业核心痛点包括声音机械感强、延迟过高、专有名词发音不准、多人对话易失真以及高并发下稳定性不足。Rime 通过真实对话数据与语音学建模,优化了对数字、字母拼读、口音及代码切换等复杂场景的处理能力。
在竞争格局中,Rime 面临的对手涵盖两类:一类是通用或企业级 TTS 平台,如 ElevenLabs、Resemble AI、Cartesia、LMNT、Hume AI、Deepgram 及 OpenAI 语音能力;另一类是聚焦实时语音交互与对话基础设施的公司。相较之下,Rime 的差异化优势在于语言学科研驱动、真实对话数据训练、低延迟设计及企业级部署能力,而非仅追求音色悦耳。
Rime 的核心价值不仅在于提供更自然的合成语音,更在于帮助企业在客服、医疗、餐饮和金融等高频率通话场景中,提升可用性、准确率与转化效率,真正让语音交互成为可依赖的业务生产力工具。
伴随新资金注入,Rime 正加速团队扩张,并向全球顶尖人才发出邀请,共同塑造语音 AI 的未来方向。
