本系列十篇文章,旨在对之前提到的十大趋势进行详细剖析。
本系列中将穿插科普、技术综述、技术发展路线,以及来自我个人与其他行业专家的思考。希望不论读者此前对语音技术与应用了解多少,都能从这一系列文章中获得有价值的观点。
本篇将围绕趋势四“算力降价是必然,端云融合有潜力”展开。大模型的爆火,进一步带动了芯片行业的繁荣。与其说大模型最利好的行业是AI,不如说是芯片;而最紧张的恐怕也是芯片行业。为什么呢?如果大模型无法持续创造更大价值,芯片行业将遭受更显著的冲击。语音作为AI的重要分支,也必将随着时代大背景一同起伏。
单位算力越来越便宜
以消费级显卡为例,我用 Gemini 3 总结了最近十年英伟达消费级显卡的性价比走势。如图所示,从2080到5090,七年时间,单位算力价格从 4.38美元/TOPS 下降至 0.6美元/TOPS(Gemini3总结,未做详细考证)

我们再来对比地平线主打的智能驾驶端侧芯片(数据由Gemini3整理,咨询了专业人士,认为数据比较合理):

显而易见,单位算力的价格持续下降,是端侧计算在未来普及的最重要前提。
端侧计算的价值——隐私、响应速度和成本
在计算密集型应用中,端侧计算具备三大优势:完美保护用户隐私、省去网络通信时间成本从而提升响应速度,以及对数据量大的应用能够显著降低计算与服务成本。
首先是隐私问题。语音数据相比文本,涉及生物信息。即便抛开语音中的文本内容,声纹本身也是相当敏感的特征。在很多应用特别是“始终在线”类型的产品中(目前这类产品已形成趋势,我们将在后续“被动记录”趋势中介绍),用户最关心的首要问题往往是隐私。将涉及大量生物信息的数据处理与隐私保护放在端侧,可完美解决这一顾虑。
其次是响应速度。语音交互的响应速度对用户体验至关重要。虽然我不完全认同“越快越好”,但“越合理越好”是肯定的。在需要快速响应的对话场景中,速度必须够快。纯云端方案因网络延迟与不稳定,其传输开销不可忽视。若语音识别、合成等模块都能部署在端侧,整体交互体验将显著提升。事实上,许多车载交互已采用端云融合策略,预计未来会有更多场景跟进。
最后是成本问题。语音服务的成本相对较高,目前主流API的语音转写价格约每小时1元。当用户量与数据积累到一定规模,API调用便显得不够经济。若将这部分成本转移至端侧芯片,则变为一次性投入。这对于被动记录、监控等场景尤其友好,可节省大量AI服务与维护成本。
端云融合的协同与挑战
端侧计算虽具重要价值,但纯粹依赖端侧如同信息孤岛,能力受限;纯粹云端智能则受网络延迟、数据隐私与安全的制约。因此,未来属于深度协同的云端融合。端与云的协同并非一成不变,而是随着技术发展持续迭代、动态调整。
智能体时代的端云协同
从技术路线看,目前已有很多落地案例。例如各类智能硬件现阶段主要依赖端侧承担传感器与简单感知功能,比如唤醒、快捷指令、声纹验证、音频降噪等前端处理。这些技术一方面保护用户隐私,一方面追求极致响应速度。更复杂的理解与推理任务,仍交由云端完成。
但随着智能体、大模型等AI软件能力的进化,以及芯片硬件实力的提升,这种协同方式将越来越灵活,端侧可承担的任务也会越来越多。比如通过意图识别动态调整端云任务分配,尽可能将端侧能完成的任务留在本地。这种动态、智能的协同方式,将随着AI与芯片的发展进一步渗透到更多应用之中。
端云协同的挑战
尽管单位算力价格持续下降,端侧仍受功耗、散热、存储、产品形态设计等因素限制。如何在各种约束条件下做出最优设计,对硬件和软件工程师而言都是一大挑战。
此外,端云融合作为一个复杂系统,也会增加整体系统的复杂度。如何合理设计并管理两端的状态同步与交互,或许也是一个关键的工程问题。
新的商业模式和机遇
云端融合的深化不仅是技术演进,更可能重塑整个语音AI的产业格局与开发模式。
商业模式的变化
单纯“按调用量付费”的云服务模式,可能演变为更复杂的混合模式。虽然目前已能看到这类模式的雏形,但整体来看,端侧成熟方案仍集中在低算力芯片和轻量级任务(如唤醒)。
对芯片与硬件厂商而言,其价值不仅在于出售硬件,更在于提供“算力+基础模型”的软硬一体解决方案。对AI算法公司来说,商业模式可能转为“授权费(端侧模型)+订阅费(云端高级服务)”。这意味着模型设计与芯片的结合将越来越紧密,商业模式也可能发生较大变化——甚至可能“为了这口醋,专门包顿饺子”。
新的场景和机遇
算力成本降低与融合架构的成熟,将推动语音等多媒体应用催生更多有意思的场景。工业领域的智能巡检、质检,面向消费者的智能家居、机器人、低功耗穿戴设备,智能座舱,沉浸式虚拟现实交互等等,都在等待更强大的端侧解决方案。
将来,我们关注的将不再是“有什么功能”,而是“如何更好地服务具体场景”。
结语
自ChatGPT引爆大模型、DeepSeek出圈以来,AI已走入普通用户的生活。从近两年技术发展与人们对AI的关注中,我们越来越感受到:
我们对智能的渴望是无限的,但任何单一资源——无论是端侧算力与功耗,还是云端的带宽与成本——都是有限的。
如何充分利用一切可用能力,依据场景特点与需求设计合理的产品,是我们持续需要思考的命题。在算力持续贬值的趋势下,我们也应思考:“端”的边界究竟在哪里?是手机、汽车、眼镜,还是小如充电宝的随身工作站?
