本文来源丨Amphion

当语音大模型(SLM)从“个人设备”走向“智能家居/车载/公共服务”等多人共享场景时,新的风险出现了:模型可能将用户A的私密日程、隐私信息,误传给用户B。简单来说,语音助手需要明确 “哪些话能说、该对谁说”,团队称它为交互隐私(interactional privacy)。基于此,团队提出并发布VoxPrivacy:首个面向语音大模型的交互隐私评测基准,以系统化方式衡量模型在共享环境中是否能“说对话、也守规矩”。


✅「可量化、可复现的语音评测」让语音大模型“懂规矩”

VoxPrivacy的核心贡献是把“共享场景里哪些信息能说、该对谁说”这件事,做成了一套可量化、可复现的语音评测。不仅看模型会不会聊天,更看它能不能在多人、多轮、跨时间的对话里识别说话人、理解语境、做出正确隐私保护的决策。


✅基准与数据:

团队设计了三层难度任务(直接保密指令→ 说话人验证保密 → 无指令的主动隐私保护),覆盖“被要求保密”到“主动判断什么是隐私”的完整能力链路;并构建了7107 条、超过 32 小时的中英双语音频,另含18 位志愿者录制的真实语音验证集,确保评测更贴近真实使用场景。


✅评测与诊断:

在对9个主流语音大模型的评测中,团队发现共享场景下的核心风险并非“无法应答”,而是“过度应答”:当用户B发起询问时,模型可能将用户A刚刚提及的私人信息直接复述出来。
整体来看,不少开源模型在“信息能否说、该对谁说”的判断上正确率仅约50%。 这意味着,模型对隐私的处理几乎等同于“随机猜测”:你既无法信任它会将信息准确传递给目标对象,也无法确保它不会向无关人员泄露隐私。
进一步分析显示,问题根源在于模型对“多说话人+多轮对话”中的身份线索捕捉能力薄弱,导致隐私边界难以守住。

💡 VoxPrivacy 让“共享语音助手的交互隐私”第一次有了统一标尺,能测出问题、解释问题、更提供了明确的改进路径:团队同步开放 4000小时数据集,助力开发者通过微调优化模型隐私边界能力。

Demo网址:https://interactionalprivacy.github.io/