AudioCC交我学
作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术创新与应用实践的最新动态。我们将用通俗易懂的语言拆解复杂理论,用数据与实验结果验证技术价值,带你快速了解最新、最有趣的学术论文,打破学术与大众之间的壁垒,让你在碎片化的时间里也能 get 到前沿知识!
一、任务介绍:什么是音频/语音水印(Audio Watermarking)?
随着语音克隆与生成式语音质量快速提升,诈骗、深度伪造传播、版权与合规风险显著上升。仅依赖被动检测(classifier)容易遭遇域迁移失效;水印提供一种更“主动”的provenance / attribution路径:在生成/分发阶段嵌入隐蔽标记,使得后续能够检测或解码,从而支持鉴别、溯源与合规审核。
二、任务分析:系统由哪些模块构成?如何部署?
一个典型水印系统包含三部分:
1. Generator(嵌入器):特征提取 → 比特嵌入 → 融合 → 生成水印音频;
2. Distortion layers(失真/攻击模拟):训练时模拟攻击分布;
3. Extractor/Detector(提取器/检测器):输出“是否带水印”或直接解码比特。
部署上常见两类:
Model-level:平台在生成端强制加水印;
User-level:在分发侧加水印(更难),且两者面对的攻击者能力假设不同,尤其在VC/TTS场景下差异更大。
三、 挑战与威胁模型:AI时代攻击面变了
本次分享的主设定是黑盒攻击(不需要梯度),攻击目标是“去水印 + 保持高音质”;AI时代的新现实是:VC/TTS可以通过“重建音频”绕开水印,这类攻击往往比传统加噪/压缩更强。
攻击面按来源可分三类:
Signal-level:pitch shift / time stretch / cut / codec / filter / noise …
Physical:播放-录制(距离、环境、设备)
AI-induced:VC / TTS(zero-shot vs adaptive)
同时也需要警惕两类“对齐假设”被破坏:
频率对齐假设容易被pitch shift破坏;
时间对齐假设容易被time stretch / cut破坏;仅靠“加噪/压缩”不足以证明鲁棒。
四、评测口径:不仅要“能解出”,还要“在高音质约束下能解出”
分享中强调三组指标:
Fidelity:嵌入后音质(听感/客观指标);
Robustness:攻击后仍可检出/提取;
Fidelity-tolerant robustness:在ViSQOL/PESQ等音质约束下比较鲁棒性(更贴近真实对手)。
评测设计上,复现多个公开水印方案,在同一框架下对信号级/物理级/AI诱导攻击进行系统对比,并输出ACC + 音质约束下鲁棒性。数据覆盖语音(LJSpeech、LibriSpeech)以及更复杂域(歌声/音乐,如M4Singer),任务以multi-bit为主,ACC是关键指标。
五、关键发现:哪些攻击“高音质也能打穿”?
以下结论为本次分享的核心takeaways:
5.1 Pitch shift:几乎“通杀级”去水印
所有方案都对pitch shift脆弱;即使在高音质(ViSQOL > 4)的约束下仍可显著去水印,ACC < 0.6,接近“近乎完全移除”。
5.2 去同步(time stretch / cutting):多数方法致命,冗余嵌入是关键缓解
除Timbre / WavMark / Patchwork外,多数方案对time stretch(中等音质)敏感,ACC < 0.5;“重复嵌入/冗余”能显著增强抗去同步能力。
5.3 噪声、MP3、重采样:对“覆盖过训练失真”的方法相对可控
AudioSeal、Timbre、RobustDNN、FSVC对常见扰动相对更稳,多数情况下ACC ≥ 0.7,部分可 > 0.8;主要原因是训练阶段覆盖这些失真并进行结构适配。
5.4 低通(LPF)往往更危险:很多水印模式“寄生在高频”
高通下多数方案ACC > 0.8,但低通常导致ACC掉到 < 0.6(少数例外)。
5.5 物理重录:强分布外扰动,远距离普遍失守
真实分发常见外放/盗录,链路叠加混响、噪声、频响与距离衰减,且与数字域失真不同、难覆盖。多数方案数字域ACC≈1,但重录后常降到ACC≈0.5;远距离(2.5m/5m)几乎全部掉到 < 0.6,甚至 < 0.4。
5.6 VC/TTS:高音质的“重建式去水印”
VC:zero-shot与adaptive/few-shot都有效,ACC被压到约50%。
TTS:zero-shot下所有方案ACC≈50%;adaptive下仅Timbre在其条件下表现出一定存活。
总体判断:SoK对当前语音水印给出偏负面结论,根因可概括为vulnerability + irrevocability。
六、基准评测补充:SoK vs AudioMarkBench(从比特恢复走向“检测部署视角”)
本次分享明确两类评测核心差异:SoK侧重比特恢复率与攻击覆盖面,AudioMarkBench补齐检测部署视角四大关键维度,更贴近实际落地需求。
• 同时评测Removal(移除)与Forgery(伪造),规避“栽赃式误报”风险;
• 引入FNR/FPR(漏报/误报率)+阈值τ协议,量化检测性能;
• 考量黑盒查询预算:攻击者大量查询检测器API时,移除攻击的可行性;
• 评估公平性:分析不同语言、性别组的鲁棒性差异。
核心发现:黑盒伪造攻击通常需大幅牺牲音质;但黑盒移除攻击,在攻击者可高频查询检测器API时,仍能在保音质前提下成功。
七、代表方法速览
AudioSeal(ICML’24):局部化水印,联合生成器/检测器与样本级定位损失,加入感知损失;检测端单次前向,速度显著提升。
MaskMark(ICASSP’24):谱图乘性掩码注入密钥,增强对神经变换、部分信号处理的鲁棒性。
Timbre Watermarking(2023):面向语音克隆,频域嵌入+重复嵌入提升稳健性;训练用失真层模拟克隆链路,增强泛化能力。
WavMark(2024):解决长语音定位问题,INN可逆网络端到端水印;BFD替代SyncCode,滑窗匹配定位,偏移模块兼容定位偏差解码。
TraceableSpeech(2024):内生式水印,联合优化TTS与水印,帧级嵌入/提取,对语音拼接更稳定。
DiscreteWM(2025):离散隐空间抗连续扰动,VQ表征+ID模运算嵌入,容量达1秒1–150bits。
八、结论与行动项:水印落地“可依赖”的核心短板
要实现可部署、可迭代的音频水印方案,优先聚焦三大主线:
训练层面:覆盖生成式重建、物理链路等更多真实场景失真;
结构层面:强化同步/定位机制,降低对固定频带、帧对齐的依赖;
安全层面:实现密钥轮换,降低伪造、覆盖攻击的可行性。
九、参考文献
1. Wen Y, Innuganti A, Ramos A B, et al. SoK: How robust is audio watermarking in generative AI models?[J]. arXiv preprint arXiv:2503.19176, 2025.
2. Liu H, Guo M, Jiang Z, et al. Audiomarkbench: Benchmarking robustness of audio watermarking[J]. Advances in Neural Information Processing Systems, 2024, 37: 52241-52265.
3. San Roman R, Fernandez P, Elsahar H, et al. Proactive Detection of Voice Cloning with Localized Watermarking[C]//ICML 2024-41st International Conference on Machine Learning. 2024, 235: 1-17.
4. O’Reilly P, Jin Z, Su J, et al. Maskmark: Robust neuralwatermarking for real and synthetic speech[C]//ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2024: 4650-4654.
5. Liu C, Zhang J, Zhang T, Yang X, Zhang W, Yu N. Detecting Voice Cloning Attacks via Timbre Watermarking[C]//Network and Distributed System Security Symposium. 2024. DOI:10.14722/ndss.2024.24200.
6. Chen G, Wu Y, Liu S, et al. Wavmark: Watermarking for audio generation[J]. arXiv preprint arXiv:2308.12770, 2023.
7. Zhou J, Yi J, Wang T, et al. TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking[C]//Proc. Interspeech 2024. 2024: 2250-2254.
8. Ji S, Jiang Z, Zuo J, et al. Speech watermarking with discrete intermediate representations[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2025, 39(23): 24239-24247.
