在自然的人机对话中,“系统能否被打断”以及“何时应停止发言并转而倾听用户”是决定交互自然性的关键问题。理想的语音对话系统(Spoken Dialogue System, SDS)不应只是机械地遵循“你一句、我一句”的轮替模式,而应像人与人交流那样具备全双工交互能力:在说话的同时持续监听,并在用户确有插话意图时及时让出话轮。然而,要让系统真正实现这一点,仍然面临诸多挑战。
构建了首个基于真实人类对话录音的语义感知打断检测基准 SID-Bench 提出了新的综合评价指标 APT (Average Penalty Time) 设计了一个基于大语言模型的语义感知打断检测模型

论文题目:Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
作者列表:夏康翔,穆秉甡,石宪,徐进,谢磊
论文预印版:https://arxiv.org/abs/2603.24144
仓库链接:https://github.com/xkx-hub/SID-bench
背景动机
近期,ICASSP 2026 首届人类语音对话系统(HumDial)挑战赛[1]专门设立了全双工交互赛道,引发了业界广泛关注。实验室此前的工作 Easy Turn [2]聚焦于实时对话中的轮次检测,旨在动态判断系统应继续倾听、生成回应,还是保持静默。而在自然的人机对话中,“系统能否被打断”以及“何时应停止发言并转而倾听用户”是决定交互自然性的关键问题。
ICASSP2026|首届类人语音对话系统(HumDial)挑战赛总结
Easy Turn:全双工口语对话系统中融合声学与语言模态的鲁棒轮次转换检测
现有人机语音对话交互中的打断方案大致走向了两个极端:基于 VAD 的方法响应非常快,但往往只要检测到用户发声就立刻触发中断,容易把正常反馈误判成打断;而更鲁棒的端到端模型虽然不容易误触发,却常常停得太慢,错过用户真正想接话的时机。与此同时,这个方向还缺少足够真实、统一的评测框架[3]。已有 benchmark[4] 多依赖 LLM 生成文本和 TTS 合成语音,难以覆盖真实人类对话中的时序、语气和情绪细节[5];现有指标也难以用一个简洁直观的分数统一反映“响应速度”和“打断稳定性”之间的权衡。
SID-Bench 构建
为了兼顾语义准确性和时间精度,文章设计了一个半自动标注流程。
第一步:先让大模型分析文本,在用户话语中标出真正开始表达“实质性意图”的那个词,也就是插入一个标签。第二步:使用 Kaldi 对音频进行强制对齐,得到每个词级别的时间戳。最终把LLM给出的语义断点和Kaldi给出的时间边界对齐,将第一个实质性词的首音素起始时间定义为真实打断点。

图1 数据标注流程图
借助这套标注流程,论文构建了SID-bench。和已有很多基于 LLM 生成文本、再用 TTS 合成语音的 benchmark 不同,SID-Bench 完全建立在真实人类对话录音之上,更能保留自然对话中的时序、语气、停顿和情绪等细节,因此更贴近真实使用场景。数据集是双语的,包含中文和英文,总共约 3700 个测试样本,来自大约 10 小时精筛后的音频,打断位置的标注的经过人工校验。
表1 SID-bench 数据构成

提出的方案
针对语音对话系统的语义打断文章作者提出了一个大模型驱动的打断检测框架,结构如图2所示。

图2 SID-model 结构图
整体架构主要由两部分组成:Audio Encoder提取声学特征,LLM Decoder建模上下文并判断是否存在打断意图。具体来说:使用 Audio Transformer (AuT) 编码原始音频,然后把音频特征送入轻量级LLM Qwen-0.6B,最终输出一个二分类结果:是否应该触发“Interrupt”
在训练阶段,论文把 interruption detection 建模成一个时序分类问题,而不是传统的一次性整句判别。对于一段带有已知 interruption point 的训练音频,作者不会只拿完整音频训练一次,而是从这段音频中随机裁剪出许多不同长度的前缀片段。如果这个片段的末端还在 ground-truth interruption point 之前,那么这个片段就被标为负例,即当前还不应触发中断;如果片段末端已经越过 interruption point,那么它就被标为正例,表示此时应该识别为真实打断。
在推理阶段,输入被切分成固定大小的 chunk。每到一个新的时刻,模型都不是只看当前块,而是将历史 chunk 累积起来一起输入。这样,模型每一步都能基于完整历史上下文重新判断当前意图。为了解决真实 interruption 边界附近预测抖动的问题,作者在推理端增加了一个简单但很有效的决策平滑机制:只有当模型连续 K 次都输出 Interrupt 时,系统才真正执行 stop 命令。这个策略本质上是在延迟极小的前提下,提高决策稳定性,减少因为瞬时抖动导致的错误中断。
实验结果
论文主要在自建的 SID-Bench 上对不同 interruption detection 系统进行比较。评测对象覆盖了几类有代表性的技术路线:
FSMN-VAD 代表最基础的纯 VAD 方案;
Freeze-Omni [6] (Silero-VAD) 和 FireRedChat (pVAD) 代表经过优化的级联式全双工系统;
Moshi 代表端到端实时语音对话模型;
作者提出的 SID-model 则是基于音频编码器和 LLM 的语义感知打断检测模型。
评测使用三类指标:
IRL(Interruption Response Latency)衡量系统对真实打断的响应延迟;
FIR(False Interruption Rate)衡量系统对非打断语音的误触发比例;
APT(Average Penalty Time)则把误打断和响应过慢统一换算成时间惩罚,作为一个综合指标。三项指标都是越低越好,但论文最强调的是 APT,因为它更直接反映真实交互中的整体体验。
此外,测试覆盖了多种条件,包括 英文对话、中文对话、噪声和静音场景。这意味着实验不只是比较模型在理想对话数据上的表现,也考察它们在非语义声学干扰下是否容易误触发。
表2 实验结果

实验结果表明,纯 VAD 路线虽然响应最快,但误触发问题严重。这在 FSMN-VAD 上表现得最典型。端到端模型虽然在某些对话场景里非常稳,但可能存在较大响应延迟,或者在非对话噪声下失稳。单纯改良 VAD 可以在一定程度上改善系统,但仍然难以同时解决速度与稳定性问题。Freeze-Omni 和 FireRedChat 分别偏向不同折中,但都没有达到很理想的综合结果。引入语义感知的 interruption 建模后,系统可以在低误触发和低延迟之间取得更好的平衡。
参考文献
[1]. The icassp 2026 humdial challenge: Benchmarking human-like spoken dialogue systems in the llm eraZhao Z, Wang S, Li G, et al. [C]//ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2026: 21850-21852.
[2].Easy turn: Integrating acoustic and linguistic modalities for robust turn-taking in full-duplex spoken dialogue systemsLi G, Wang C, Xue H, et al. [C]//ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2026: 16957-16961.
[3]. Guan-Ting Lin, Shih-Yun Shan Kuan, and et al., “Full-duplex-bench-v2: A multi-turn evaluation framework for duplex dialogue systems with an automated examiner,” arXiv preprint arXiv:2510.07838, 2025.
[4]. Yizhou Peng, Yi-Wen Chao, and et al., “FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems,” in Proc. Interspeech, 2025, pp. 176–180.
[5]. Gabriel Skantze, “Turn-taking in Conversational Systems and Human-Robot Interaction: A Review,” Comput. Speech Lang., vol. 67, pp. 101178, 2021.
[6]. Xiong Wang, Yangze Li, and et al., “Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM,” in Proc. ICML, 2025.
