ChatGPT、DeepSeek 等语言模型具备「深度推理」(Reasoning)能力,这类模型会在回答问题前先进行一段较长的推论过程,使回答的品质大幅提升。

不过,这种「先停下来思考再作答」的方式,虽然能产生更高品质的回应,却不太适用于需要即时反应的语音互动场景。

现在,台大李宏毅教授团队与微软研究人员合作开发出STITCH,让口语语言模型(即输入语音、输出语音的大型语言模型, Spoken Language model)能「边说话边进行深度推理」。

这代表使用STITCH 技术的语音语言模型,在与你对话时,不需要停顿,就能给出经过深度推理后的回应!

论文地址 :https://arxiv.org/abs/2507.15375

项目主页与demo:https://d223302.github.io/STITCH/index_zh.html


作者团队来自:

工业界:微软

学术界:台湾大学李宏毅团队


STITCH 的贡献

STITCH 提出一种交互产生深度思考以及语音回覆的输出方式,使得模型在回覆的同时,能够一边输出有声的语音回覆,一边进行无声的深度思考;

STITCH 巧妙利用以下观察:模型产生一段2秒的语音输出只需要0.4秒,剩下的1.6秒可以拿来做无声的深度思考。透过交互产生语音输出与无声思考,模型就可以在播放语音给使用者的同时进行深度思考;

STITCH 在数学推理上大幅超越无法进行深度思考的基线模型,且与无法深度思考的基线模型有一模一样的延迟。