来自 Hugging Face 的 Vaibhav Srivastav 最近在推特上发布了一条令人振奋的突破:Speech to Speech语音交互系统,可以极大地提升了人与机器之间的沟通效率与体验。
GitHub 链接:https://github.com/eustlb/speech-to-speech
语音活动检测:使用Silero VAD v5 语音转文本:采用Whisper模型 语言模型:可以使用任何指令型模型 文本转语音:选择Parler-TTS

在交流时有朋友向Vaibhav问道:
"我能不能把语言模型换成翻译模型,做一个实时语音翻译器呢?"
Vaibhav的回答也是相当鼓舞人心:
"当然可以!只需要换一下LLM的骨干网络,再给一个自定义的翻译指令就行。几行代码就能搞定!"
参考链接
https://twitter.com/reach_vb/status/1824059903201173621
