Interspeech 2026|Decoding the Ear(DeEAR):从人类偏好中客观量化语音表现力的对齐框架
原创3 months ago
Interspeech 2026|Decoding the Ear(DeEAR):从人类偏好中客观量化语音表现力的对齐框架

近年来,端到端口语对话(S2S)与语音合成(TTS)技术正加速从“可懂、可用”向“自然、拟人”发展。尤其在智能座舱、语音助手等实际应用场景中,用户对语音交互的期待已不再局限于内容准确,还希望模型能够展现接近真人的表现力,包括细腻的情绪起伏、…

26 0 0