文章来源于低调奋进,作者知源
文章较多,统计难免存在错误,故本文仅供参考,下面是资源的链接。
https://www.isca-speech.org/archive/interspeech_2022/index.html
tts:https://tts-tutorial.github.io/interspeech2022/INTERSPEECH_Tutorial_TTS.pdf
vc:https://tts-tutorial.github.io/interspeech2022/INTERSPEECH_Tutorial_VC.pdf
https://docs.google.com/spreadsheets/d/1Bz52a3vMjLGvitx4M6OKp4w6YjVfjSAl-pvYS_aHrzY/edit?usp=sharing
以下表一给出具体分类说明。图一为interspeech 2022文章总数,共有178篇。表一和图二为语音合成每个研究方向的文章分布状况以及对比,由此可知声学模型、声音转换、情感合成系统、声码器、个性化和歌唱等占据绝对的优势。另外mos统计所有音频质量评估的文章,因为有相关的比赛,所以文章较多。
| adaptation | |
| dataset | 数据集 |
| mos | 音频质量评估等 |
分类 | 文章数量 |
| acoustic | 34 |
| adaptation | 12 |
| dataset | 8 |
| expressive | 24 |
| frontend | 6 |
| mos | 27 |
| multilingual | 6 |
| multimodal | 3 |
| other | 8 |
| singing | 12 |
| speech-to-speech | 4 |
| vc | 17 |
| vocoder | 17 |
| total | 178 |

具体文章列表参见:
https://docs.google.com/spreadsheets/d/1Bz52a3vMjLGvitx4M6OKp4w6YjVfjSAl-pvYS_aHrzY/edit?usp=sharing

语音识别的文章分类参照表三说明。interspeech 2022的语音识别文章有275篇,具体的文章分布参见表4和图3的饼状图。其中模型性能优化、rnn-t流式、多语言、无监督半监督、多人会议等场景鲁棒性以及多模态是研究热点。
| robust | 鲁棒性 |
| speaker diarization | speaker diarization |
multichannel | 多通道 |
| speech translation | 语音翻译 |
| multi-modal | 多模态 |
| 分类 | 文章数量 |
| accent | 4 |
| adaptation | 6 |
| ctc | 5 |
| data augmentation | 10 |
| dataset | 8 |
| general | 44 |
| lm | 22 |
| multilingual | 17 |
| multimodal | 11 |
| device | 5 |
| other | 35 |
| rnn-t | 22 |
| robust | 14 |
| speaker diarization | 20 |
| speech translation | 8 |
| unsupervised | 44 |
| total | 275 |
图3 语音识别研究方向饼状图


