作者:知源

语音合成领域统计列表请访问

http://yqli.tech/page/tts_paper.html
语音识别领域论文统计请访问
http://yqli.tech/page/asr_paper.html
开源语音数据查询
http://yqli.tech/page/data.html
如何查找语音资料请参考文章
https://mp.weixin.qq.com/s/eJcpsfs3OuhrccJ7_BvKOg

ICASSP 2022有1906篇文章,ICASSP 2021有1757篇文章,文章数量较多,本文的统计不保证完全正确,读者可参考性阅读。

ICASSP 2022 文章链接

https://docs.google.com/spreadsheets/d/1YgWCNhQTWlmx7HGq3W74OuPGVN-ThTRC92TIiyoNd8U/edit?usp=sharing

ICASSP 2021 文章链接

https://docs.google.com/spreadsheets/d/1hUV7dUoI4HMkhrcsU8O4rPUscrXfy8AXHHQ9GP0CfjU/edit?usp=sharing


一 语音合成篇

以下表一给出具体分类说明。图一为icassp 2021和2022文章总数,2021有63篇文章,2022有89篇文章。表二和图二为icassp 2021和2022语音合成每个研究方向的文章分布状况以及对比,由此可知声学模型、声音转换、情感合成系统、声码器和歌唱等占据绝对的优势。

表一  语音合成分类说明
分类
说明
前端
多音字,韵律,g2p等等。
声学模型
语言特征转声学特征,attention工作,多说话人以及双重学习
声码器
波形生成
个性化
少数据,脏数据应用等自适应
多语言
多语言模型
歌唱合成
歌唱和音乐合成
情感
风格和情感
多模态
主要搜集talking head文章
声音转换
基于GAN方案和特征解耦方案
S2S
speech-to-speech
其它
基于EEG合成,开源数据,MOS评测以及语音合成的应用


图1 语音合成论文总数


表二  语音合成论文分布情况

icassp 2021icassp 2022
前端36
声学模型1818
声码器66
个性化34
多语言24
歌唱合成46
情感风格611
多模态23
声音转换1423
其它58
total6389
图2 语音合成论文分布情况饼状图和柱状图



ICASSP 2022 文章链接

https://docs.google.com/spreadsheets/d/1YgWCNhQTWlmx7HGq3W74OuPGVN-ThTRC92TIiyoNd8U/edit?usp=sharing


二 语音识别篇

语音识别的文章分类参照表三说明。ICASSP 2022的语音识别文章有146篇,具体的文章分布参见表4和图3的饼状图和柱状图。(去年没统计识别,所以不做对比)

表三  语音识别分类说明

分类
说明
general
包括传统、混合语音识别,以及对asr的优化
ctc
ctc优化
rnn-t
rnn-t的优化
aed
aed优化
dataset
开源数据库
data aug
数据增广
lm
语言模型研究
multilingual
多语音系统以及code-switch
personal
少数据量自适应以及个性化ASR
rescoring
多种模型联合打分
unsupervised
无监督或者自监督学习
accent ,dialect
口音和方言
other
其它方向研究,包括系统评价标准等等
robust鲁棒性
speaker diarizationspeaker diarization

multichannel

多通道
speech translation语音翻译
multi-modal多模态



表4 语音识别研究方向分布情况

general28
ctc4
rnn-t6
aed4
dataset3
data augmentation3
lm4
multilingual6
personal | adaptation9
rescoring6
unsupervised18
accent1
multichannel4
robust4
other29
speaker diarization9
speech translation2
multimodal6
total146


图3 语音识别研究方向饼状图和柱状图



ICASSP 2022 文章链接

https://docs.google.com/spreadsheets/d/1YgWCNhQTWlmx7HGq3W74OuPGVN-ThTRC92TIiyoNd8U/edit?usp=sharing