ICASSP 2022 语音合成和语音识别简报

语音合成领域统计列表请访问http://yqli.tech/page/tts_paper.html,语音识别领域论文统计请访问http://yqli.tech/page/asr_paper.html。开源语音数据查询 http://yqli.tech/page/data.html。如何查找语音资料请参考文章https://mp.weixin.qq.com/s/eJcpsfs3OuhrccJ7_BvKOg)。读者有什么建议可以直接给我发消息,我将不断修改该统计。如有转载,请注明出处。欢迎关注微信公众号:低调奋进。


ICASSP 2022有1906篇文章,ICASSP 2021有1757篇文章,文章数量较多,本文的统计不保证完全正确,读者可参考性​阅读。

ICASSP 2022 文章链接

https://docs.google.com/spreadsheets/d/1YgWCNhQTWlmx7HGq3W74OuPGVN-ThTRC92TIiyoNd8U/edit?usp=sharing

ICASSP 2021 文章链接

https://docs.google.com/spreadsheets/d/1hUV7dUoI4HMkhrcsU8O4rPUscrXfy8AXHHQ9GP0CfjU/edit?usp=sharing


一 语音合成篇

以下表一给出具体分类说明。图一为icassp 2021和2022文章总数,2021有63篇文章,2022有​89篇文章。表二和图二为icassp 2021和2022语音合成每个研究方向的文章分布状况以及对比,由此可知声学模型、声音转换、情感合成系统、声码器和歌唱等占据绝对的​优势。

表一  语音合成分类说明

分类

说明

前端

多音字,韵律,g2p等等。

声学模型

语言特征转声学特征,attention工作,多说话人以及双重学习

声码器

波形生成

个性化

少数据,脏数据应用等自适应

多语言

多语言模型

歌唱合成

歌唱和音乐合成

情感

风格和情感

多模态

主要搜集talking head文章

声音转换

基于GAN方案和特征解耦方案

S2S

 speech-to-speech

其它

基于EEG合成,开源数据,MOS评测以及语音合成的应用

图1 语音合成论文总数

表二  语音合成论文分布情况

icassp 2021icassp 2022
前端36
声学模型1818
声码器66
个性化34
多语言24
歌唱合成46
情感风格611
多模态23
声音转换1423
其它58
total6389

图2 语音合成论文分布情况饼状图和柱状图

ICASSP 2022 文章链接

https://docs.google.com/spreadsheets/d/1YgWCNhQTWlmx7HGq3W74OuPGVN-ThTRC92TIiyoNd8U/edit?usp=sharing

二 语音识别篇

语音识别的文章分类参照表三说明。ICASSP 2022的语音识别文章有146篇,具体的文章分布参见表4和图3的饼状图和柱状图​。(去年没统计识别,所以不做对比)

                                  表三  语音识别分类说明

分类

说明

general

包括传统、混合语音识别,以及对asr的优化

ctc

ctc优化

rnn-t

rnn-t的优化

aed

aed优化

dataset

开源数据库

data aug

数据增广

lm

语言模型研究

multilingual

多语音系统以及code-switch

personal

少数据量自适应以及个性化ASR

rescoring

多种模型联合打分

unsupervised

无监督或者自监督学习

accent ,dialect

口音和方言

other

其它方向研究,包括系统评价标准等等

robust鲁棒性
speaker diarizationspeaker diarization

multichannel

多通道
speech translation语音翻译
multi-modal多模态

                         表4 语音识别研究方向分布情况

general28
ctc4
rnn-t6
aed4
dataset3
data augmentation3
lm4
multilingual6
personal | adaptation9
rescoring6
unsupervised18
accent1
multichannel4
robust4
other29
speaker diarization9
speech translation2
multimodal6
total146

                

                                图3 语音识别研究方向饼状图和柱状图

      

ICASSP 2022 文章链接

https://docs.google.com/spreadsheets/d/1YgWCNhQTWlmx7HGq3W74OuPGVN-ThTRC92TIiyoNd8U/edit?usp=sharing


版权声明:本文为liyongqiang2420原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。