中文读唇总动员：CNVSRC 2023 视觉语音识别挑战赛启动

由 NCMMSC 2023 组委会发起，清华大学、北京邮电大学、海天瑞声、语音之家共同主办的 CNVSRC 2023 中文连续视觉语音识别挑战赛即日启动，诚邀参与报名。

赛事官网：http://cnceleb.org/competition

视觉语音识别，也称唇语识别，是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前，唇语识别的研究方兴未艾，虽然在独立词、短语等识别上取得了长足进展，但在大词表连续识别方面仍面临巨大挑战。特别是对于中文而言，由于缺乏相应的数据资源，该领域的研究进展受到了限制。为此，清华大学在2023年发布了CN-CVS数据集[1]，成为首个大规模的中文视觉语音识别数据库，为进一步推动大词表连续视觉语音识别 (LVCVSR) 提供了可能。关于CN-CVS数据集的更多信息，可访问数据库官网 http://cnceleb.org 。

为推动这一研究方向的发展，清华大学联合北京邮电大学、海天瑞声和语音之家将在 NCMMSC 2023 举办中文连续视觉语音识别挑战赛 (CNVSRC, Chinese Continuous Visual Speech Recognition Challenge)。本次赛事以 CN-CVS 中文视觉语音识别数据库为基础数据，评估在录音室朗读 (Reading) 和网络演讲 (Speech) 两类场景下的 LVCVSR 系统的性能。比赛结果将在 NCMMSC 2023 会议上宣布并颁奖。

图1 CN-CVS 数据库官网 http://cnceleb.org

任务设置

CNVSRC 2023 共设有两个任务：

T1：特定说话人视觉语音识别 (Single-speaker VSR)
T2：多个说话人视觉语音识别 (Multi-speaker VSR)

前者侧重于针对某一特定说话人进行大量数据调优后的性能，后者侧重于系统对非特定说话人的基础性能。每个任务根据训练数据不同，又分为固定赛道 (Fixed Track) 和开放赛道 (Open Track)。

固定赛道仅允许使用 CN-CVS 数据集即各任务发布的开发集作为训练集，旨在验证算法的先进性。开放赛道则可以使用任何数据进行训练，旨在验证当前技术能够达到的性能上限。清华大学将提供固定赛道上的基线系统代码，供参赛者作为参考。

参赛方式

CNVSRC 2023 对任何个人和机构开放。目前，竞赛官网已经启动并接受报名。关于竞赛规则、时间节点等更多信息，可进入竞赛官网。

浏览器访问： http://cnceleb.org/competition

[1] C. Chen, D. Wang, T.F. Zheng, CN-CVS: A Mandarin Audio-Visual Dataset for Large Vocabulary Continuous Visual to Speech Synthesis, ICASSP, 2023.文章来源地址https://uudwc.com/A/Y6368