AVSpeech 视听语音数据集|大规模无噪语音视频研究数据
AVSpeech 视听语音数据集|大规模纯净语音视频研究资源
AVSpeech 是面向视听语音领域的大规模纯净视听数据集,专为语音识别、唇语识别、多模态语音研究打造,数据质量高、覆盖广。
1. 内容覆盖范围
数据规模:约4700 小时纯净语音视频片段,源自29 万个公开视频
片段时长:单段3-10 秒,无背景噪音干扰
核心特点:音画强对齐,声音唯一对应画面中说话人
覆盖维度:多语种、多人物、多样面部姿态,场景丰富
2. 适用范围与可用途径
适用领域:视听语音识别、唇语识别、多模态 AI、语音增强、语音分离、学术论文实验
可用途径:高校科研、AI 算法开发、模型训练验证、竞赛项目、语音技术研发