全部版块 我的主页
› 论坛 › 提问 悬赏 求职 新闻 读书 功能一区 › 经管文库(原现金交易版)
103 0
2026-05-15

AVSpeech 视听语音数据集|大规模无噪语音视频研究数据



AVSpeech 视听语音数据集|大规模纯净语音视频研究资源

AVSpeech 是面向视听语音领域的大规模纯净视听数据集,专为语音识别、唇语识别、多模态语音研究打造,数据质量高、覆盖广。



1. 内容覆盖范围

数据规模:约4700 小时纯净语音视频片段,源自29 万个公开视频

片段时长:单段3-10 秒,无背景噪音干扰

核心特点:音画强对齐,声音唯一对应画面中说话人

覆盖维度:多语种、多人物、多样面部姿态,场景丰富



2. 适用范围与可用途径

适用领域:视听语音识别、唇语识别、多模态 AI、语音增强、语音分离、学术论文实验

可用途径:高校科研、AI 算法开发、模型训练验证、竞赛项目、语音技术研发





AVSpeech – 视听语音数据集.zip
大小:(8.48 MB)

只需: RMB 5元  马上下载

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

相关推荐
栏目导航
热门文章
推荐文章

说点什么

分享

扫码加好友,拉您进群
各岗位、行业、专业交流群