全部版块 我的主页
› 论坛 › 提问 悬赏 求职 新闻 读书 功能一区 › 经管文库(原现金交易版)
75 0
2026-06-29

DiDeMo时间定位数据集下载 | 视频自然语言时刻检索基准数据集 | 含训练/验证/测试集



内容覆盖范围


DiDeMo(Distinct Describable Moments)是由Flickr采集的视频时间定位基准数据集,专为自然语言驱动的视频时刻检索任务设计。数据集将视频统一剪辑为30秒以内片段,并按5秒间隔划分标注单元以降低人工标注复杂度。整体规模覆盖10,464个视频,细分为训练集8,395个、验证集1,065个、测试集1,004个,总计包含26,892个经人工验证的精确时刻标注。



该数据集的核心价值在于描述文本的高细粒度与多维度覆盖:每条描述均经过多轮验证,确保单一时刻对应唯一语义。描述内容涵盖摄像机运动(如推轨、变焦)、时间转换指标(如"第一次""随后")及具体活动行为,适用于需要理解时序关系与视觉语义对齐的模型训练。



可用途径与适用场景


学术研究:作为视频自然语言定位(Video-Language Grounding)的标准评测基准,广泛用于CVPR、ICCV、ECCV等顶会的时刻检索、时序动作定位、视频问答等方向研究。


模型训练:支持跨模态预训练模型(如MCN、2D-TAN、Moment-DETR等)在时序边界回归与语义对齐任务上的训练与调优。


工程落地:为短视频内容检索、智能视频剪辑、自动化字幕对齐、监控事件定位等AI应用提供高质量标注数据支撑。


教学演示:适用于计算机视觉、多媒体分析相关课程的案例教学与实验复现。



bffb3bde-f17c-4f4b-874b-8d63dad86546.png


DiDeMo 时间定位数据集.zip
大小:(45.13 KB)

只需: RMB 5元  马上下载


二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

相关推荐
栏目导航
热门文章
推荐文章

说点什么

分享

扫码加好友,拉您进群
各岗位、行业、专业交流群