Flickr30K Entities 数据集下载 | 图像文本实体定位基准 视觉 grounding 核心数据集
Flickr30K Entities 是 Flickr30K 数据集的权威扩展版本,专为图像中文本实体提及的精确定位(Visual Grounding / Phrase Localization)而构建。该数据集在原有 158K 条图像描述句子的基础上,新增了 244K 条共指链(coreference chain)和 276K 个手动标注边界框(bounding box),实现了自然语言描述与图像区域级别的细粒度对齐,是视觉语言预训练、多模态大模型、图像文本 grounding 等方向的核心基准数据集。
数据集内容覆盖范围
Flickr30K Entities 基于 Flickr30K 的 31,783 张真实场景图像,提供多层次结构化标注:
图像描述:158K 条人工撰写的图像描述句子,覆盖日常生活、人物、动物、场景等多样化主题
共指链标注:244K 条 coreference chain,将同一图像内不同句子中对同一实体的指代关联起来,解决跨句实体一致性问题
边界框标注:276K 个精确的手动标注 bounding box,将文本中的名词短语与图像中的对应区域一一映射
实体类别:涵盖人、动物、物体、场景部件等多种实体类型,支持细粒度的短语定位任务
核心应用场景与可用途径
Flickr30K Entities 广泛应用于以下前沿研究与工程方向:
视觉语言理解与定位
Phrase Grounding(短语定位):给定图像描述中的名词短语,在图像中定位对应的边界框区域
Referring Expression Comprehension(指代表达理解):根据自然语言描述找到图像中的目标对象
Visual Question Answering(视觉问答):结合实体定位提升 VQA 模型的空间推理能力
多模态大模型与预训练
视觉语言预训练(VLP):作为 CLIP、ALBEF、BLIP、LLaVA 等模型的 grounding 能力评测基准
多模态对齐学习:训练图像-文本跨模态对齐模块,提升大模型的细粒度理解能力
指令微调(Instruction Tuning):用于构建视觉 grounding 指令数据集,增强多模态 LLM 的定位能力
计算机视觉与 NLP 交叉研究
图像字幕生成(Image Captioning):评估生成描述中实体与图像区域的对应准确性
实体级图像检索:支持基于文本实体的细粒度图像搜索与匹配
共指消解(Coreference Resolution):跨模态共指链的构建与推理研究