返回全部动态
SAGE:用于多实体视觉检索的语义属性图
原标题:SAGE: Semantic Attribute Graphs for Multi-Entity Visual Retrieval
AI 摘要
arXiv 论文提出 SAGE 框架,通过将密集文档图像中的语义实体解析为层次化图节点并采用多向量嵌入,缓解了标准视觉语言检索器因单向量编码导致的“语义稀释”问题。作者还构建了 DEAR 基准数据集,包含 1055 对查询-图像对,用于评估多实体视觉检索。实验表明 SAGE 在 DEAR 上显著优于基线,Recall@3 达 0.849,代码已开源。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
SAGE: Semantic Attribute Graphs for Multi-Entity Visual Retrieval Abstract Dense document images often contain many fine-grained visual and textual entities whose relevance depends on a user query. Standard vision-language retrievers encode cropped regions with a single vector, which can mix distinct entity signals and obscure the evidence needed for fine-grained retrieval. We call this failure mode Semantic Dilution and quantitatively show that it degrades entity-level retrieval as a function o
发布时间:2026-09-07 12:00
抓取时间:2026-09-07 12:30
来源机构:arXiv