返回全部动态

PHA-Net:基于原型的文本-视频检索分层对齐网络

原标题:PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval

arXiv cs.IR一手来源研究质量 83

AI 摘要

本文提出了一种名为PHA-Net的原型分层对齐网络,用于文本-视频检索任务。该方法通过引入模态共享原型作为桥梁,并设计原型支持的令牌合并模块和原型对比损失,以高效优化跨模态对齐。在MSR-VTT、ActivityNet、VATEX和Charades四个基准上,PHA-Net在召回率总和上分别提升了8.8%、19.2%、0.7%和4.9%,验证了其有效性。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Computer Science > Information Retrieval Title:PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval View PDF HTML (experimental) Abstract:With the emergence of large-scale image-text pre-training models, e.g., CLIP, text-video retrieval has experienced substantial advances in recent years. Existing best-performing methods involve aligning cross-modal semantics at individual, local, and global levels simultaneously, raising concerns about the intrinsic sema


发布时间:2026-08-04 12:00
抓取时间:2026-08-04 12:57
来源机构:arXiv
阅读原文arxiv.org