CLIP-CC-Bench:评估视频语言模型的长段落视频描述能力
原标题:CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
AI 摘要
CLIP-CC-Bench 是一个用于评估视频语言模型长段落视频描述能力的基准测试套件,基于5小时电影内容构建了200个约90秒的片段,每个片段配有约400字的人工参考描述。研究团队使用5个LLM嵌入模型组成的集成和粗粒度与细粒度两种语义匹配方法,评估了17个视频语言模型,发现最佳模型平均HM-CF得分仅为0.67,表明长视频描述任务尚未解决。该基准测试的评估协议具有高可靠性,排名在1000次重采样中保持稳定,相关代码和数据已开源。
正文节选
CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Abstract Benchmarking video-language models has largely focused on short clips and single-sentence metrics, leaving open whether current systems can generate accurate long-form, paragraph-level descriptions. We introduce CLIP-CC-Bench, an evaluation suite for long-form video description built from 5 hours of movie content segmented into 90-second clips, each paired with an expert-written paragraph-style referen