返回全部动态

CLIP-CC-Bench:评估视频语言模型的长段落视频描述能力

原标题:CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

Hugging Face Daily Papers一手来源研究质量 82

AI 摘要

CLIP-CC-Bench 是一个用于评估视频语言模型长段落视频描述能力的基准测试套件,基于5小时电影内容构建了200个约90秒的片段,每个片段配有约400字的人工参考描述。研究团队使用5个LLM嵌入模型组成的集成和粗粒度与细粒度两种语义匹配方法,评估了17个视频语言模型,发现最佳模型平均HM-CF得分仅为0.67,表明长视频描述任务尚未解决。该基准测试的评估协议具有高可靠性,排名在1000次重采样中保持稳定,相关代码和数据已开源。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Abstract Benchmarking video-language models has largely focused on short clips and single-sentence metrics, leaving open whether current systems can generate accurate long-form, paragraph-level descriptions. We introduce CLIP-CC-Bench, an evaluation suite for long-form video description built from 5 hours of movie content segmented into 90-second clips, each paired with an expert-written paragraph-style referen


发布时间:
抓取时间:2026-08-11 05:54
来源机构:Hugging Face
阅读原文huggingface.co