返回全部动态
OpenCompass v0.5.4 发布:集成多模态评估与多轮推理
原标题:0.5.4
AI 摘要
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安装兼容性。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
# OpenCompass v0.5.4 Release Notes ## 🌟 Highlights ✨ **Multimodal Evaluation with VLMEvalKit:** OpenCompass now integrates VLMEvalKit for native multimodal dataset loading, OpenAI-compatible inference, and official VLMEvalKit evaluation metrics (#2586). ✨ **Multi-Round Evaluation:** `GenInferencer` now supports multi-round inference, accompanied by the new Multi-IF benchmark for evaluating multi-turn instruction following (#2557). ✨ **Expanded Model API Ecosystem:** Added LiteLLM as
发布时间:2026-08-26 14:41
抓取时间:2026-08-31 00:41
来源机构:Shanghai AI Laboratory