返回全部动态
OpenMOSS发布MOSS-VL-Instruct-0408多模态模型
原标题:OpenMOSS-Team/MOSS-VL-Instruct-0408
AI 摘要
OpenMOSS团队发布了MOSS-VL-Instruct-0408,这是一个基于MOSS-VL-Base-0408进行监督微调的多模态视觉语言模型,支持图像理解、长视频理解和实时流式交互。该模型采用交叉注意力架构和绝对时间戳,在视频理解基准上表现优异,如VideoMME和MLVU,并在视频理解上超越Qwen3-VL。模型已开源,采用Apache-2.0许可证。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
--- title: MOSS-VL-Instruct-0408 date: '2026-04-08T00:00:00.000Z' category: Multimodal-LLM status: SFT language: - en - zh library_name: transformers pipeline_tag: video-text-to-text license: apache-2.0 base_model: fnlp-vision/MOSS-VL-Base-0408 tags: - SFT - Video-Understanding - Image-Understanding - MOSS-VL - OpenMOSS - multimodal - video - vision-language --- <p align="center"> <img src="assets/logo.png" width="320"/> </p> # MOSS-VL-Instruct-0408 MOSS-VL is an open vision-language model
发布时间:2026-08-20 10:20
抓取时间:2026-08-20 10:21
来源机构:Hugging Face