返回全部动态

OraRL:将标注作为轨迹的高效可扩展视频多模态强化学习

原标题:Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

arXiv cs.CV一手来源研究质量 90

AI 摘要

南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

1]VCIP, School of Computer Science, Nankai University 2]Brain and Artificial Intelligence Lab, Northwestern Polytechnical University 3]State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences 4]NKIARI, Futian, Shenzhen ]†Corresponding author. \mclink[Keywords]Multimodal large language models, unified video perception, reinforcement learning. \projecthttps://orarl.github.io/ \datahttps://huggingface.co/datasets/OraRL/OraRL-Data \mcmo


发布时间:2026-08-24 12:00
抓取时间:2026-08-24 12:19
来源机构:arXiv
阅读原文arxiv.org