返回全部动态
OraRL:将标注作为轨迹的高效可扩展视频多模态强化学习
原标题:Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
AI 摘要
南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
1]VCIP, School of Computer Science, Nankai University 2]Brain and Artificial Intelligence Lab, Northwestern Polytechnical University 3]State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences 4]NKIARI, Futian, Shenzhen ]†Corresponding author. \mclink[Keywords]Multimodal large language models, unified video perception, reinforcement learning. \projecthttps://orarl.github.io/ \datahttps://huggingface.co/datasets/OraRL/OraRL-Data \mcmo
发布时间:2026-08-24 12:00
抓取时间:2026-08-24 12:19
来源机构:arXiv