返回全部动态

校准分布奖励学习:对齐人类感知以提升视频生成

原标题:Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation

arXiv cs.CV一手来源研究质量 84

AI 摘要

arXiv 论文提出一种用于视频生成的校准分布奖励学习框架,通过精英引导过滤校准偏好数据、将视频质量建模为多维奖励分布并使用 Wasserstein 距离对齐人类偏好,以及在 GRPO 中引入基于 Wasserstein 的分布对齐,以提升奖励信号的可靠性和生成视频的感知一致性。实验表明该方法在奖励建模和视频生成上均有效,代码已开源。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[Page 1] Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation Nai-Xin Zhai1,11†, Weihua Cheng2,11, Dexu Yu3, Yikai Gu4, Hanwen Du5,11, Junchen Fu6,11, Chenxi Huang7, Yingwei Song8, Liyuan Lillian Ma9, Yang Ran3, Youhua Li1*, and Yongxin Ni10* 1 City University of Hong Kong 2 ShanghaiTech University 3 Fenz.AI


发布时间:2026-08-25 12:00
抓取时间:2026-08-25 12:37
来源机构:arXiv
阅读原文arxiv.org