校准分布奖励学习:对齐人类感知以提升视频生成
原标题:Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation
AI 摘要
arXiv 论文提出一种用于视频生成的校准分布奖励学习框架,通过精英引导过滤校准偏好数据、将视频质量建模为多维奖励分布并使用 Wasserstein 距离对齐人类偏好,以及在 GRPO 中引入基于 Wasserstein 的分布对齐,以提升奖励信号的可靠性和生成视频的感知一致性。实验表明该方法在奖励建模和视频生成上均有效,代码已开源。
正文节选
[Page 1] Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation Nai-Xin Zhai1,11†, Weihua Cheng2,11, Dexu Yu3, Yikai Gu4, Hanwen Du5,11, Junchen Fu6,11, Chenxi Huang7, Yingwei Song8, Liyuan Lillian Ma9, Yang Ran3, Youhua Li1*, and Yongxin Ni10* 1 City University of Hong Kong 2 ShanghaiTech University 3 Fenz.AI