返回全部动态

ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式坍缩

原标题:ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration

arXiv cs.LG一手来源研究质量 84

AI 摘要

南方科技大学与腾讯优图实验室联合提出 ReNFT 方法,用于修复扩散模型在奖励后训练中出现的模式坍缩问题。该方法通过内部概率质量重新校准,在不依赖外部信号或修改文本编码器的情况下,恢复生成器内部的多样性。实验表明,ReNFT 在 PickScore 和 GenEval 上保留了 NFT 奖励的 98.9% 和 99.0%,同时将 DreamSim-Div 分别提升了 58.8% 和 55.0%。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration Abstract Reward post-training of diffusion generators inevitably concentrates probability mass on a few reward-favored modes, a mode collapse that erases within-prompt diversity. Existing methods for mitigating collapse rely on external signals or interfaces, augmenting the reward with perceptual objectives, adjusting reference regularization, or modifying the text encoder, but none repairs an adap


发布时间:2026-09-02 12:00
抓取时间:2026-09-02 12:13
来源机构:arXiv
阅读原文arxiv.org