ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式坍缩
原标题:ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration
AI 摘要
南方科技大学与腾讯优图实验室联合提出 ReNFT 方法,用于修复扩散模型在奖励后训练中出现的模式坍缩问题。该方法通过内部概率质量重新校准,在不依赖外部信号或修改文本编码器的情况下,恢复生成器内部的多样性。实验表明,ReNFT 在 PickScore 和 GenEval 上保留了 NFT 奖励的 98.9% 和 99.0%,同时将 DreamSim-Div 分别提升了 58.8% 和 55.0%。
正文节选
ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration Abstract Reward post-training of diffusion generators inevitably concentrates probability mass on a few reward-favored modes, a mode collapse that erases within-prompt diversity. Existing methods for mitigating collapse rely on external signals or interfaces, augmenting the reward with perceptual objectives, adjusting reference regularization, or modifying the text encoder, but none repairs an adap