返回全部动态

视觉对齐的图像编辑后续建议:对话系统中的三阶段框架

原标题:What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

Hugging Face Daily Papers一手来源研究质量 81

AI 摘要

该论文提出一个三阶段多模态框架,用于在图像创作对话中推荐后续编辑建议。框架结合监督微调、多目标强化学习和视觉验证器,在百万级用户的A/B测试中将视觉不一致率从3.7%降至0.9%,并显著提升推荐点击率、图像采纳率和平均对话轮数。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems Abstract A three-stage multimodal framework improves follow-up edit recommendations in image-creation conversations by combining supervised fine-tuning, multi-objective reinforcement learning, and visual verification. Conversational assistants increasingly recommend follow-up edits to help users continue a task. Existing systems primarily target text-only interactions, leaving image-creation convers


发布时间:
抓取时间:2026-08-12 01:41
来源机构:Hugging Face
阅读原文huggingface.co