返回全部动态
UniSwap:用于说话视频的流式音视频身份替换框架
原标题:UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
AI 摘要
UniSwap是一个用于说话视频中流式音视频身份替换的框架,通过统一的流式音视频扩散Transformer实现外观和声音的同步替换。它采用交换-重建流程解决训练数据稀缺问题,并结合上下文预训练、条件流式适应和高效自强制DMD等技术,将采样步骤从30步减少到3步。实验表明,UniSwap在音视频同步、身份保持、流式效率和长时生成稳定性方面表现出色。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos Abstract UniSwap enables synchronized appearance and voice replacement in talking videos through a unified streaming audio-visual diffusion transformer with specialized training and inference adaptations. Talking-video character replacement requires coordinated transfer of appearance and voice while preserving the source motion, scene, linguistic content, and audio-video timing. Existing methods use separately optimized models
发布时间:—
抓取时间:2026-08-14 13:41
来源机构:Hugging Face