返回主题地图

AI 视频

技术方向 · AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作 · 共 21 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月25日周五 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源5

MiniMax H3 武打动作 LoRA 发布:全量 int8 DiT 训练

作者在 Hugging Face 发布了一个基于 MiniMax H3 的武打动作风格 LoRA(wushu action),使用 924 段精选武打片段、以全量 int8-convrot DiT 加 bf16 Qwen3-VL 文本编码器训练 1000 步,主打 ComfyUI 即插即用。作者表示该版本表现仍未达预期,计划继续整理素材并训练包含更多运动动作

9月16日周三 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Hearmeman 发布 MiniMax-H3 NSFW LoRA 适配器集

HearmemanAI 在 Hugging Face 上发布了针对 MiniMax-H3 视频生成模型的 NSFW LoRA 适配器集合,包含动作类(如 HMNSFW V2.5、HMCumshot)和解剖类(如 HMPussy、HMBreasts)两类适配器,可叠加在角色或场景 LoRA 上使用。这些权重与 CivitAI 上的发布版本通过 SHA-256

9月15日周二 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LTX-2.5 无审查视频模型 v1.1 FP8 版发布

Hugging Face 用户 ChrisColeTech 发布了 LTX-2.5-uncensored-v1.1-FP8,这是基于 Lightricks/LTX-2.5 的预合并量化版本,将 Eros10 NSFW、DMD 蒸馏、IC-LoRA、IC-LoRA Detailer 和 Img2Vid 五个微调 LoRA 直接烘焙进权重。模型提供 GGUF 与

9月10日周四 · 1 条
正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源产品发布

NVIDIA 在 IBC 推出实时 AI 技术,助力广播、体育和流媒体

NVIDIA 在 IBC 2026 大会上宣布扩展其 AI for Media 产品组合,推出多项用于广播、体育和流媒体的实时 AI 技术,包括合成视频检测器(SVD)、3D 人体姿态估计、视频帧生成(VFG)、视频超分辨率(VSR)和 TrueHDR。这些技术已被 Dalet、TwelveLabs、Wowza、Vizrt 和 Ross Video 等公司集

9月9日周三 · 2 条
正文结构化主题已通过公开置信门槛
The Verge AI产品发布

亚马逊Prime Video推出AI口型同步配音技术

亚马逊Prime Video推出新AI功能,利用AI和视觉特效技术使演员口型与配音音频同步。该功能目前仅适用于德国剧集《Maxton Hall》的英语配音版,但计划未来扩展至更多内容。此前,Prime Video已在12部影视作品中试验AI辅助配音,而Meta和YouTube也推出了类似的口型同步自动配音功能。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

跨模态扩散模型对抗攻击与防御综述

这篇综述首次统一回顾了扩散模型在图像、视频和3D三种视觉模态下的对抗攻击与防御研究。文章提出了一种以任务为中心的全面分类法,按模态、攻击/防御和生成任务组织文献,并深入分析了评估设置,包括数据集、指标和基准。最后,作者指出了若干开放挑战并提出了具体的未来研究方向。

9月7日周一 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

RA-GRPO:基于反思的偏好优化用于视觉生成

本文提出了一种名为 RA-GRPO 的强化学习偏好对齐框架,用于扩散生成模型。该方法通过引入 Diffusion Reflection 机制,利用逆向扩散过程修正中间采样轨迹,并借助 Counterfactual Path Synthesis 将修正后的轨迹蒸馏到策略中,以提升文本到图像和文本到视频生成的语义保真度和视觉真实感。实验表明,RA-GRPO 在缓

8月22日周六 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LTX-2.3 无审查版 v1.4 发布:融合 NSFW 与蒸馏 LoRA

ChrisColeTech 发布了 LTX-2.3-uncensored-v1.4-fp8 模型,基于 Lightricks 的 LTX-2.3 并融合了 Eros10 极端 NSFW LoRA 和 DMD 蒸馏 LoRA,支持文本到视频、图像到视频等多种模式,并提供了 GGUF 和 FP8 量化版本。该模型宣称可在 4-8 步内生成高质量视频,并支持长达

8月21日周五 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LTX-2.3 22B uncensored 量化版发布:支持本地视频生成

ChrisColeTech 发布了 LTX-2.3 22B uncensored 模型的 GGUF/FP8/INT8 量化版本,提供六种量化格式及配套的文本编码器、VAE、蒸馏 LoRA 和空间放大模型,用于本地运行文本到视频和图像到视频生成。该仓库提供了详细的推荐参数(如 1024×576 分辨率、12 步采样)和实测性能数据(RTX 5090 上生成 5

8月20日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google Gen AI Python SDK Releases一手来源API 更新

Google Gen AI Python SDK v2.19.0 发布,新增多项配置与状态功能

Google 发布了 Gen AI Python SDK 的 v2.19.0 版本,新增了音频转录配置中的模式枚举、工具并行搜索的数据保留设置、强化学习超参数中的步数计数、实时连接状态中的 IDLE 状态,以及视频分辨率和扩展任务参数等功能。这些更新增强了 SDK 的功能性和灵活性。

8月14日周五 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 GGUF 量化版发布,支持 ComfyUI 运行

joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本,支持在 ComfyUI 中运行,并提供 fl2va 和 ref2va 两种模型。该版本解决了 ComfyUI-GGUF 的架构识别问题,并提供了多种量化选项以适应不同显存。此外,还提供了剪枝版本的替代方案,并解释了 K-quants 不可用的原因。

8月13日周四 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

物理模拟与扩散模型结合的视频去反射新框架

Hugging Face 每日论文介绍了一项关于视频反射去除的研究。该研究提出了一个闭环框架,包含基于物理的反射视频合成(S2R-Synthesis)、基于扩散模型的视频去反射模型(S2R-Removal)以及新的基准(S2R-Bench)。实验表明,该方法在多个基准上达到了最先进性能,且推理速度更快。代码和预训练权重即将发布。

8月12日周三 · 1 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持

NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。

8月11日周二 · 2 条
正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源产品发布

Vercel AI SDK v6.0.248 发布:视频生成支持自适应宽高比

Vercel AI SDK 发布 v6.0.248 版本,主要更新为视频生成功能:在 generateVideo 和 VideoModelV3CallOptions 中支持 aspectRatio: 'adaptive',允许视频模型根据输入自动推导输出比例,特别适配 BytePlus Seedance 2.5 模型。该更新避免了显式宽高比时的类型断言,但支

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

视觉世界搜索:持久视觉记忆、分层索引与源证据

本文提出了一种面向持续视觉数据流的搜索基础设施模型,包括分析器定义的场景、持久理解工件、视觉记忆和分层索引。作者开发了VideoDB数据格式(VDB)并在生产中实现,通过类型化搜索界面支持规划检索、状态调查、直接访问和基于证据的综合。在四个公共数据集上的9800多个查询对比中,通用组件流水线在Recall@1/@3/@10上优于商业视频原生引擎,表明视觉世界

8月8日周六 · 1 条
正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源产品发布

Vercel AI SDK 7.0.58 发布:新增自适应视频宽高比支持

Vercel AI SDK 发布 ai@7.0.58 版本,主要更新包括:尊重代理设置中的 ToolLoopAgent 超时;为 generateVideo 添加 'adaptive' 宽高比支持,适配 BytePlus Seedance 2.5 等模型;通过使 Zod v4 导入可树摇动来减小包体积。

8月6日周四 · 1 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

金刚GC3芯片发布:RISC-V数据流架构重新定义视频AI算力

在CCF Chip 2026大会上,中科通量发布了全球首款RISC-V数据流架构视频智能AIGC芯片金刚GC3,该芯片采用12核设计,支持128路1080P硬解码,INT8算力达200 TOPS。金刚GC3通过数据流架构优化视频处理效率,旨在解决通用芯片在视频AI场景下的能耗和延迟问题,标志着国产RISC-V高端算力在视频专用领域的商业化提速。

8月5日周三 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 GGUF 量化版发布,支持文本生成视频

realrebelai 在 Hugging Face 上发布了 MiniMax-H3 模型的 GGUF 量化版本,支持文本到视频生成,并提供了 ComfyUI 的目录结构。该模型基于 Comfy-Org/MiniMax-H3,包含 UNet、文本编码器和 VAE 组件,用户需从 Comfy-Org 获取 VAE 文件。发布者声称已获得 MiniMax 的许可

8月2日周日 · 2 条
正文结构化主题已通过公开置信门槛
The Verge AI商业

Pippa以收入分成吸引艺术家,但伦理AI之路仍艰难

AI视频生成初创公司Pippa推出收入分成模式,每次用户生成基于艺术家风格的内容,艺术家即可获得报酬,试图以更道德的方式吸引艺术家。然而,其技术仍基于未经明确同意抓取的网络数据训练的开源模型,且目前仅有4位签约艺术家和约800名订阅用户。联合创始人认为这能改变AI行业的'血腥历史',但面临艺术家社区的质疑和竞争压力。

正文结构化主题已通过公开置信门槛
xAI News一手来源产品发布

xAI 发布 Imagine Video 1.5 更新,支持图像语音参考和1080p

xAI 发布了 Imagine Video 1.5 的更新版本,新增了图像和语音参考功能,支持文本、图像和语音生成视频,并原生支持 1080p 分辨率。该功能在美国率先面向 SuperGrok Heavy 和 SuperGrok Plus 用户推出,随后将向所有用户开放。同时,xAI API 也已支持图像参考、文本转视频和原生 1080p,语音参考需申请。