返回主题地图

图像生成

技术方向 · 文生图模型迭代、图像编辑能力与创作工具生态 · 共 21 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究10

CARE:面向扩散模型的条件感知表示正则化

该论文提出 CARE(Condition-Aware Representation Regularization),一种轻量级即插即用的正则化框架,根据条件相似度动态调整扩散模型的特征分布,无需显式对齐损失或外部监督。在 ImageNet 类到图任务上,CARE 在 40 万训练步内将 FID 降低 19.08%,实现 3.5 倍加速;在文到图任务上,20

9月25日周五 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布9

Viggle 发布 Qwen-Image-2.1 少步蒸馏 LoRA v0.2.1

Viggle 在 Hugging Face 上发布了 Qwen-Image-2.1-viggle-turbo v0.2.1,这是基于 Qwen/Qwen-Image-2.1 的少步蒸馏 LoRA 适配器,采用分布匹配蒸馏(DMD)训练。它支持文生图和指令驱动编辑,仅需 6 次 transformer 前向(而非基座的 40 步)且无需无分类器引导,端到端约快

9月23日周三 · 3 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源模型发布1

Moonworks Lunara:建模艺术智能的文本到图像模型

Moonworks 提出 Moonworks Lunara 文本到图像模型,将「艺术智能」定义为先建立语义、艺术与构图约束、再在约束内实现视觉世界的两阶段计算,并采用新型 Diffusion Mixture Transformer 架构与 CAT 训练算法。团队用 GPT-5.6 Sol 作为评估器,在 1000 条提示、8000 张生成图像上对比包括 FL

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究1

LEDFlow:熵引导生成顺序的均匀离散流采样器

该论文提出 LEDFlow,一种无需训练的采样器,通过熵引导的吸收策略为均匀离散流引入生成顺序。研究发现均匀离散流中 9.4% 的生成单元在中间步骤正确但最终输出错误,LEDFlow 将这一比例降至 2.6%。在 Nikoli 数独上达到 0.845 的求解准确率,在文本到图像生成和多模态理解任务上也优于原生采样器,且推理成本相当。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

基于Krea-2的人物LoRA模型girlslike-krea2发布

作者 ifmylove2011 在 Hugging Face 发布了名为 girlslike-krea2 的 LoRA/LoKR 模型,基于 krea/Krea-2-Raw 与 Krea-2-Turbo 训练,用于生成特定人物形象。模型采用全秩 LoKR 训练方案,建议使用强度 0.8 1.5,中近景相似度尚可但远景效果不佳,且需输入人物本名作为触发词。作者

9月22日周二 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

nphSi 发布 Z-Image-Lora 人物肖像生成模型

Hugging Face 用户 nphSi 发布了 Z-Image-Lora,这是一个基于 Tongyi-MAI/Z-Image 和 Z-Image-Turbo 的文本到图像 LoRA 模型,采用 Apache-2.0 许可。该模型通过“vrtlxxxx”触发词生成特定人物肖像,并在 2026 年更新中新增了数百个名人触发词。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

WorkRally首发接入腾讯混元Hy Image3.5 preview,两周免费开放

腾讯混元于9月22日发布Hy Image3.5 preview生图模型,腾讯视频专业影视智能平台WorkRally首发接入,并在两周内向创作者免费开放,覆盖剧集分镜、影视物料、角色与场景设定等场景。该模型盲测显示较Hy Image3.0提升约30%,支持文生图与图生图、最多5张参考图、最高2K输出,腾讯云API 2K定价0.15元/张。出海AI创作工具OnS

9月16日周三 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Krea2-Turbo 4步蒸馏LoRA发布:速度提升1.6倍

开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000

9月11日周五 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

AcFlow:通过学习条件激活流控制文生图扩散Transformer

论文提出 AcFlow,一种在推理阶段控制文本到图像扩散 Transformer(DiT)的方法。它通过一个学习到的、以概念描述为条件的速度场,对中间层图像 token 激活进行传输,同时保持基础 DiT 冻结。该方法支持连续调节风格强度并抑制不需要的概念,在风格-内容权衡上优于基线,且无需针对每个概念单独拟合即可泛化到未见概念。

9月9日周三 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

跨模态扩散模型对抗攻击与防御综述

这篇综述首次统一回顾了扩散模型在图像、视频和3D三种视觉模态下的对抗攻击与防御研究。文章提出了一种以任务为中心的全面分类法,按模态、攻击/防御和生成任务组织文献,并深入分析了评估设置,包括数据集、指标和基准。最后,作者指出了若干开放挑战并提出了具体的未来研究方向。

9月7日周一 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

RA-GRPO:基于反思的偏好优化用于视觉生成

本文提出了一种名为 RA-GRPO 的强化学习偏好对齐框架,用于扩散生成模型。该方法通过引入 Diffusion Reflection 机制,利用逆向扩散过程修正中间采样轨迹,并借助 Counterfactual Path Synthesis 将修正后的轨迹蒸馏到策略中,以提升文本到图像和文本到视频生成的语义保真度和视觉真实感。实验表明,RA-GRPO 在缓

9月5日周六 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

FLUX.2-klein-4B LiteRT 版:手机端本地文生图与编辑

Hugging Face 社区发布了 FLUX.2-klein-4B 模型的 LiteRT 量化版本,由 Black Forest Labs 的 FLUX.2 klein 4B 转换而来,采用 int8 量化并针对端侧设备优化。该版本可在 Pixel 8a 的 Mali GPU 上完全本地运行文生图和图像编辑任务,生成质量与 fp32 管线相当(PSNR 3

9月4日周五 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

基于Z-Image的人物LoKR/LoRA测试模型发布

Hugging Face 用户 ifmylove2011 发布了基于阿里通义 Z-Image Base/Turbo 模型训练的人物 LoKR/LoRA 系列,用于测试人物生成效果。该系列区分基于 base 和 turbo 训练的版本,并提供了使用建议和注意事项,如触发词、采样参数等。作者强调该模型仅用于测试,禁止不当用途。

8月31日周一 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

FocusGen:利用模拟人物代理焦点小组扩展视觉设计探索

FocusGen 是一个交互式系统,通过模拟人物代理的“虚拟焦点小组”为视觉设计探索引入外部视角。与以往将代理作为批评者汇聚于单一作品的方法不同,FocusGen 将人物角色作为并行生成器,每个代理独立驱动迭代生成循环,将设计简报转化为多种受众条件方向。评估表明,迭代细化循环优于零样本生成,人物角色条件化比通用助手基线产生更高的视觉多样性,且开放式偏好访谈比

8月25日周二 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

CircleStone Labs 发布动漫文生图模型 Anima

CircleStone Labs 与 Comfy Org 合作发布了 Anima,一个 20 亿参数、专注于动漫风格的非写实文生图模型。该模型基于 NVIDIA Cosmos-Predict2-2B 微调,提供 Base、Aesthetic 和 Turbo 三个版本,支持 ComfyUI 原生使用。Anima 在动漫图像上训练,也可生成其他非写实内容,但不适

8月22日周六 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Omnico 发布从 Krea 2 Turbo 提取的 LoRA 模型

Omnico 从 Krea 2 Turbo 微调检查点中提取了 LoRA 模型,并发布在 Hugging Face 上。这些 LoRA 支持实时混合和权重调整,且占用空间更小。作者在 Mac Mini M4 上完成了提取工作,并指出低秩 LoRA 有时效果更佳。

8月17日周一 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

PROVE:基于可验证证据的免训练提示词恢复方法

PROVE 是一种无需训练的、黑盒的提示词恢复攻击方法,通过组合可验证的场景描述而非优化 token 序列来重建提示词,适用于原始版权作品和 AI 生成内容。在 MS-COCO、Flickr30K 和 Lexica 数据集上,PROVE 在图像相似度和文本-图像对齐方面优于基于优化、字幕和强化学习的基线方法,且无需训练或访问生成器。该方法旨在应对提示词市场兴

8月16日周日 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Krea 2 Turbo Edit GGUF 量化版发布,支持身份保持编辑

ChrisColeTech 在 Hugging Face 发布了 Krea 2 Turbo Edit 的 GGUF 量化版本,支持文本到图像、图像到图像和身份保持编辑,8 步推理,在 RTX 5090 上生成 1024² 图像约需 35 秒。该版本包含三个量化等级和 FP8 缩放构建,并集成了 Qwen3-VL-4B 文本编码器和 Qwen-Image VA

8月9日周日 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

pmczip 发布基于 Krea-2-Raw 的 LoRA 模型

pmczip 在 Hugging Face 上发布了基于 Krea-2-Raw 的 LoRA 模型,用于生成特定女性人物的逼真图像。该模型采用 bespoke-lora-trained-license 许可,包含多个示例提示词,展示了其生成高质量、写实风格图像的能力。

1月1日周日 · 1 条
正文结构化主题已通过公开置信门槛
Jay Alammar观点

用AI图像生成重制经典游戏图形

作者Jay Alammar尝试使用Stable Diffusion、Dall-E和Midjourney等AI图像生成工具,重制1987年游戏《Nemesis 2》的开场动画图形。他通过调整提示词和搜索Lexica等图库,成功生成了部分高分辨率版本,但发现这些工具在文本再现、元素定位和特定细节(如三只眼)上存在局限。文章展示了各工具的效果对比,并指出当前文本到