AdvFD:通过对抗 Fréchet 距离损失提升视觉生成
AdvFD 提出了一种新的生成器后训练方法,通过引入可学习的对抗特征空间来补充静态 Fréchet 损失,并采用真实特征白化来稳定优化。实验表明,AdvFD 在 JiT 和 pMF 骨干网络及不同模型规模上均能一致提升一步生成器的后训练效果。该方法旨在解决直接优化 Fréchet 目标时出现的 Fréchet hacking 问题。
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AdvFD 提出了一种新的生成器后训练方法,通过引入可学习的对抗特征空间来补充静态 Fréchet 损失,并采用真实特征白化来稳定优化。实验表明,AdvFD 在 JiT 和 pMF 骨干网络及不同模型规模上均能一致提升一步生成器的后训练效果。该方法旨在解决直接优化 Fréchet 目标时出现的 Fréchet hacking 问题。
CurveFP 是一种新的低精度数据类型家族,通过交错对数曲线和紧凑块缩放实现封闭乘积,使乘法变为精确的符号异或和整数索引更新。CurveFP8 用于训练,CurveFP7 用于部署,在多个 7B-9B 模型上以更少的位达到或超过 FP8 的困惑度,并在 128.3M 参数预训练中实现 FP8 级质量,同时降低格式引起的惩罚。
本文提出了一种名为“Signpost Watermarking”的方法,通过联合优化训练不可感知的视觉水印,使其能与独立部署的其他水印系统共存。作者首先实证发现视频水印也具备图像水印中的共存特性,然后引入解码器感知的训练目标,在保持水印鲁棒性和视觉质量的同时,显著提升共存性能。该方法支持分层溯源信号,为内容真实性和版权保护提供了实用路径。
arXiv 论文提出 Sequential Modality Dropout (SMD),一种针对多模态序列推荐模型的训练时模态随机丢弃方法。SMD 在训练时独立地以一定概率擦除整个用户交互历史中的图像或文本模态,使模型学会不依赖单一模态进行预测。在四个骨干模型和四个 Amazon 数据集上,SMD 将文本保留率提升 1.0 到 3.2 个点,且几乎不损失全
arXiv 论文提出 Data-Centric Parallel (DCP),一种用于训练可变长序列的分布式并行方法。DCP 通过根据每个 batch 的序列长度动态调整并行大小、梯度累积和重计算等运行时设置,在 32 块 H200 GPU 上实现了最高 2.88 倍的加速,且仅需 10 行代码即可集成到任意模型中。该方法旨在打破现有方法在效率和易用性之间的
魔搭 ms-swift 发布 v4.4.3 补丁版本,包含多项 bug 修复和功能更新。主要修复了 Qwen3.5、Qwen3-TTS、Qwen3-Omni 等模型的模板和训练问题,新增了 packing strategy、GKD 多轮支持、RLSD 自蒸馏优势重加权等功能,并优化了 Megatron、NPU 等后端兼容性。该版本提升了框架的稳定性和训练效率
Gated Hindsight Distillation (GHD) 是一种改进移动 GUI 代理训练的方法,利用未来截图作为特权信息,在标准模仿失败时恢复正确的推理。该方法在 AndroidWorld 和 AndroidLab 上,通过两种视觉语言模型,相比 GRPO 提高了任务成功率。代码和检查点将公开。
该研究提出无监督在线策略自蒸馏方法(U-OPSD),仅利用模型自身生成和内部一致性(多数投票)构建伪解决方案,无需外部监督即可纠正模型自信的错误。在多个数学推理基准上,U-OPSD 在 Qwen3 非思考模式下相比基础模型提升 8.5% 和 10.7%,并优于或持平于有监督方法 OPSD 和 GRPO。代码已开源。
由xAI联合创始人Igor Babuschkin创立的AI初创公司River AI,在成立仅两个月后获得了由General Catalyst和AMP PBC领投的11亿美元融资,Nvidia、AMD Ventures、Y Combinator和Temasek参投。River AI旨在从头重建AI技术栈,包括训练、模型、产品层和硬件,以开发个人可训练的AI助手
TNG公司(慕尼黑软件咨询公司)在Hugging Face博客上分享了将NVIDIA Nemotron 3.5 Lightning模型扩展为多模态视觉模型的实验。他们采用GLM-5.2 Vision的方法,仅训练一个小的MLP适配器,将现成的视觉编码器(如Kimi K2.6 Vision Tower或NVIDIA C-Radiov4-H)注入模型,在RTX
ONESTRUCTION 公司在 AWS GenAIIC 的技术支持下,基于 Qwen3 模型构建了面向建筑行业 BIM 工作流的领域基础模型 Ishigaki-IDS。该模型通过合成数据生成和 CPT、SFT、RLVR 三阶段训练流程,解决了 IDS 标准数据稀缺、IFC 词汇注入和语法生成等挑战,降低了 BIM 专业人员使用 IDS 的门槛。
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr
另有 1 家信源报道
远景科技集团在乌兰察布投产全球最大AI算力超级单体,总规划容量2GW,支持百万卡并行和百万P级算力。该超级单体通过自建风电场、储能和AI电力系统,将波动的新能源转化为稳定算力能源,同等面积算力输出可达传统数据中心10倍。远景计划到2030年在全球戈壁建成5GW绿色AI算力中心。
Hugging Face 发布了一篇技术报告,提出将可解释性作为训练约束而非事后解释的方法。实验表明,在自回归和扩散语言模型中,可解释性随规模提升而增强。他们发布了 Steerling-8B 模型,该模型能归因输出到输入 token、概念和训练数据,支持闭环干预,且性能可与使用 2-16 倍计算量训练的模型竞争。
该研究针对基于LLM的生成式推荐系统中语义ID(SID)的初始化问题,发现标准随机初始化会导致嵌入围绕物品流行度而非语义组织,且持续预训练(CPT)无法可靠恢复语义几何。作者提出一种零参数干预方法,直接从语义嵌入空间的质心初始化SID token嵌入,无需额外训练或推理开销,在纯SFT下Recall@5提升最高16%,冷物品Recall@5提升最高60%,并
本研究挑战了可解释性以牺牲模型能力为代价的假设,提出将可解释性作为训练约束,与语言建模目标共同优化。实验表明,在自回归和扩散语言模型上,可解释性随计算规模提升而增强,模型表征变得更解耦且与人类可理解概念对齐。作者发布了Steerling-8B扩散语言模型,支持输出归因和概念引导干预,其性能可与使用2-16倍计算量训练的开放模型竞争。
另有 1 家信源报道
Motif 3 是一个具有 3140 亿总参数、每 token 激活 132 亿参数的解码器专用混合专家语言模型,采用细粒度稀疏 MoE 架构,每层包含 384 个路由专家,每 token 选择 8 个。该模型基于分组差分潜在注意力(GDLA)构建,并整合了流形约束超连接、专家特定 PolyNorm 激活和多 token 预测等技术。模型在约 12.5 万亿
Hugging Face Daily Papers 发布了一篇题为《Evidence-RL: Towards Evidence-intensive Visual Reasoning》的论文。论文提出了一种名为反事实证据解缠(CED)的训练时证据审计方法,用于增强视觉语言模型(VLM)的接地能力。CED 通过中和对象中心的证据区域并比较支持度下降,结合 GRP
DeepSpeed 发布了 v0.19.5 补丁版本,包含多项修复和改进。主要修复了 ZeRO++ 小参数二次分片复制、ZeRO-3 异步梯度卸载与固定卸载缓冲区、AutoEP 在 ZeRO-1/2 下的通用转换问题,以及 torch 2.12+ 的编译错误。此外,新增了独立的 pin memory 操作,并支持 ZeRO 卸载下的非托管梯度累积。
Hugging Face 与 EleutherAI 合作发起 FineBooks 项目,在超过 2000 页历史书籍上测试了 14 个开源 OCR 模型,发现小模型表现优于大模型,最佳模型字符准确率超 97%,成本低于每千页 2 美元。研究认为这些模型足以用于 AI 训练数据,但尚不适合学术用途。团队计划用顶级模型重新处理约 20 万份 BHL 文档并开放数