返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月2日周日 · 4 条
正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出 Blackwell GPU 集群,训练速度提升90%

Together AI 宣布推出基于 NVIDIA Blackwell 平台的 GPU 集群,并配套优化的 AI 加速软件栈 Together Kernel Collection。该集群在训练 70B 参数模型时速度比 H100 快 90%,达到每节点每秒 15,200 tokens。Together AI 利用 ThunderKittens 框架开发了自定

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

FlashAttention-3 发布:利用 Hopper GPU 新特性实现 1.5-2 倍加速

Together AI 发布了 FlashAttention-3,通过利用 Hopper GPU 的异步特性(如 WGMMA、TMA 和 FP8 低精度)来加速注意力计算,相比 FlashAttention-2 在 FP16 下速度提升 1.5-2 倍,达到 740 TFLOPS(H100 理论峰值的 75%),FP8 下接近 1.2 PFLOPS。该技术提

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源商业

Together AI 与 YC 合作推出首个专用 GPU 集群

Together AI 与 Y Combinator 宣布合作,为 YC 投资组合中的 AI 初创公司提供首个专用 GPU 集群,以解决计算资源获取难和成本高的问题。该集群支持短期灵活使用和长期优惠价格,初创公司可通过自助门户直接管理 GPU。目前集群已满负荷运行,双方计划未来扩展集群规模。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

PyTorch 性能分析(三):注意力机制剖析

Hugging Face 博客发布 PyTorch 性能分析系列第三部分,聚焦注意力机制的剖析。文章通过对比朴素注意力、原地操作和 SDPA 等实现,展示了如何利用 profiler 识别性能瓶颈,并指出将 masked fill 替换为原地版本可消除多余的内存拷贝内核,从而提升效率。

7月26日周日 · 1 条
正文结构化主题已通过公开置信门槛
Berkeley AI Research Blog一手来源研究

ABBEL:通过信念评分提升 LLM 长时程交互效率

Berkeley AI Research 博客介绍了 ABBEL 框架,用于提升 LLM 在长时程交互中的信念更新效率。该框架通过将摘要视为信念状态并引入信念评分(如重建评分)来监督摘要内容,在 CollabBench 协作编码任务中,相比传统递归摘要,将性能差距缩小约 50%,并减少 50% 的训练步数。在 Combination Lock 任务中,结合领

7月23日周四 · 1 条
正文结构化主题已通过公开置信门槛
DeepSpeed Releases一手来源产品发布

DeepSpeed v0.19.3 补丁发布:修复与功能增强

DeepSpeed 发布了 v0.19.3 补丁版本,包含多项修复和功能改进。主要修复了 ZeRO-3 中的数据类型处理问题、文件描述符泄漏、CUDA 上下文初始化等 bug,并新增了 AutoEP 与 AutoTP 并行折叠、EXAONE 4.5 模型推理支持、混合引擎用于在线策略蒸馏等功能。此外,还改进了 CI 流程、类型提示和文档。

7月18日周六 · 1 条
正文结构化主题已通过公开置信门槛
Ahead of AI研究

控制LLM推理努力:多模式推理模型的开发方法

本文探讨了如何控制大语言模型(LLM)的推理努力程度,使其具备低、中、高多种推理模式。文章回顾了推理模型的发展,如OpenAI的o1和DeepSeek-R1,并介绍了通过强化学习(RLVR)训练推理模型的方法,以及推理时计算扩展的概念。作者还提到了GPT-5.6系列模型提供多种推理努力设置,并计划深入讲解多努力模式模型的开发方法。

7月17日周五 · 1 条
正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源产品发布

NVIDIA Vera Rubin 提升代理式 AI 后训练性价比

NVIDIA 发布博客,强调后训练(post-training)是代理式 AI 时代的关键工作负载,并提出“每美元智能”(intelligence per dollar)作为核心指标。文章介绍了 NVIDIA 的 Vera Rubin 平台和 Nemotron 3 Ultra 模型,旨在通过降低推理成本来提升智能收益,并列举了 Prime Intellect

7月16日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

扩散模型创造力源于得分平滑的插值效应

Google Research 科学家郑道在 ICLR 2026 发表论文,证明扩散模型的创造力源于神经网络学习到的“平滑”得分函数,导致模型在训练数据点之间插值而非记忆。该研究结合正则化理论和去噪数学,解释了模型泛化的机制,并指出权重衰减等正则化方法会增强这种平滑效应。

7月6日周一 · 1 条
正文结构化主题已通过公开置信门槛
Import AI研究

Import AI 464:Fable编写GPU内核,AI自动化与模拟计算

Import AI 464期报道了Fable模型在KernelBench-Mega基准上编写GPU内核,实现18.71倍加速,创下最快megakernel记录,显示AI在自动化AI研发任务上的进步。同时,CAIS和Scale Labs的Remote Labor Index显示AI系统在在线自由职业任务上的成功率从2.5%升至16.1%,表明AI对经济就业的潜

7月1日周三 · 2 条
正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 推出 AI 流量分类管理新选项

Cloudflare 在 AI 内容控制一周年之际,推出新的 AI 流量管理选项,将 AI 爬虫分为搜索、代理和训练三类,允许网站所有者精细控制。新默认设置将于 2026 年 9 月 15 日生效,对带广告的页面默认阻止训练和代理爬虫,但允许搜索爬虫。此举旨在平衡内容保护与网站可发现性。

正文结构化主题已通过公开置信门槛
Microsoft Research Blog一手来源研究

SkillOpt:将智能体技能作为可训练参数,实现可靠性能提升

微软研究院发布SkillOpt,一种将智能体技能文件视为可训练参数的新方法,在不更新模型权重的情况下,通过前向-反向-更新循环优化技能。在六个基准、七个模型和三种执行模式下,SkillOpt在全部52个评估单元中取得最佳或并列最佳结果,显著提升性能,且优化后的技能可跨模型和任务迁移。

6月24日周三 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

缩放定律的细致探讨:从理论到实践

本文回顾了深度学习中的缩放定律(scaling laws)研究,从早期理论到Kaplan等人的实证工作,指出损失随模型规模、数据和计算量呈幂律下降,并可用于预测大模型训练需求。文章强调了缩放定律在计算资源分配中的实用价值,并讨论了不同阶段(小数据、幂律区、不可约误差区)的行为。

6月11日周四 · 1 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers v5.11.0 发布:新增 DiffusionGemma 和 DeepSeek-V3.2 支持

Hugging Face Transformers 库发布 v5.11.0 版本,新增 DiffusionGemma 和 DeepSeek-V3.2 模型支持。DiffusionGemma 采用编码器-解码器架构和多画布采样,加速文本生成;DeepSeek-V3.2 引入 DeepSeek 稀疏注意力机制,提升长上下文训练和推理效率。此外,该版本扩展了 Ke

5月7日周四 · 1 条
正文结构化主题已通过公开置信门槛
DeepSpeed Releases一手来源产品发布

DeepSpeed v0.19.0 发布:多模态支持与多项修复

DeepSpeed 发布 v0.19.0 版本,包含多项修复和功能增强,如 ZeRO-3 碎片整理工具、序列并行对多模态模型的支持、Muon 优化器的 Gram 正交化,以及多个 bug 修复。该版本提升了稳定性、兼容性和性能,对使用 DeepSpeed 进行大规模模型训练的用户有积极影响。

4月22日周三 · 2 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源研究

Google DeepMind 推出 Decoupled DiLoCo,实现跨区域高效分布式训练

Google DeepMind 推出了 Decoupled DiLoCo,一种新型分布式 AI 训练方法,通过将通信融入计算周期,避免同步阻塞,从而在跨区域网络上实现高效训练。他们成功使用 2-5 Gbps 的广域网在四个美国区域训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上。该方法还支持混合不同代际的硬件(如 TPU v6e 和 TPU v

正文结构化主题已通过公开置信门槛
DSPy Releases一手来源产品发布

DSPy 3.2.0 发布:优化器链式组合与 LiteLLM 解耦

DSPy 发布 3.2.0 版本,主要亮点包括 BetterTogether 优化器支持链式组合、开始与 LiteLLM 解耦、输入字段类型不匹配警告、强化 RLM 和 PythonInterpreter 安全性。此外,磁盘缓存默认启用受限 pickle 以增强安全,optuna 变为可选依赖。

4月7日周二 · 1 条
正文结构化主题已通过公开置信门槛
GLM New Releases一手来源模型发布

智谱发布GLM-5.1旗舰模型,长程任务能力显著提升

智谱AI发布了新一代旗舰模型GLM-5.1,其编码能力和长程任务处理能力显著增强,可独立持续工作长达8小时,实现从规划到交付的完整闭环。该模型综合能力全面对齐Claude Opus 4.6,成为首个在综合能力上对齐该模型的中国模型,并跻身全球开源模型前列。通过multi-turn SFT、RL与过程质量评估体系,GLM-5.1在长任务中的稳定性、一致性与工具

2月13日周五 · 1 条
正文结构化主题已通过公开置信门槛
DeepSpeed Releases一手来源产品发布

DeepSpeed v0.18.6 补丁发布:修复竞态条件与梯度问题

DeepSpeed 发布了 v0.18.6 补丁版本,包含多项修复和改进。主要修复了叶模块竞态条件、ZeRO stage 0 的 bf16 梯度范数发散等问题,并支持 AutoTP 自定义分区模式及 Python 3.14 注解处理。此外,将 torch.jit.script 替换为 torch.compile,并新增了两位贡献者。

1月31日周六 · 1 条
正文结构化主题已通过公开置信门槛
百度 PaddlePaddle Releases一手来源产品发布

飞桨3.3.0发布:训练效率与国产硬件适配全面升级

百度飞桨框架发布3.3.0版本,重点提升大模型训练效率、开发体验和国产硬件适配。新版本升级了FlashMaskV3稀疏注意力内核,性能超越FlexAttention,并推出FlexCheckpoint参数自动切分重组系统,权重转换性能比Megatron-LM快1.2倍以上。同时引入虚拟内存动态碎片整理技术,将MoE模型显存碎片率从10%降至3%。此外,新版本