返回全部动态

飞桨3.3.0发布:训练效率与国产硬件适配全面升级

原标题:PaddlePaddle 3.3.0 Release Notes

百度 PaddlePaddle Releases一手来源产品发布质量 83

AI 摘要

百度飞桨框架发布3.3.0版本,重点提升大模型训练效率、开发体验和国产硬件适配。新版本升级了FlashMaskV3稀疏注意力内核,性能超越FlexAttention,并推出FlexCheckpoint参数自动切分重组系统,权重转换性能比Megatron-LM快1.2倍以上。同时引入虚拟内存动态碎片整理技术,将MoE模型显存碎片率从10%降至3%。此外,新版本增强了生态兼容性,支持FlashInfer、DeepGEMM等社区模块,并深度适配昆仑芯XPU和海光DCU。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

# 重要更新 飞桨框架 3.3 版本在大模型训练效率、开发体验及国产硬件适配等关键领域持续突破创新,在计算显存高效利用、训推衔接转换、生态兼容性、调试效率、国产硬件适配等方面带来多项重要升级,全面提升大模型训推能力。 ## 训练效率突破 * **FlashMaskV3升级**:深度优化稀疏注意力掩码计算FlashMaskV3计算内核,性能全面超越FlexAttention,算子性能最高领先2.1 倍;原生支持上下文并行并引入计算负载均衡机制,分布式场景算子性能相比Megatron-LM快80%,全面强化长文训练能力。 * **FlexCheckpoint参数自动切分重组系统**:基于首创的轻量级描述语言AOA (All in One Arrow),支持从单卡视角灵活描述复杂的权重转换关系,并自动推导分片映射;通过跨机通信的高并发与负载均衡调度,在大参数规模下权重转换性能相比Megatron-LM领先1.2倍以上,有效解决大模型训推不同阶段参数转换的成本与效率难题。 * **虚拟内存动态碎片整理**:引入基于虚拟内存技术的显存分配机制,可根据运行时显存占用情况动态进行碎片整


发布时间:2026-01-31 15:13
抓取时间:2026-08-17 17:45
来源机构:百度飞桨
阅读原文github.com