返回全部动态
以GLM-5为例:九章智算云如何落地训推一致的强化学习系统
原标题:以GLM-5为例,探究九章智算云强化学习系统如何落地“训推一致”
AI 摘要
本文以GLM-5为例,探讨九章智算云如何通过强化学习系统实现训推一致。文章指出,随着预训练边际收益递减,模型能力Scaling正转向后训练强化学习,RL成为模型能力持续提升的关键。九章智算云通过将Generator、Environment和Trainer纳入统一工作流,实现动态调度和状态资源化,提升有效Token产出率,并与模型厂商形成算法与基础设施双向RL Scaling的协作模式。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
0 过去几年,大模型竞争的主线很清晰:更大的模型、更多的数据和更强的GPU集群。 但随着预训练边际收益递减,模型能力Scaling正从单纯的预训练堆叠向后训练强化学习(RL)转变,数学推理、代码生成、复杂决策、长时序Agent等高阶能力,越来越依赖后训练强化学习(RL)激发。RL通过生成、执行、反馈和奖励,让模型持续学习推理、规划与自我纠错的能力。 由此,大模型发展从“一次性训练”进入“持续训练”,模型能力Scaling也从预训练延伸至生成、反馈和迭代全过程。SemiAnalysis指出,当RL成为模型能力持续Scaling的关键,竞争的就不只是算法,还有支撑模型持续生成、训练和更新的AI基础设施系统。 问题也随之变成:当模型越依赖RL获得能力,谁来支撑这种能力持续低成本地生产。 从“模型+算力”到算法与AI基础设施共同Scaling 智谱近期的模型迭代,为观察后训练RL提供了一个窗口。 智谱公告指出,GLM-5.3与GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro取得62.1分、Terminal
发布时间:2026-08-19 15:55
抓取时间:2026-08-19 18:40
来源机构:雷峰网