返回全部动态

7名博士生3个月从零训练7B大模型并全流程开源

原标题:7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开

量子位开源质量 76

AI 摘要

北京中关村学院7名博士生用一个暑假从零训练出7B大模型ZGCM-1,并开源模型权重、训练代码、数据配方、中间checkpoint和日志。团队组建数百个Agent分头处理数据、跑实验、看日志和做评测,实践「AI4AI」研发范式,并对11类任务的Agent自主性做了L1-L5评级。ZGCM-1在多项通用评测中与Qwen3-8B等相近,部分数学推理和搜索任务可与更大模型比较,团队已开始尝试400B、500B规模。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开 几百个Agent参与研发,AI开始造AI 允中 发自 凹非寺 量子位 | 公众号QbitAI 北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1。 随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。 在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,它也能与Qwen3-235B-A22B、GLM-5.1等更大规模的模型比较。 但比最终分数更让人好奇的是,数据、训练、集群、评测这一整套工程,在大厂通常需要几百人的团队协作完成,七个人怎么做得过来? 他们给自己组建了一支几百个Agent的团队,分头处理数据、跑实验、看日志、做评测,亲手实践「AI4AI」研发范式。 模型训完后,团队还对整个模型研发流程中Agent的实际表现做了一次评级,希望基于本次完整的大模型训练实践,为RSI现状提供真实的工程结论。 至于为什么开始做这件事,还要从一顿火锅说起。 看了很多


发布时间:2026-09-15 10:17
抓取时间:2026-09-15 11:25
来源机构:量子位
阅读原文qbitai.com