返回全部动态

笔记本无GPU跑7000亿参数GLM:SSD当显存的分层推理框架Colibrì

原标题:笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

量子位开源质量 76

AI 摘要

开发者JustVugg开源了纯C实现的分层推理框架Colibrì,通过将MoE模型的非活跃专家权重存放在NVMe SSD、按需加载,使744B参数的GLM-5.2可在最低16GB RAM的笔记本上无GPU运行。项目已支持9个模型家族,包括975B的Inkling和2.8T参数的Kimi K3,GitHub已获32k Star。其核心是LRU缓存、专家使用频率统计和跨层专家预测(可预测性71.6%),将VRAM、RAM、SSD组织为分层内存系统。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 闻乐 发自 凹非寺 量子位 | 公众号 QbitAI 25GB笔记本硬跑744B GLM-5.2,32GB内存挑战2.8T Kimi K3—— 甚至都不用GPU。 GitHub现在最火热的大模型开源小蜂鸟Colibrì,纯C实现、零引擎依赖的分层推理框架,已经狂揽32k Star。 它最早是冲着GLM-5.2来的。 正常情况下,744B的总参数规模已经让普通消费级电脑望而却步,但Colibrì的办法可以说是相当简单粗暴: 内存装不下,那就别全装进去。 模型里暂时用不到的部分,直接扔在SSD里;等推理真的需要哪个专家,再现场从硬盘把它捞出来。 于是,GLM-5.2经过int4处理后大约372GB的权重,可以在最低16GB、推荐24GB左右RAM的机器上运行,GPU甚至不是必需品。 作者最初验证它的开发机,也只有12核CPU+25GB RAM。 现在,Colibrì已经不满足于744B了。 它目前已经覆盖9个模型家族,从GLM-5.2/5.3、Dee


发布时间:2026-09-26 17:01
抓取时间:2026-09-26 18:04
来源机构:量子位
阅读原文qbitai.com