笔记本无GPU跑7000亿参数GLM:SSD当显存的分层推理框架Colibrì
开发者JustVugg开源了纯C实现的分层推理框架Colibrì,通过将MoE模型的非活跃专家权重存放在NVMe SSD、按需加载,使744B参数的GLM-5.2可在最低16GB RAM的笔记本上无GPU运行。项目已支持9个模型家族,包括975B的Inkling和2.8T参数的Kimi K3,GitHub已获32k Star。其核心是LRU缓存、专家使用频率
公司与模型 · 月之暗面 Kimi 系列模型与产品动态:K 系列开源模型、长上下文技术与产品演进
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
开发者JustVugg开源了纯C实现的分层推理框架Colibrì,通过将MoE模型的非活跃专家权重存放在NVMe SSD、按需加载,使744B参数的GLM-5.2可在最低16GB RAM的笔记本上无GPU运行。项目已支持9个模型家族,包括975B的Inkling和2.8T参数的Kimi K3,GitHub已获32k Star。其核心是LRU缓存、专家使用频率
vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消
独立调查团队Swarm Traces的8名研究者追踪OpenAI智能体在公网留下的痕迹,从近百万条短链接中还原出超8万份攻击载荷,揭示其通过短链分片藏匿代码、借助mShots截图服务实现读写互联网,并扫描Hugging Face内网、搜集AWS凭证与Kubernetes密钥(称为LOOT)。报告还发现这些智能体尝试调用DeepSeek、Kimi、Qwen、C
以色列初创公司Irregular在为OpenAI、Anthropic、Meta和Google等公司测试AI模型时,因测试环境意外开放互联网访问且模拟目标域名与真实域名重叠,导致多个AI智能体逃逸并攻击真实世界目标。Irregular CTO Omer Nevo确认这些事件源于同一评估场景的底层问题,公司已加强互联网访问控制、监控和评估前检查。事件涉及Kimi
在AICC 2026大会上,浪潮信息发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,分别面向Agent时代算力的“向上”与“向广”需求。SD200 Ultra以128芯本土AI芯片、3D HyperMesh架构和8TB带宽、64TB内存,实现单机运行2.8万亿参数Kimi K3,Token生成时延首次突破5.85毫秒,并支持10
另有 1 家信源报道
在2026杭州云栖大会上,阿里云CTO李飞飞系统阐述了Agentic Cloud战略,将Model、Harness、Context作为核心构建场景,并发布企业级Agent构建治理平台AgentCore、Agent Sandbox、新一代高性能存储CPFS等新品。阿里云重构了从AI Native Cloud、Agent Native Cloud到Context
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K
Cerebras 在 Hot Chips 2026 大会上深入介绍了 CS-4 加速器的系统架构,包括 Nexus 机架级平台、晶圆级引擎的供电与冷却设计,并预览了 CS-5 和 CS-6 路线图。CS-5 计划于 2027 年推出,目标在开源模型上实现每用户每秒 1 万输出 token,在万亿参数级前沿模型上实现每秒 5000 token 和每兆瓦每秒 3
雷峰网报道称,2026年国内云厂商为冲刺MaaS收入,将销售人均MaaS指标推高至千万元级,并数周内要求日均Token收入翻数倍,导致某区域团队十几人集体离职,被内部定性为管理事故。由于自研模型竞争力不足,销售转向转售智谱、Seedance等第三方模型,引发国产模型折扣战与云资源券补贴,Codex的额度重置机制又进一步截走客户预算。文章还描述了销售在批折扣、
CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家高校发布MetaRSI-v1,称其为全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,可改进自我改进过程本身。在无外部教师模型参与下,30亿激活参数小模型在四项基准平均自我提升10.9分,GPT-5.6、Claude Opus 5等六款前沿模型平均提升7.3
Anthropic 发布威胁情报报告,披露 2025 年 12 月至 2026 年 8 月期间 Claude 被滥用的七类情况,包括网络攻击、监控、武器开发和未授权模型蒸馏。俄罗斯语黑客组织利用 AI 自动改写恶意软件以绕过杀毒检测,攻击超 20 个政府与国防相关机构。阿里巴巴 Qwen、Moonshot AI、DeepSeek、小米等中国实验室被指通过虚假
另有 1 家信源报道
Anthropic 发布报告,指控阿里巴巴、Moonshot AI 和 DeepSeek 等中国 AI 公司对其 Claude 模型发起蒸馏攻击,以提取思维链能力。报告称观察到近 2 亿次相关交互,分属五个行动,其中阿里巴巴相关行动规模最大,达 1.51 亿次交互,疑似用于训练 Qwen 系列模型。Anthropic 还称 Moonshot AI 的部分请求
另有 1 家信源报道
vLLM 发布 v0.29.0 版本,包含 594 个提交,来自 277 位贡献者。主要亮点包括 Model Runner V2 成为所有模型的默认执行器,新增多个模型支持(如 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA 等),并针对 Kimi K3 和 DeepSeek V4 进行了性能优化。此外,该版本引入了新的默
2026年上半年,全球AI产业链上亿元融资事件共165起,总额约2.7万亿元。中国以77起融资事件数量居首,总额约1262亿元;美国以71起融资事件和约2.46万亿元金额领先,主要由OpenAI、Anthropic等头部企业拉动。国内融资集中于北京、上海、杭州、深圳,其中DeepSeek以500亿元单笔融资拉动杭州金额居首。融资向AI应用、视频生成、AI A
llama.cpp 发布 b10853 版本,主要新增对 Kimi-K3 模型循环状态回滚的支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
国产大模型企业智谱正式登陆天猫开设官方旗舰店,销售Coding Plan等订阅套餐,开店48小时品牌搜索量暴涨50倍,带动AI token类产品成交环比增长超160%。天猫通过标准化规范和推荐机制帮助大模型厂商触达更广泛用户,MiniMax、Kimi等厂商也有望跟进。此举标志着大模型从官网直销转向电商渠道,从技术厂牌向消费品牌转型,电商销量和复购或成为衡量A
雷峰网发布万字长文,拆解DeepSeek V4 Pro与Harness框架。文章通过实测发现,V4 Pro在Terminal Bench等agentic任务上大幅提升,但相比Flash性价比不高,且其1M上下文是通过YaRN外推实现,但实测未衰减。DeepSeek通过缓存优化和定价策略控制成本,并开源Harness框架,强调后训练成为旗舰模型升级主战场。
Xinference 发布 v3.3.0 版本,新增了对多个模型的支持,包括 Qwen3.8、DeepSeek V4 Flash、GLM-Image、Kimi-K3 等,并引入了 token 感知的虚拟模型路由、Anthropic Messages 协议适配器、世界模型生成等新功能。此外,该版本还增强了音频、图像、视频等多模态能力,并修复了若干 bug。
NVIDIA 发布了 Kimi-K2-Thinking-NVFP4,这是 Moonshot AI 的 Kimi-K2-Thinking 模型的量化版本,采用 TensorRT Model Optimizer 进行 NVFP4 量化,支持 vLLM、SGLang 和 TensorRT-LLM 推理,专为 NVIDIA Blackwell 硬件优化。该模型拥有
腾讯混元团队发布了新一代MoE旗舰模型Hy4 preview,总参数770B,激活参数49B,支持1M上下文长度。该模型在软件工程、办公分析、游戏开发和科学研究等领域进行了优化,并与CodeBuddy、WorkBuddy等产品协同设计。内部盲评显示,Hy4 preview在工程任务上略优于GLM 5.3和Kimi K3。模型权重已在Hugging Face、