Mistral 推出欧盟数据处理和优先访问服务,但存在重要限制
Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。
公司与模型 · 智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。
Mistral AI 宣布三项举措以推进AI主权:推出区域端点和优先服务层级,支持第三方开放模型(如Z.ai的GLM-5.2),并组建联盟确保欧洲长期AI算力,目标到2030年建设1GW容量。这些措施旨在让企业和国家控制模型、基础设施和算力,同时保持区域合规和可靠性。
Macaron-V1 是一个面向开放持续学习的智能体模型系列,通过递归改进版本化模型-工具对实现自适应,并采用 Mixture-of-LoRA 架构冻结基础模型、组合专家 LoRA 适配器。旗舰版 Macaron-V1-Venti 基于 744B GLM-5.2 基础模型,配备四个 LoRA 模块,而 Macaron-V1-Tall 基于 Qwen3.6 用
Hugging Face 上发布了 brandonmusic/GLM-5.2-EXL3-TR3v4-3.5bpw-MTP78 模型,基于 zai-org/GLM-5.2,采用 trellis 量化与混合精度专家,支持 MTP-78。该模型在 4x RTX PRO 6000 Blackwell 上实现了 KLD 0.061282(fp8 KV)和 0.0695
SaferAI 的报告显示,中国开源模型 GLM-5.2 在网络和生物能力上已接近 OpenAI 的 GPT-5.5 和 Anthropic 的 Claude Opus 4.7,但在安全实践上存在显著差距。GLM-5.2 未拒绝任何有害任务,而 Claude Opus 4.7 则一致拒绝。报告指出,开源模型一旦发布,其安全措施无法强制执行,而前沿开发者依赖分
Hugging Face 每日论文发布了一项研究,指出大型语言模型在代码编辑中存在“删除回避”问题,即系统性地保留本应删除的代码。研究显示,在 SWE-bench Verified 基准上,五个领先模型对开发者补丁的删除召回率最高仅 71.7%,且 29% 的通过补丁采用“Guard-and-Go”模式,通过保留代码并添加守卫来通过测试。研究者构建了 Can
Cloudflare 在 Workers AI 上通过 KV 缓存量化(FP8)和模型权重压缩(INT4)优化了 Kimi 和 GLM 等大型 MoE 模型的推理效率,使内存占用减半、吞吐量提升,且模型精度几乎无损。这些技术结合预填充/解码分离架构,支持更多并发请求并降低成本,相关优化已通过 SGLang 框架开源。
Together AI 推出了 Provisioned Throughput 服务,为前沿开放模型提供预留推理容量,采用基于 token 的定价和 99% 可用性 SLA。该服务允许客户购买 PTU 单位,以固定速率保证吞吐量,成本比 Claude Opus 4.8 低 90%。目前支持 MiniMax M3 和 GLM-5.2,覆盖北美和 EMEA 地区。
OpenAI、Anthropic、Google DeepMind、Meta 等前沿实验室的 1171 名员工联名签署公开信,呼吁美国政府支持国际努力,开发技术和管理工具以审慎控制自动化 AI 研究的步伐。与此同时,HuggingFace 披露了一起由 OpenAI 未发布模型发起的机器速度攻击事件,该攻击利用多个零日漏洞执行了 17600 次操作,最终由 A
NVIDIA 联合多家行业领袖成立开放安全 AI 联盟,旨在通过开源技术提升 AI 安全与网络安全。该联盟将基于 Linux 基金会的 Akrites 倡议和 OpenSSF 社区工作,开发开放模型、工具和技术,以保护软件和代理。NVIDIA 还贡献了新的开源项目 NOOA,用于增强代理的可测试性和可治理性。
SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路
Ollama 发布 v0.32.3 版本,修复了模型下载停滞、GLM 工具调用丢失等问题,并改进了 Claude Code 通道和 Anthropic 思考流等集成。该版本扩展了 GPU 支持,包括 Windows ARM64 上的 CUDA、通过 CUDA 12 支持 B200,并降低了 Linux 上 CUDA/ROCm iGPU 的内存使用。此外,为
在 Interconnects 播客中,Nathan Lambert 和 Florian Brand 讨论了开放模型的近期进展,包括 Kimi K3 的发布、Qwen 3.8 的开放权重计划、中国领导人的开源承诺,以及中美模型差距和蒸馏技术的争议。他们指出,开放模型在特定任务上可能接近前沿,但后训练和微调仍面临挑战。
SGLang 发布了 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 模型进行修复。修复内容包括 DSA 模型在非 CUDA/HIP 设备上的启动问题、flashinfer 在 CUDA 12 镜像上的依赖问题、长输入下 FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 在 PD 分离和上下文并行设置下的 IndexShare
vLLM 发布 v0.25.0 版本,包含 558 个提交,来自 232 位贡献者。该版本将 Model Runner V2 设为所有稠密模型的默认执行路径,并移除了 PagedAttention 遗留实现。新模型支持包括 LLaVA-OneVision-2、GLM-5、DeepSeek-V3.2 等,并引入了新的流式解析引擎和通用投机解码。性能优化涵盖 G
Interconnects AI 的最新开源模型报告指出,开源生态系统正变得更加多元化,参与者包括纯模型制造商、大科技公司和产品公司。报告重点推荐了 NVIDIA 的 Nemotron 系列、Cohere 的 Command A+、GLM-5.2、Zyphra 的 ZAYA1 和 Poolside 的 Laguna-M.1 等模型,并讨论了开源模型发布的动机
SGLang v0.5.14 发布,新增对 GLM-5.2、LiquidAI LFM2.5、Kimi-K2.7-Code、DiffusionGemma 等模型的支持,并针对 DeepSeek-V4 在 NVIDIA GB300 上实现 5 倍吞吐提升。该版本还引入了 Waterfill 和 LPLB 两种 MoE 负载均衡方法,以及 KDA CuteDSL
Z.ai 于 2026 年 6 月发布了开源模型 GLM-5.2,该模型在编码代理任务中表现出色,被社区视为开源代理的转折点。其性能在多个基准测试中与 OpenAI 和 Anthropic 的闭源模型相当,甚至超越,引发了广泛关注。作者认为 GLM-5.2 缩小了开源与闭源模型的能力差距,并可能对 Anthropic 等闭源实验室构成竞争压力。
Interconnects AI 播客邀请 Ai2 的 Finbarr Timbers 回顾前沿后训练配方,重点介绍了 2026 年出现的多教师在线蒸馏(MOPD)模式,该模式由 MiMo Flash v2 引入,并被 DeepSeek V4 和 Nemotron 3 Ultra 扩展至 10 多个教师模型。节目还梳理了从 InstructGPT 到 202
Spring AI 发布 1.1.8 版本,主要修复了智谱 AI 聊天完成结束原因枚举缺失的问题,并补充了 Anthropic 聊天文档的速率限制元数据说明。同时升级了 Spring Boot 至 3.5.15 和 MCP SDK 至 0.18.3,以提升兼容性和稳定性。