返回全部动态
llama.cpp v0.4.1 发布:新增多模型支持并升级 ggml
原标题:v0.4.1
AI 摘要
llama.cpp 发布 v0.4.1,新增 Maple 20B-A1B 三元 MoE、腾讯 Hy 4 预览版和 Spark2.5 模型支持,并改进 JSON schema 处理、聊天解析、日志和服务器子进程管理。核心变更包括修复 DeepSeek2、GLM-MoE 等模型的 MTP KV 缓存分配,以及 Qwen/Kimi/GLM 的 GDN 归一化问题。同时 ggml 升级至 v0.24.0,扩展了后端覆盖与精度控制 API。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
## Overview llama.cpp 0.4.1 adds Maple 20B-A1B, Tencent Hy 4, and Spark2.5 support, improves JSON schema handling, chat parsing, logging, and server child-process management, and updates ggml to v0.24.0. ### API changes - Changed `llama_sampler_chain_n()` to return `int32_t` instead of `int` ([#28631](https://github.com/ggml-org/llama.cpp/pull/28631)). - Added `server_subproc` and `waiter` for router child-process monitoring in `server-common.h` ([#28555](https://github.com/ggml-org/ll
发布时间:2026-09-15 02:27
抓取时间:2026-09-15 03:09
来源机构:ggml-org