返回全部动态
llama.cpp v0.4.0 发布:新增多模型支持与稀疏注意力
原标题:v0.4.0
AI 摘要
llama.cpp 发布 v0.4.0 版本,新增对 Qwen3.8-Flash-Next、Nemotron-3-Puzzle 等模型的支持,并引入按需张量读取、服务器每槽上下文限制和视频输入选项。核心更新包括 ggml 0.23.0 的稀疏闪存注意力与 RDMA 支持,以及多项多模态和服务器功能改进。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
## Overview llama.cpp 0.4.0 adds initial Qwen3.8-Flash-Next and Nemotron-3-Puzzle support, on-demand tensor reading, per-slot server context limits, video input options, and a ggml update to 0.23.0 with major sparse flash attention and RDMA work. ### API changes - Added `llama_lazy_mode` and `lazy_mode` ([#27794](https://github.com/ggml-org/llama.cpp/pull/27794)). - Added `max_buf_size` to quantize params ([#27795](https://github.com/ggml-org/llama.cpp/pull/27795)). - Bumped session/s
发布时间:2026-09-05 03:56
抓取时间:2026-09-05 04:16
来源机构:ggml-org