返回全部动态

llama.cpp v0.4.0 发布:新增多模型支持与稀疏注意力

原标题:v0.4.0

llama.cpp Releases一手来源产品发布质量 83

AI 摘要

llama.cpp 发布 v0.4.0 版本,新增对 Qwen3.8-Flash-Next、Nemotron-3-Puzzle 等模型的支持,并引入按需张量读取、服务器每槽上下文限制和视频输入选项。核心更新包括 ggml 0.23.0 的稀疏闪存注意力与 RDMA 支持,以及多项多模态和服务器功能改进。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

## Overview llama.cpp 0.4.0 adds initial Qwen3.8-Flash-Next and Nemotron-3-Puzzle support, on-demand tensor reading, per-slot server context limits, video input options, and a ggml update to 0.23.0 with major sparse flash attention and RDMA work. ### API changes - Added `llama_lazy_mode` and `lazy_mode` ([#27794](https://github.com/ggml-org/llama.cpp/pull/27794)). - Added `max_buf_size` to quantize params ([#27795](https://github.com/ggml-org/llama.cpp/pull/27795)). - Bumped session/s


发布时间:2026-09-05 03:56
抓取时间:2026-09-05 04:16
来源机构:ggml-org
阅读原文github.com