返回全部动态

llama.cpp b10419:OpenVINO 后端优化与 Qwen3.5 支持

原标题:b10419

llama.cpp Releases一手来源产品发布质量 83

AI 摘要

llama.cpp 发布 b10419 版本,主要针对 OpenVINO 后端进行了多项优化和修复。新增了对 Qwen3.5、GPT-OSS MoE 和 MXFP4 的支持,并修复了 NEOX RoPE 在 GPU 状态模式下的精度问题。此外,通过引入 GGML_OPENVINO_RELEASE_WEIGHTS 选项和流式权重重量化,显著降低了 GPU 推理时的内存占用和编译期内存峰值。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> OpenVINO: Qwen3.5, memory optimization, and test-recurrent-state-rollback (#26952) * OpenVINO backend: 1) enable gpt-oss moe on OV bk; 2) enable mxfp4 support * OpenVINO backend: disable TOPK_MOE op test * OpenVINO Backend: Add op FILL support * OpenVINO backend: enable set rows with multi dims * fix the name missmatch in setrow + view * OpenVINO backend: enable op GGML_UNARY_OP_SIGMOID * OpenVINO Backend: enable SQR & SQRT * OpenVINO backend: 1) ensure unique node names


发布时间:2026-08-14 06:11
抓取时间:2026-08-14 06:20
来源机构:ggml-org
阅读原文github.com