返回全部动态
llama.cpp b10419:OpenVINO 后端优化与 Qwen3.5 支持
原标题:b10419
AI 摘要
llama.cpp 发布 b10419 版本,主要针对 OpenVINO 后端进行了多项优化和修复。新增了对 Qwen3.5、GPT-OSS MoE 和 MXFP4 的支持,并修复了 NEOX RoPE 在 GPU 状态模式下的精度问题。此外,通过引入 GGML_OPENVINO_RELEASE_WEIGHTS 选项和流式权重重量化,显著降低了 GPU 推理时的内存占用和编译期内存峰值。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> OpenVINO: Qwen3.5, memory optimization, and test-recurrent-state-rollback (#26952) * OpenVINO backend: 1) enable gpt-oss moe on OV bk; 2) enable mxfp4 support * OpenVINO backend: disable TOPK_MOE op test * OpenVINO Backend: Add op FILL support * OpenVINO backend: enable set rows with multi dims * fix the name missmatch in setrow + view * OpenVINO backend: enable op GGML_UNARY_OP_SIGMOID * OpenVINO Backend: enable SQR & SQRT * OpenVINO backend: 1) ensure unique node names
发布时间:2026-08-14 06:11
抓取时间:2026-08-14 06:20
来源机构:ggml-org