返回全部动态

llama.cpp b10593 发布:修复 DeepseekV4 多序列回滚问题

原标题:b10593

llama.cpp Releases一手来源产品发布质量 79

AI 摘要

llama.cpp 发布 b10593 版本,主要修复了 DeepseekV4 在多序列场景下的回滚问题,并进行了模型加载修复、缓存清理优化和图拓扑静态化等改进。该版本提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

<details open> DeepseekV4: fix rollback with multi-seq (#26756) * DeepseekV4: fix rollback with multi-seq * fix model loading * make pending rollback single use * only clear cache for seq_id for full load * add assert for compress ratio * make graph topology static * pass true instead of flags in clear_compressed * cont : clean-up + TODOs --------- Co-authored-by: Georgi Gerganov <ggerganov@gmail.com> </details> **Website:** - <https://llama.app> **Attestations:** - <https://github


发布时间:2026-08-23 19:40
抓取时间:2026-08-23 20:10
来源机构:ggml-org
阅读原文github.com