llama.cpp b10429 发布:支持解码期间访问指标和槽位
原标题:b10429
AI 摘要
llama.cpp 发布 b10429 版本,主要更新是允许在 llama_decode() 期间访问 /metrics 和 /slots 端点,通过重构 server_queue 的 worker 逻辑,在 yield_to_queue 中调用 llama_decode 并处理 process_mtmd_chunk。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,但部分平台构建(如 KleidiAI、ROCm、openEuler)被禁用。
正文节选
<details open> server: allow accessing /metrics and /slots during llama_decode() (#27041) * server_queue::worker * call llama_decode inside yield_to_queue * also handle process_mtmd_chunk * clean up * nits * rm test </details> **Website:** - <https://llama.app> **macOS/iOS:** - [macOS Apple Silicon (arm64)](https://github.com/ggml-org/llama.cpp/releases/download/b10429/llama-b10429-bin-macos-arm64.tar.gz) - macOS Apple Silicon (arm64, KleidiAI enabled) [DISABLED](https://github.com/ggm