返回全部动态
llama.cpp b10920:Hexagon 后端支持多设备模型切分
原标题:b10920
AI 摘要
llama.cpp 发布 b10920 版本,主要新增 Hexagon 后端对多设备模型切分(row-split)的支持,由高通工程师参与贡献。该更新涵盖融合算子工作切分、多设备状态管理、fence 与同步机制、内存缓冲处理以及 ALLREDUCE 错误处理等大量修复与重构,并同步更新了开发者文档。此举使 llama.cpp 能在多设备场景下更高效地分配推理负载。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
<details open> hexagon: support for multi-device model split (aka row-split) (#28589) * hex-row-split: add support for multi-device row spliting Co-authored-by: Max Krasnyansky <maxk@qti.qualcomm.com> * hex-mdev: add work splitting to fused kernels * hex-mdev: use mdev_ prefix for all multi-device state * hex-mdev: make device configuration more expressive to support device groups * hex-mdev: fix mdev session init * hex-mdev: fused nx (2x,3x) matmuls must update row counts for each w/o
发布时间:2026-09-12 15:15
抓取时间:2026-09-12 16:11
来源机构:ggml-org