llama.cpp b10686 发布:Metal 共享内存断言更新
llama.cpp 发布 b10686 版本,主要更新为在 Metal 后端添加共享内存填充的断言检查,以增强稳定性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端支持。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10686 版本,主要更新为在 Metal 后端添加共享内存填充的断言检查,以增强稳定性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端支持。
llama.cpp 发布 b10684 版本,改进了 SYCL 后端中 --fit 算法对 --fit-target 的遵循,更准确地计算给定上下文大小所需的峰值显存,避免 OOM 并减少过度保留。在 Arc b70 上测试,使用 unsloth 的 qwen3.8(Q4 K XL)模型,配合 q8 0 KV 和 MTP,在 --fit-target 1 下
llama.cpp 发布 b10683 版本,主要更新为 Vulkan 后端中重复的 fastdiv 函数被合并,并重命名了优化小除数除法的函数。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10682 版本,主要更新为针对 M1 Max 芯片添加 fa-vec 调优(PR #27932)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10681 版本,主要修复了 Vulkan 后端中 mul mat id 操作的填充问题,将填充从 N 改为 K,以避免越界访问。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、ROCm、Vulkan、OpenVINO 等。
Level1Techs论坛用户thr3e通过实验发现,AI模型本地部署性能不如官方版的原因在于推理软件栈的微小差异,如注意力后端、KV缓存量化、权重量化方案等,这些差异会导致浮点运算产生数值偏移,进而改变输出token。实验显示,切换注意力后端或使用INT4 KV缓存会导致工具调用失败,而英伟达NVFP4权重量化表现最差。thr3e正在打包测试工具供其他用户
Unsloth 发布了 GLM-5.3-Flash 的 GGUF 量化版本,支持通过 llama.cpp 或 Unsloth Desktop 运行。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B,激活参数 18B,采用混合架构和 mHC 技术,性能超越 GLM-5.2 且成本更低。
OpenAI 在 SpaceX 收购 Cursor 后,以马斯克旗下公司违反合同为由切断了与 Cursor 的合作,此举被视为对 Anthropic 此前类似行动的效仿。Cursor 回应称 OpenAI 仅占其流量的 5%,并暗示决定尚未最终。同时,本周开源模型密集发布,包括 GLM-5.3、Hy4-preview 和 Qwen3.8-Flash,vLLM
UC Berkeley 和 MIT 的研究人员发布了 FreeToken,这是一个开源推理引擎,旨在通过动态协同执行,在消费级硬件上运行前沿 MoE 模型。FreeToken 采用 q 策略动态分配 CPU 和 GPU 计算,并引入语义锚点检查点,显著提升解码和预填充速度。基准测试显示,FreeToken 在 RTX 4060 笔记本上运行 Qwen3.6-
JonathanColetti 发布了 Qwen3.8-27B 的未审查版 GGUF 量化模型,通过 Heretic 工具移除拒绝方向,显著减少拒绝行为但未完全消除。模型保留多 token 预测头,提供多种量化版本和视觉投影器,并附有困惑度测量数据。该模型基于 Apache-2.0 许可,支持中英文,适用于文本生成任务。
NVIDIA 发布了 Kimi-K2-Thinking-NVFP4,这是 Moonshot AI 的 Kimi-K2-Thinking 模型的量化版本,采用 TensorRT Model Optimizer 进行 NVFP4 量化,支持 vLLM、SGLang 和 TensorRT-LLM 推理,专为 NVIDIA Blackwell 硬件优化。该模型拥有
Hugging Face 上发布了新模型 logic65/Qwen3.8-Whittle-MoE-27B-A17.8B,这是一个从 Qwen3.8-27B 中通过后验方式切分出的混合专家模型,总参数 27B,激活参数 17.8B。该模型通过仅训练路由器(冻结专家)恢复了性能,并新增了停止信号以解决推理中止问题。v2.2.1 修复了推理中止缺陷,但 GGUF
RadixArk 发布了 Qwen3.8-27B-DSpark,这是一个为 Qwen3.8-27B 目标模型设计的投机解码草稿模型,使用 SpecForge 训练并由 SGLang 提供服务。该模型在 17 个工作负载上平均接受长度提升 26.45%,吞吐量最高提升 3.16 倍,相比 EAGLE 和自回归基线有显著性能提升。
logic65 发布了 Qwen3.8-Whittle-MoE-27B-A17.8B 的 GGUF 量化版本,这是一个从 Qwen3.8-27B 中提取的混合专家模型,专注于改善停止生成行为。v2.2 版本修复了推理中止问题,但 GGUF 文件仍存在缺陷,建议关闭推理或使用 safetensors 版本。该模型提供多种量化等级,包括动态 DQ 系列,并支持
AMD 发布了基于 Qwen3.8-27B 的 INT4 权重量化模型 Qwen3.8-27B-Quark-AWQ-INT4-W4A16,采用 AWQ 算法和 AMD Quark 工具链。该模型在 GSM8K 和 BFCL 等基准测试中性能接近 BF16 基础模型,恢复率达 95% 以上。模型支持 vLLM 推理,并提供了详细的评估和量化命令。
AI云公司Lambda通过摩根大通安排,获得10亿美元私人短期债务融资,用于购买英伟达AI芯片并租赁给微软。这是Lambda近期一系列债务融资的最新一笔,此前已获得10亿美元担保信贷额度和9.26亿美元贷款用于购买英伟达GB300 GPU。该公司还据报道在洽谈30亿美元的IPO前融资轮。
llama.cpp 发布 b10679 版本,新增 bench 工具的 --tensor-read-lazy 选项,用于延迟读取张量,并重命名相关模式为 LLAMA LAZY MODE 。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制包,支持多种硬件后端。
llama.cpp 发布 b10678 版本,主要更新为减少 qwen4exp 模型的图分割数量(PR #27880)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
llama.cpp 发布 b10677 版本,修复了 Vulkan 后端在 ggml vk graph optimize 中缺失视图别名依赖的问题。该问题导致在 AMD 和 NVIDIA Vulkan 上运行 Qwen3.8 等模型时,出现贪婪解码输出错误、每次服务器启动结果不同以及投机解码接受无效等异常。修复通过比较视图源基址并排除无操作节点来确保依赖正确
据传英伟达将以130亿美元收购开源AI模型平台Hugging Face,此前英伟达已与Poolside达成60亿美元协议,Stripe也以70多亿美元收购了OpenRouter。这些交易表明,科技巨头正通过收购开源AI公司来对冲对前沿实验室的依赖,并应对推理成本上升和自研芯片趋势。开源模型目前使用率较低,但因其成本效益和可定制性,未来可能被更多企业采用。