llama.cpp b10426 发布:wasi 强制单线程
llama.cpp 发布 b10426 版本,主要更新为在 wasi 上强制单线程执行(PR #25686)。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持 Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 KleidiAI、ROCm 等)被禁用。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10426 版本,主要更新为在 wasi 上强制单线程执行(PR #25686)。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持 Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 KleidiAI、ROCm 等)被禁用。
llama.cpp 发布 b10425 版本,主要更新为在 SYCL 后端融合了 gated-delta-net 状态写回操作,提升了 Arc Pro B70 上 Qwen 3.6 27B 模型的推理性能,文本生成速度提升约 1.2%。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
AutoPrune 是一个由 Hugging Face 论文提出的 AI4AI 框架,利用大型语言模型自动设计视觉令牌剪枝策略,通过领域特定语言和残差搜索公式实现高效剪枝。实验表明,在移除 94.4% 视觉令牌时,AutoPrune 保留了超过 99% 的全令牌性能,同时将 FLOPs 减少 9.9 倍,预填充延迟降低 6.4 倍。该框架在 14 个多模态基
llama.cpp 发布 b10424 版本,主要改进了 DFlash 架构中 target layer ids 的日志输出格式,使其更清晰易读。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
Latent Space 报道称,Google 发布 Gemini 3.7 Flash 模型,使其在性能上重新回到前沿。文章指出,此前 3.5 和 3.6 Flash 版本已落后于 Claude 4.8+ 和 GPT 5.5+ 系列模型,而新版本通过更新缩小了差距。该更新对 Google 在 AI 模型竞争中的地位具有积极影响。
Meta AI Research 开源了 Muse Glimmer,一个 300 亿参数、Apache 2.0 许可的模型,专为本地设备上的自主代理、工具调用和编码任务设计。该模型通过动态量化和 DFlash 投机解码优化,可在消费级 GPU 上运行,内存占用降至 17-20 GB。Muse Glimmer 在多个基准测试中表现优于同类模型,并支持多种本地框
LLMRouter 论文提出了一个统一的 LLM 路由基础设施,将路由形式化为包含五个组件的顺序决策过程,并构建了覆盖多种任务的 xRouteBench 基准。该框架包含 16 种以上的路由方法,实验表明学习型路由器比最强固定模型基线相对提升 14.6%,并支持从训练到部署的端到端流程。
本研究针对量化混合专家模型(MoE)中的路由翻转问题,提出了一种因果分析框架,并发现检测路由翻转比判断其是否需要修复更容易。实验表明,在4位KV缓存量化下,约三分之一的性能损失由路由中介引起,但现有推理可观测的统计量无法预测翻转的损失符号,存在经验性的收益检测障碍。研究还发现参考保真度的修复效果因架构而异,且门控归一化约定仅影响损伤幅度而非路由可恢复性。
arXiv 上发布了一篇关于基于大语言模型的多智能体系统通信拓扑的研究论文。论文提出 E2-Explainer 框架,通过因果推断识别通信拓扑中的关键子图,以解释协作成功的原因并剪除冗余边。实验表明,该框架能有效降低通信成本并保持任务性能。
Hugging Face 每日论文发布了一篇关于全带宽 Transformer 的研究,该研究通过引入潜在反馈机制,将解码步骤中顶层隐藏状态与采样 token 嵌入融合后反馈回网络底部,以拓宽垂直反馈通道,从而在不改变核心架构、KV 缓存和语言建模目标的前提下提升推理能力和效率。实验表明,在 1B 参数规模、400B token 的训练下,全带宽 Trans
英特尔宣布其Muse Glimmer模型在Intel GPU和Xeon CPU上通过上游vLLM和Hugging Face Transformers实现Day-0支持,覆盖从工作站到云实例的广泛硬件。该支持得益于英特尔的“Upstream First”承诺、对开源社区的持续贡献以及与Meta的紧密合作。用户可通过vLLM的HTTP服务器(兼容OpenAI A
VIDRAFT 推出了 AX-Ray,一个用于 AI 和 AX 部署的安全诊断层,基于 FINAL-Bench Diagnostics 构建。AX-Ray 在公开诊断中识别出 Zyphra/Zamba2-1.2B 和 nvidia/Nemotron-H-8B-Base-8K 两个模型存在因果泄漏缺陷,即前缀行为依赖未来 token,属于结构性正确性失败。该缺
Ollama 发布了 v0.32.11 版本,主要新增了 Muse Code 和 DeepSeek Harness 的集成,并匹配了 Muse Glimmer 的推理模板。这些更新旨在增强对相关模型和工具的支持。
ReRound 是一种无需校准的后训练量化方法,通过条件扩散模型生成低比特权重的连续重建,以解决标准舍入到最近方案在量化区间中点附近的歧义问题。该方法利用容差度量选择候选量化矩阵,并通过匹配前导奇异值确定最优容差,在 3-bit 和 4-bit 权重量化中优于标准 RTN,且不增加推理开销。ReRound 对小规模 LLM 特别有效,其性能优于多种免校准方法
llama.cpp 发布 b10423 版本,主要更新为在所有工具中应用 CPU 参数(PR #27026)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 KleidiAI、ROCm 7.14
llama.cpp 发布 b10419 版本,主要针对 OpenVINO 后端进行了多项优化和修复。新增了对 Qwen3.5、GPT-OSS MoE 和 MXFP4 的支持,并修复了 NEOX RoPE 在 GPU 状态模式下的精度问题。此外,通过引入 GGML OPENVINO RELEASE WEIGHTS 选项和流式权重重量化,显著降低了 GPU 推理
llama.cpp 发布 b10418 版本,主要更新是支持 SYCL 主机固定内存以提升主机到设备的访问性能,并修复了线程安全问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10415 版本,主要更新为自动检测 MTP 草稿模型类型(PR #27005)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 macOS KleidiAI、Ubu
OpenAI 推出了名为 Ultrafast 的新模式,使最新模型 GPT-5.6 Sol 的处理速度提升至标准处理的 14 倍,每秒可生成多达 750 个输出 token。该模式由 OpenAI 与芯片制造商 Cerebras 合作提供支持,目前仅向少数客户开放预览,未来将扩大访问范围。OpenAI 表示,Ultrafast 可应用于事件响应、客户服务、金
另有 1 家信源报道
bartowski 发布了 Muse-Glimmer-30B 模型的 GGUF 量化版本,该模型由 meta-models 开发,支持文本和图像输入,并具备 MTP 和 imatrix 功能。量化版本使用 llama.cpp 生成,提供从 bf16 到 IQ3 XXS 的多种量化格式,以适应不同硬件和性能需求。推荐用户选择 Q4 K M 版本作为性能与大小的