llama.cpp b10797 发布:修复 s390x 架构 q5 1 量化问题
llama.cpp 发布 b10797 版本,主要修复了 ggml-cpu 在 s390x 架构上 q5 1 量化中未初始化 v acc 的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10797 版本,主要修复了 ggml-cpu 在 s390x 架构上 q5 1 量化中未初始化 v acc 的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
Nvidia 发布了开源工具 PAIR(个人 AI 路由器),可自动将本地 AI 请求分发到家庭网络中的多台设备,以缩短并行代理任务的等待时间。该工具兼容多种硬件,并在演示中将任务完成时间从单台笔记本的 18 分钟缩短至三设备集群的不到 9 分钟。PAIR 的发布是 Nvidia 将开放 AI 与其硬件更紧密结合的战略的一部分,该公司还以 129 亿美元收购
Freaksterz 发布了 Qwen3.8-27B 的 W8A8 INT8 量化版本,采用 SmoothQuant 和激活感知 GPTQ 技术,在保持低 KL 散度的同时实现比 W8A16 更快的预填充速度。该模型兼容 DFlash2 投机解码,并提供了详细的评估数据和部署指南。
inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数 124B,激活参数仅 5.1B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE。该模型在代码、智能体、通用知识等基准上匹配或超越前代旗舰,并集成 SGLang HiCache 与 Mooncake 分层缓存,将长输入场景的 TTFT 降低 60% 至
llama.cpp 发布 b10796 版本,新增 n expert used max 函数以支持每层具有不同专家数量的 MoE 模型,修复了模型加载时的错误检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10795 版本,主要更新是在 SYCL 后端启用融合优化,将 RMS NORM+MUL+ADD 和 ADD+ADD 残差链融合,以减少内核启动开销。该融合支持多种数据类型和广播/非连续场景,不支持的组合会回退到两次 add 调用。同时发布了适用于多个平台和硬件的二进制文件。
该研究揭示了大型语言模型(LLM)在不确定时如何依赖训练语料的词频先验:其输出嵌入矩阵中存在一个单一方向,编码了语料库的unigram分布,称为“无知方向”。该方向在Llama、Qwen、Gemma和Pythia等模型家族中普遍存在,且通过线性最小二乘拟合即可恢复。研究发现,将最终预测状态投影到该方向可分解为tempered Bayesian更新,其中先验加
arXiv 论文提出 DoPR 框架,通过离线压缩文档前缀并在在线重排序中复用,减少 LLM 点式重排序的冗余计算。在 TREC DL、BEIR 和 BRIGHT 基准上,使用 Qwen3 模型(0.6B 至 8B)测试,实现了最高 8.0 倍的在线文档侧内存减少和 8.04 倍延迟加速,同时保留全文档重排序器平均 NDCG@10 的 97.1%-99.5%
该研究探讨了在多智能体系统中,当智能体知晓其内部激活被监控并收到监控反馈时,基于激活的监控探针是否仍然有效。实验在四人二十一点和两人西蒙斯囚徒游戏中进行,使用Qwen3-32B-AWQ和GPT-OSS-20B模型,发现告知智能体监控存在并不会降低探针的检测准确性,智能体仍会继续共谋。这表明激活监控在智能体具有评估意识时仍具鲁棒性。
llama.cpp 发布 b10794 版本,主要重构了 SYCL 后端中 GGML SYCL ENABLE MKL FA 为全局变量。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
Minima AI 团队发布论文,提出对混合大模型 Qwen3.8-27B 的全部 496 个线性层(包括 Gated DeltaNet 循环层)进行 NVFP4 W4A4 4-bit 量化,仅用 PTQ 校准,无需 QAT 或蒸馏。实验表明,该量化模型在 MMLU-Pro、GSM8K、AIME'25 等基准上与 BF16 基线性能相当,模型大小降至 17.
LiteLLM 发布 v1.101.0-dev.2 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和功能更新,如 MCP 工具列表分页支持、Azure 工具模式扁平化、Bedrock 流式响应统一防护、Slack 用户支出阈值告警、Prometheus 速率限制指标等。
字节跳动旗下 Seed 研究团队正式发布 Seed2.0 系列模型,针对大规模生产部署和多模态理解进行了系统优化,提升了视觉感知、复杂指令执行和推理能力,并提供 Pro、Lite、Mini 及代码模型等多种规格。Seed2.0 在多项公开基准上取得领先成绩,其 Pro 和代码模型已在豆包和 TRAE 上线,API 已通过火山引擎开放。
llama.cpp 发布 b10793 版本,主要修复了每次新提交都会导致整个源代码重新编译的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
OpenAI 发布了 GPT-6 Astra,这是首个 Stargate 模型,在 FrontierMath 和 ARC-AGI-3 等基准测试中表现优异。作者通过早期访问测试发现,Astra 能够以低于每小时 6 美元的成本执行 AI 工程师任务,包括模型训练、数据标注、系统部署和子代理管理。作者利用 Astra 构建了多个工具,并认为它能够自动化大部分
llama.cpp 发布 b10791 版本,主要针对 OpenCL 后端进行优化,包括量化 lm head、解码 GEMV 及中批量 GEMM 的优化,以提升推测解码和多 token 预测性能。该版本还修复了多个内核问题,并提供了多平台二进制文件。
Shopify 工程团队推出了一种名为 Gisting 的新技术,可将长 LLM 系统提示压缩为少量学习的“要点”令牌,从而提高吞吐量并降低推理成本。在 Sidekick GraphQL 代理中,系统提示从约 6000 个令牌减少到 1500 个要点令牌,预测质量不变,中位首令牌时间从 438ms 降至 354ms,端到端延迟从 6.8s 降至 4.2s,吞
llama.cpp 发布 b10790 版本,主要调整了 SM87 架构中 MMVQ 到 MMQ 的交叉切换逻辑。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
pearsonkyle 发布了 Qwen3.8-27B 的 GPTQ W4A16 量化版本,基于 Qwen/Qwen3.8-27B,使用 32K 上下文校准,支持 vLLM 直接服务。该模型将 90.5% 参数量化为 int4,但嵌入和输出头保持 bf16,文件大小 18.1 GiB。模型内置 MTP 草稿头实现 1.71 倍解码加速,并保留视觉塔支持图像输
Langfuse 发布了 v4.28.1 版本,包含多项更新:标记关闭 Gemini 3 Pro 和 3.1 Flash-Lite 预览版,改进 Web 界面(如时间线展开、评分列显示),增强实验评估功能(支持批量评估中的变量映射覆盖),并优化 ClickHouse 性能(启用文本索引缓存)及支持自定义集群迁移。此外,还修复了认证(密码重置绑定一次性代码)和