llama.cpp b10541 发布:新增多模态投影器设备参数
llama.cpp 发布 b10541 版本,新增 --mmproj-device 参数及 MTMD BACKEND DEVICE 环境变量,用于指定多模态投影器的后端设备,并支持 -mmdev 短标志。该版本提供多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm 等。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10541 版本,新增 --mmproj-device 参数及 MTMD BACKEND DEVICE 环境变量,用于指定多模态投影器的后端设备,并支持 -mmdev 短标志。该版本提供多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm 等。
llama.cpp 发布 b10538 版本,主要更新为在 Metal 后端中仅对大 batch 进行 KV 缓存反量化(PR #27438),以优化性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台
llama.cpp 发布 b10537 版本,主要改进是在 Windows CI 中使用 LLVM 的 OpenMP 替代微软的非再分发调试版本,并打包了相应的许可证。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部
llama.cpp 发布 b10536 版本,主要更新为 server 端路由器在主设置完成后延迟加载启动模型。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10534 版本,主要更新为 CUDA 后端新增按硬件和量化类型调整的切换点,用于优化 mvq 到 MMQ 解码的交叉点。该更新引入了运行时环境变量 GGML CUDA MMVQ MAX 来调整批量大小阈值,并针对 Blackwell、Ada 等硬件进行了调优,在 RTX 5090 上 Q4 K 密集解码在 B=8 时性能提升 2
llama.cpp 发布 b10533 版本,主要改进是在 JSON schema 中优雅降级处理不支持的 regex 模式。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
llama.cpp 发布 b10532 版本,在 Metal 后端为 flash attention 新增 KV 缓存反量化预处理,将 Q8 0、Q4 0、Q4 1、Q5 0、Q5 1 等量化 KV 反量化为 F16 后运行注意力内核,并优化了 MLA 模型中 V 为 K 视图时的冗余反量化。该版本在 M2 Ultra 上通过全部 4798 项测试,Qwen
llama.cpp 发布 b10531 版本,主要变更包括回滚了 tensor-split meta 后端的修复提交。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台(如 macOS KleidiAI、U
AWS宣布OpenAI GPT-5.6模型现已在Amazon Bedrock上支持跨区域推理,覆盖超过25个AWS区域。该功能通过地理和全球推理配置文件实现,允许请求在多个区域间路由,以提高吞吐量和性能。GPT-5.6系列包括Sol、Terra和Luna三个变体,支持文本和图像输入,具有100万token上下文窗口,并支持推理模式、工具调用和提示缓存。
Zynerji 发布了基于 Qwen3.8-27B 的未审查模型 Ektome-Qwen3.8-27B-PristinelyUncensored,采用 Ektomē 技术去除拒绝行为,同时保持甚至略微提升模型能力(MMLU-val 从 0.812 升至 0.818,有害请求拒绝率从 100% 降至 0%)。该模型保留了完整的 MTP 头和视觉塔,并提供了多种
llama.cpp 发布 b10520 版本,主要修复了 ggml-cpu 中 fp16 类型在 32 位 ARM 平台上的编译问题,通过检查 ARM FP16 FORMAT IEEE 宏来确保类型可用性,并调整了 NEON+FMA 代码块的编译条件。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并
lmcoleman 发布了 ThinkingCap-Qwen3.6-27B 的 GGUF 量化版本,使用 MagicQuant 混合进化逐张量搜索方法,提供 Q4、Q5、Q6 等不同量化档位,并推荐 Q5 档位以平衡质量与大小。该模型基于 bottlecapai 的 ThinkingCap-Qwen3.6-27B,支持文本生成和视觉输入,可在 LM Stud
llama.cpp 发布 b10519 版本,主要重构了服务器端的睡眠处理逻辑,允许在睡眠期间访问 /metrics 端点,并添加了缓存响应、拆分指标与槽位任务等改进。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
0bserverx 发布了 Muse-Glimmer-30B-Heretic-Uncensored-GGUF,这是基于 Meta 的 Muse-Glimmer-30B 模型,通过 Heretic v1.4.0 进行 abliteration 处理,并提供了 27 种 GGUF 量化版本,内存占用从 6.53 GB 到 55.73 GB 不等。该模型支持视觉-
Anthropic 报告称,多个 Claude 模型(包括 claude.ai、Claude API、Claude Code 和 Claude Cowork)出现错误率升高的问题。目前该问题已解决,团队正在调查原因并会尽快提供更新。
llama.cpp 发布 b10517 版本,主要针对 Vulkan 后端进行优化,包括在 coopmat1 中一次性反量化 q8 0 KV 缓存,并改进了 Flash Attention 路径的容错与布局检查。该版本还提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
Liquid AI 发布了 LFM2.5 系列模型的 Q4 0 量化检查点,采用量化感知蒸馏(QAD)技术,将高精度教师模型蒸馏为量化学生模型,恢复了 BF16 精度损失的 97%。这些检查点在保持 Q4 0 低内存和高吞吐的同时,质量接近或超过 Q5 K M 和 Q4 K M,并已在 Hugging Face 上开放下载。
企业支出管理平台 Ramp 推出了自己的 AI 模型路由服务 Router,允许用户和公司通过 API 使用和切换多种大语言模型。该服务目前仅在美国可用,2026 年剩余时间内免费,并提供 26 美元信用额度。Router 提供来自 OpenAI、Anthropic、DeepSeek 等多家公司的模型,并支持多种路由策略和仪表盘监控。此举旨在进入 AI 推理
微软研究院发布了深度学习密度泛函(DFT)模型 Skala 1.1,该版本训练数据量是前版的2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala 现已集成到 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,同时推出实时基准以跟踪性能。这些进展旨在使计算化学模拟更具预测性,并广泛
AWS 博客介绍了如何使用 Amazon Bedrock 为 FHIR 医疗 API 构建智能安全监控。该方案通过异步分析访问模式、自动分类数据敏感度并生成自然语言合规报告,在不影响 API 延迟的前提下增强安全性。它使用 AWS Lambda、API Gateway、HealthLake 等组件,并包含 CloudFormation 模板和代码示例。