llama.cpp b11138 发布:修复 Jinja 一元运算符解析
llama.cpp 发布 b11138 版本,主要修复了 Jinja 模板引擎中一元 +/- 运算符的解析问题,使其在变量前(如 items[:-n] 和 GigaChat 的 indent[:-indent factor])能正确解析,并确保过滤器/测试保持在操作数之外。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11138 版本,主要修复了 Jinja 模板引擎中一元 +/- 运算符的解析问题,使其在变量前(如 items[:-n] 和 GigaChat 的 indent[:-indent factor])能正确解析,并确保过滤器/测试保持在操作数之外。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译
llama.cpp 发布 b11136 版本,其 llama-server 现在接受 OpenAI 兼容的 video url 内容类型,并支持 data:video/ 的 base64 URI。此前服务端只接受非标准的 input video 类型且拒绝视频 data URI,导致符合 OpenAI 规范的客户端报错。该改动使 llama-server 能
llama.cpp 发布 b11135 版本,主要修复了 server 端通过 dedup-cache-models 对草稿 HF 模型进行去重的问题(对应 issue #27846),并避免在 lambda 中捕获结构化绑定。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11132 版本,新增对 Gemma 4 DSpark 草稿骨干(draft backbone)的支持,包括 GGUF 转换与运行时支持,覆盖全注意力与 SWA 两种 Gemma 4 DSpark 草稿,并支持绑定输出权重与布尔型骨干元数据。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预
llama.cpp 发布 b11130 版本,主要更新为 make-release 流程中的 summary prompt 调整。该版本提供了覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
llama.cpp 发布 b11126 版本,主要变更为在 Vulkan 后端新增 IQ4 XS 量化格式的 MMQ/MMV 矩阵乘法内核并做性能优化。优化过程中针对 Intel A770 上 MMVQ 出现 27.3% 的 tg 性能回退,选择在 Intel 设备上禁用 IQ4 XS 的 MMVQ。该版本同时提供覆盖 macOS、Linux、Windows
llama.cpp 发布 b11125 版本,主要变更是 ggml-meta 解析多缓冲区视图(multi buffer views),并添加 TODO 以便在图分配器重构后重新审视。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
llama.cpp 发布 b11124 版本,主要修复了 CUDA 后端中 top-k MoE 算子应始终触发的问题(PR #28432)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
星驿付与慧徕店作为阿里云AI战略合作伙伴在2026云栖大会亮相,发布墨斗云AI应用生态全景,并展示行业首创的鲁班超级AI智能体。鲁班采用OpenClaw+Hermes双擎架构,支持无感接入微信、企微、钉钉等工具,已累计服务数十万商户,日均Token调用量超350亿。墨斗云平台覆盖商业智能应用、企业级解决方案与基础生态应用,AI商户审核系统替代人工75%工作量
Google 为其开源 TPU 性能分析工具 XProf 新增了 Kernel Profiling 套件,使开发者能够查看自定义 Pallas 内核的周期级细节,而此前这些内核在 trace 中只是不透明的块。该套件提供编译器检查、Trace Viewer 的 LLO 数据以及硬件计数器采样三种层级,并支持外部事件触发实现亚微秒级捕获。在 tiled mat
商汤大装置资深技术专家罗伟在2026全球AI芯片峰会Token工厂异构混训混推技术研讨会上发表演讲,介绍商汤大装置以Token为中心的新一代AI基础设施实践。商汤大装置日均Token服务量从2月的0.46万亿增长至8月的4.5万亿,通过横向编排与纵向优化两条主线提升Token产能,并规划从固定P/D配比走向动态资源池、再走向模块级资源池的技术演进方向。
南京人工智能企业汇智智能发布一站式AI服务平台Hellome,称其为国内首个实现FDE(前沿部署工程师)与企业客户直接对接的应用智能体服务平台。客户在平台发布需求后由认证FDE承接,依托自研桌面智能体Hzhermes完成方案设计、部署与上线,将AI落地周期压缩至周级。平台同步启动FDE百万激励计划,并称其智能体服务已覆盖50余个行业、超1万家企业客户,未来三
斑马智能在云栖大会发布新一代全模态端侧大模型AutoOmni 2.0-23B-A3B,采用MoE架构,普通任务能力堪比10倍参数量云模型,复杂任务达其80%-90%。同时亮相AutoClaw 2.0智舱协作服务实车方案,并宣布与YoooClaw合作打通车内车外上下文数据。该模型已合作10家芯片企业,推理加速5-6倍,量化保真度超99%。
Mastra 发布多项更新,核心是 @mastra/mcp@2.0.0 基于 MCP 2026-07-28 修订版重写,移除 initialize 握手,改用 suspend/resume 机制处理需要输入的工具体。新增 Azure AI Search 和 Weaviate 两个向量存储后端,并为可观测性 trace 查询加入分页、字段发现和增量轮询。持久化
llama.cpp 发布 b11122 版本,主要更新为 SYCL 后端扩展 MMVQ GLU 融合,支持混合量化类型,并新增 rms norm+scale 与 ssm conv+silu 融合。同时提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11121 版本,主要变更为 SYCL 后端新增对 get rows back 算子的支持,目前仅支持 fp32/fp16 精度,并同步更新了 ops.md 文档。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CUDA、Vulkan、ROC
Comfy-Org 在 Hugging Face 上发布了 FLUX.1-Krea-dev 的 ComfyUI 重打包版本,提供 fp8 量化后的单文件扩散模型 flux1-krea-dev fp8 scaled.safetensors。该模型基于 Black Forest Labs 官方发布的 FLUX.1-Krea-dev 微调模型,沿用其非商业许可,并
Hugging Face 用户 pottokao 发布了 Qwen-Image-2.1 文本编码器(Heretic)的量化版本,提供 GGUF(Q4 K M)、FP8 和 bf16 三种格式,并附带 mmproj 文件以支持 Qwen3-VL 视觉塔。作者指出此前 GGUF 报错源于 ComfyUI-GGUF 未加载视觉塔,并提供了配套补丁节点 ComfyU
Langfuse 发布 v4.42.0 版本,主要包含 Web 前端重构(将深层导入统一走 index.ts)、UI 修复与设计系统组件迁移,以及 trace 消息内部预览、注释与评论嵌入 trace/session 等新功能。AI 网关方面新增对 Anthropic 连接的支持,评估模块引入实验性的决策模型评估器(TypeSafe Jev)并移除相关功能开
Comfy-Org 在 Hugging Face 上发布了 MiniMax-Music-3 的 ComfyUI 重打包模型文件,基于 MiniMaxAI/MiniMax-Music3 原始模型。该仓库提供 DiT、文本编码器和 VAE 等多精度权重文件(fp16、fp32、int8、bf16 等),并附带文本生成音乐的 ComfyUI 工作流模板,方便用户在