MLX v0.32.2 发布:多项修复与性能优化
MLX 发布了 v0.32.2 版本,包含多项修复和性能优化,如保留 subnormal 浮点值、支持 Ellipsis 索引、修复 divmod 截断问题、为 scaled dot product attention 添加 force fused 选项等。此外,还更新了 nanobind 至 2.15.0,并新增了 AI 使用政策。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
MLX 发布了 v0.32.2 版本,包含多项修复和性能优化,如保留 subnormal 浮点值、支持 Ellipsis 索引、修复 divmod 截断问题、为 scaled dot product attention 添加 force fused 选项等。此外,还更新了 nanobind 至 2.15.0,并新增了 AI 使用政策。
llama.cpp 0.3.0 版本发布,新增 dots3-note 多模态模型及 DSA-ISWA KV 缓存,支持 GLM-4.5-Air 的 MTP 预测,并为 DeepSeek 4 添加张量分割模式和多序列回滚修复。ggml 升级至 v0.22.0,服务器新增调试参数,Web UI 支持标签页聊天导航。
llama.cpp 发布 b10621 版本,将版本号升级至 0.3.0,并更新了 CI 发布默认描述,添加了生成发布摘要的脚本。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,支持多种硬件后端如 Vulkan、ROCm、CUDA、OpenVINO 等。
Langfuse 发布 v4.18.0 版本,新增基于负载的评估规则过滤器,并刷新了全大写、精确匹配和关键词重叠的模板。该版本还改进了 OTel 日志记录、应用内代理的工具审批来源记录,并修复了定价、分页、过滤器、自动化、OTLP 摄入限制、评估重试和 UI 显示等多个问题。此外,还调整了 GPT-5.4 推理令牌和 GPT-5.6-sol 的价格。
llama.cpp 发布 b10620 版本,主要同步了 ggml 子模块。该版本提供了覆盖 macOS、Linux、Windows、Android 及 iOS 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、CUDA、OpenVINO、SYCL 等多种后端,并附带 UI 组件。
LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V10-GGUF,该模型通过其自研的 Genesis 算法对 GGUF 格式的模型进行张量噪声修复,并融合了 Hermes 智能体微调数据。模型在保持无审查能力的同时,旨在提升稳
llama.cpp 发布 b10618 版本,修复了 GBNF 语法解析中字符类内连字符转义(\-)的问题,该问题导致工具调用语法解析失败。此修复由 Claude Code 辅助完成,并添加了相应的解析器测试。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件。
llama.cpp 发布 b10617 版本,主要变更是在 SYCL 后端中将 tq2 0 标记为不支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等后端。
OpenAI Codex负责人Tibo在播客访谈中表示,ChatGPT和Codex将融合为统一的个人AGI,下一代Agent将走向云端和更大规模计算资源,并强调OpenAI已实际应用递归式自我改进。他还回顾了在Google DeepMind的经历,认为OpenAI文化更注重快速交付和自下而上的创新。
KVBoost 是一个面向 HuggingFace 兼容解码器模型的块级 KV 缓存复用系统,通过双哈希键控和偏差引导的重计算,解决了共享内容出现在提示任意位置时的缓存命中问题。在 Qwen2.5-3B 模型上,KVBoost 相比全量重计算实现了 4.49 倍的 TTFT 加速,比 vLLM 前缀缓存快 16%,且无质量损失。该系统支持 KV 量化、磁盘溢
DigClaw公司的预测框架Rhizome v1在FutureX评测平台上获得三个前十席位,验证了预测能力可独立于基座模型。该框架通过搜索与推理解耦、轨迹记录与概率校准、因果链感知更新三大设计,降低了过度自信率。DigClaw及其关联的Newborn Ventures将这一能力应用于投资决策,并计划向产业方、金融机构和政府引导基金开放服务。
neureps 发布了 warmly-qwen35-2b-enko-gguf,这是离线 SNS 应用 Warmly 的生产模型仓库,基于 Qwen3.5-2B-enko 进行词汇剪枝和 GGUF 量化。仓库包含 base 版本和 distill-v1 版本,后者通过蒸馏提升了韩语自然性,并通过了官方门禁但尚未晋升。量化变体对比显示,IQ4 XS 结合领域 i
jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLL
llama.cpp 发布 b10615 版本,主要针对 Metal 后端为 flash-attn 向量计算添加了按设备调优的 (Q, NE) 参数,并新增了调优工具和表格,覆盖 M1 Pro、M2 Ultra、M5 Max 等设备。该版本同时提供了多平台二进制包,包括 macOS、Linux、Windows、Android 等。
llama.cpp 发布 b10614 版本,主要针对 Metal 后端进行重构,将算子源码拆分为多个文件并支持并行编译,显著提升编译速度。同时新增了 col2im 1d、CONV 2D DW(深度卷积)、Q2 0 等算子支持,并融合了 snake 激活函数。该版本还提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件
英伟达通知部分核心客户,自明年年初起,搭载其AI芯片的服务器价格将上涨超过15%,覆盖Vera Rubin和Grace Blackwell等旗舰产品,原因是存储芯片成本大幅上涨。涨价由代工厂商向微软、谷歌、甲骨文等客户传达,英伟达未回应。此举凸显存储芯片厂商三星、SK海力士、美光在AI基础设施需求爆发下的定价话语权,并给AI数据中心建设带来不确定性。
Groq宣布将成为首批采用NVIDIA Groq 3 LPX和Vera Rubin NVL72的公司,以提升其AI推理云性能。该平台在基准测试中实现每秒3400个输出令牌,显著加速代理工作负载。Groq与Dell Technologies合作部署,旨在为全球开发者和企业提供大规模推理服务。
NVIDIA 技术博客介绍了 SemiAnalysis 的 AgentX 基准测试,用于评估 AI 基础设施在代理式编码推理中的性能。该基准通过重放真实编码代理会话,测量每兆瓦吞吐量等指标。NVIDIA 公布的预览结果显示,Vera Rubin NVL72 在 AgentX 工作负载下每兆瓦吞吐量比 GB300 NVL72 高出 30 倍,而 GB300 N
NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数
NVIDIA 技术博客分析了代理型 AI 工作负载的轨迹特征,指出其高度可变且以顺序延迟为主。基于 163,594 个会话的遥测数据,超过 97% 的轨迹是独特的。NVIDIA Vera CPU 采用平衡架构,兼顾单线程性能与并发能力,以优化整个代理轨迹,相比最新竞争产品可提供高达 1.5 倍的代理性能,从而提升 AI 工厂的舰队经济性。