返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月25日周二 · 16 条
正文结构化主题已通过公开置信门槛
MLX Releases一手来源产品发布

MLX v0.32.2 发布:多项修复与性能优化

MLX 发布了 v0.32.2 版本,包含多项修复和性能优化,如保留 subnormal 浮点值、支持 Ellipsis 索引、修复 divmod 截断问题、为 scaled dot product attention 添加 force fused 选项等。此外,还更新了 nanobind 至 2.15.0,并新增了 AI 使用政策。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp 0.3.0 发布:新增多模态模型与多项推理优化

llama.cpp 0.3.0 版本发布,新增 dots3-note 多模态模型及 DSA-ISWA KV 缓存,支持 GLM-4.5-Air 的 MTP 预测,并为 DeepSeek 4 添加张量分割模式和多序列回滚修复。ggml 升级至 v0.22.0,服务器新增调试参数,Web UI 支持标签页聊天导航。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp 发布 b10621 版本,升级至 0.3.0

llama.cpp 发布 b10621 版本,将版本号升级至 0.3.0,并更新了 CI 发布默认描述,添加了生成发布摘要的脚本。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,支持多种硬件后端如 Vulkan、ROCm、CUDA、OpenVINO 等。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.18.0 发布:新增评估过滤器与多项修复

Langfuse 发布 v4.18.0 版本,新增基于负载的评估规则过滤器,并刷新了全大写、精确匹配和关键词重叠的模板。该版本还改进了 OTel 日志记录、应用内代理的工具审批来源记录,并修复了定价、分页、过滤器、自动化、OTLP 摄入限制、评估重试和 UI 显示等多个问题。此外,还调整了 GPT-5.4 推理令牌和 GPT-5.6-sol 的价格。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10620 发布:同步 ggml 并更新多平台二进制

llama.cpp 发布 b10620 版本,主要同步了 ggml 子模块。该版本提供了覆盖 macOS、Linux、Windows、Android 及 iOS 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、CUDA、OpenVINO、SYCL 等多种后端,并附带 UI 组件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-35B-A3B 无审查多模态模型 Genesis Hermes V10 发布

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V10-GGUF,该模型通过其自研的 Genesis 算法对 GGUF 格式的模型进行张量噪声修复,并融合了 Hermes 智能体微调数据。模型在保持无审查能力的同时,旨在提升稳

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10618 发布:修复 GBNF 语法转义问题

llama.cpp 发布 b10618 版本,修复了 GBNF 语法解析中字符类内连字符转义(\-)的问题,该问题导致工具调用语法解析失败。此修复由 Claude Code 辅助完成,并添加了相应的解析器测试。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10617 发布:SYCL 后端弃用 tq2 0

llama.cpp 发布 b10617 版本,主要变更是在 SYCL 后端中将 tq2 0 标记为不支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
量子位观点

OpenAI Codex负责人Tibo访谈:Agent将走向云端,ChatGPT与Codex融合

OpenAI Codex负责人Tibo在播客访谈中表示,ChatGPT和Codex将融合为统一的个人AGI,下一代Agent将走向云端和更大规模计算资源,并强调OpenAI已实际应用递归式自我改进。他还回顾了在Google DeepMind的经历,认为OpenAI文化更注重快速交付和自下而上的创新。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

KVBoost:块级 KV 缓存复用与偏差引导重计算加速 LLM 推理

KVBoost 是一个面向 HuggingFace 兼容解码器模型的块级 KV 缓存复用系统,通过双哈希键控和偏差引导的重计算,解决了共享内容出现在提示任意位置时的缓存命中问题。在 Qwen2.5-3B 模型上,KVBoost 相比全量重计算实现了 4.49 倍的 TTFT 加速,比 vLLM 前缀缓存快 16%,且无质量损失。该系统支持 KV 量化、磁盘溢

正文结构化主题已通过公开置信门槛
量子位研究

VC用AI预测未来:DigClaw框架在FutureX获三个前十

DigClaw公司的预测框架Rhizome v1在FutureX评测平台上获得三个前十席位,验证了预测能力可独立于基座模型。该框架通过搜索与推理解耦、轨迹记录与概率校准、因果链感知更新三大设计,降低了过度自信率。DigClaw及其关联的Newborn Ventures将这一能力应用于投资决策,并计划向产业方、金融机构和政府引导基金开放服务。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Warmly 发布 Qwen3.5-2B 韩英 GGUF 生产模型

neureps 发布了 warmly-qwen35-2b-enko-gguf,这是离线 SNS 应用 Warmly 的生产模型仓库,基于 Qwen3.5-2B-enko 进行词汇剪枝和 GGUF 量化。仓库包含 base 版本和 distill-v1 版本,后者通过蒸馏提升了韩语自然性,并通过了官方门禁但尚未晋升。量化变体对比显示,IQ4 XS 结合领域 i

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B-heretic-dflash:非官方 5 层 DFlash 投机解码草稿模型

jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLL

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10615 发布:Metal flash-attn 按设备调优

llama.cpp 发布 b10615 版本,主要针对 Metal 后端为 flash-attn 向量计算添加了按设备调优的 (Q, NE) 参数,并新增了调优工具和表格,覆盖 M1 Pro、M2 Ultra、M5 Max 等设备。该版本同时提供了多平台二进制包,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10614:Metal 后端并行编译与新增算子支持

llama.cpp 发布 b10614 版本,主要针对 Metal 后端进行重构,将算子源码拆分为多个文件并支持并行编译,显著提升编译速度。同时新增了 col2im 1d、CONV 2D DW(深度卷积)、Q2 0 等算子支持,并融合了 snake 激活函数。该版本还提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件

正文结构化主题已通过公开置信门槛
智东西商业

英伟达AI服务器明年涨价超15%,存储成本压力传导

英伟达通知部分核心客户,自明年年初起,搭载其AI芯片的服务器价格将上涨超过15%,覆盖Vera Rubin和Grace Blackwell等旗舰产品,原因是存储芯片成本大幅上涨。涨价由代工厂商向微软、谷歌、甲骨文等客户传达,英伟达未回应。此举凸显存储芯片厂商三星、SK海力士、美光在AI基础设施需求爆发下的定价话语权,并给AI数据中心建设带来不确定性。

8月24日周一 · 4 条
正文结构化主题已通过公开置信门槛
Groq Blog一手来源产品发布

Groq率先部署NVIDIA Groq 3 LPX与Vera Rubin NVL72

Groq宣布将成为首批采用NVIDIA Groq 3 LPX和Vera Rubin NVL72的公司,以提升其AI推理云性能。该平台在基准测试中实现每秒3400个输出令牌,显著加速代理工作负载。Groq与Dell Technologies合作部署,旨在为全球开发者和企业提供大规模推理服务。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA Vera Rubin 和 Blackwell 树立代理式 AI 每瓦性能新标准

NVIDIA 技术博客介绍了 SemiAnalysis 的 AgentX 基准测试,用于评估 AI 基础设施在代理式编码推理中的性能。该基准通过重放真实编码代理会话,测量每兆瓦吞吐量等指标。NVIDIA 公布的预览结果显示,Vera Rubin NVL72 在 AgentX 工作负载下每兆瓦吞吐量比 GB300 NVL72 高出 30 倍,而 GB300 N

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能

NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA Vera CPU 应对代理型 AI 舰队挑战

NVIDIA 技术博客分析了代理型 AI 工作负载的轨迹特征,指出其高度可变且以顺序延迟为主。基于 163,594 个会话的遥测数据,超过 97% 的轨迹是独特的。NVIDIA Vera CPU 采用平衡架构,兼顾单线程性能与并发能力,以优化整个代理轨迹,相比最新竞争产品可提供高达 1.5 倍的代理性能,从而提升 AI 工厂的舰队经济性。