返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1716 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月11日周五 · 20 条
正文结构化主题已通过公开置信门槛
量子位产品发布

百度秒哒升级企业版并上线AI Coding商单平台

百度秒哒宣布升级,推出企业版与AI Coding商单平台。企业版强化组织协作、权限管理与运行保障,支持源码下载、本地部署和资源扩容;商单平台连接企业需求方与专业创作者,提供撮合、签约、支付宝托管结算与履约保障。官方称秒哒用户一年增长200倍,创造500万个应用,87%的创造者此前不会写代码,并以33.4%份额居中国AI原生无代码应用生成平台第一。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog开源

不要忽视 wrapture:Python monkey patching 新库

Simon Willison 在其博客中推荐了 Graham Dumpleton 于 2026 年 8 月 31 日发布的新 Python monkey patching 库 wrapture,认为它有望成为 Python 开发者的必备工具。wrapture 同时服务于测试和可观测性(类似 New Relic 风格的追踪),支持单元测试、调用记录、分阶段行为

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源开源

Xinference 发布 v3.4.0:新增 vLLM 多进程路由与 prefill/decode 分离

Xinference 发布 v3.4.0,新增 vLLM 原生多进程执行器路由、Gemma-4 Transformers 后端批处理支持、prefill/decode 分离、多 worker 副本扩缩容等特性,并加入 MonkeyOCR、dots OCR、Fish Audio S1-mini/S2-Pro、MiniCPM5-2B 等模型支持。该版本还增强了缓

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.35.0 发布:统一搜索、实验对比与 AI 网关改进

Langfuse 发布 v4.35.0 版本,主要更新包括统一侧边栏搜索与保存视图、实验对比运行的颜色编码、评估器控件与版本历史优化、会话时间线 UI 改进,以及 AI 网关的信任执行解析和提供商连接归属功能。此外还修复了会话预设恢复循环、网关端点解析等问题,并进行了代码重构和 CI 配置调整。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Qwen3.8-27B Escha-W2 的 GGUF 移植与 llama.cpp 内核解码

开发者 aj9o9 将 EschaLabs 的 Qwen3.8-27B-Escha-W2 模型移植到 llama.cpp,通过新增 GGML OP ESCHA MUL MAT 算子在内核中直接解码原生 2-bit escha 量化数据,无需解包为稠密张量。提供 Q8 0 和 F16 两种 GGUF 构建及可选的 MTP 推测解码草稿模型,但需要其 llama

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10909:Metal 后端融合表重构与性能修复

llama.cpp 发布 b10909 版本,主要重构 Metal 后端的算子融合机制,将所有可融合模式统一到单张融合表(ggml-metal-fuse.cpp),供图优化器和算子编码器共用。修复了融合模式中输出索引使用相对索引导致 norm/MUL 融合被静默禁用、token 生成性能回退约 5% 的问题。新增 gated delta net 与 KV c

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10908:修复 Metal iq mul mv 内核线程闲置

llama.cpp 发布 b10908 版本,主要修复 Metal 后端中 iq mul mv 系列内核在 ne00 < 1024 时的线程闲置问题。改动将 #28086 的行切分方案推广到 iq1 s、iq1 m、iq2 xxs、iq2 xs、iq2 s 和 iq3 s 六个内核,并顺带优化了 src0 行指针偏移与 offset0 的折叠处理。该版本同时

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源API 更新

OpenAI 修复 GPT-5.6 Sol API 错误率升高问题

OpenAI 状态页面报告 GPT-5.6 Sol 在 API 上出现错误率升高,影响 Chat Completions 和 Responses 服务。OpenAI 表示已定位问题并实施缓解措施,通过增加容量使部分流量恢复,最终所有受影响服务已完全恢复。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10907:修复多架构 MTP 上下文 KV cache 分配

llama.cpp 发布 b10907 版本,主要修复了 deepseek2、glm4moe、cohere2moe 等架构下 MTP(多 token 预测)上下文的 KV cache 分配问题,并新增了反向架构门控与针对 MTP 层过滤的架构测试。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10906:修复图像后推测解码位置传递问题

llama.cpp 发布 b10906 版本,修复了服务器端在图像输入后进行推测解码(speculation)时的位置传递问题:此前向 drafter 传递的是 token 数量而非实际位置,该问题影响所有 drafter 而不只是 DFlash。同时将 draft 参数 n past 重命名为 pos0,以明确其表示位置而非 token 数。该版本同步提供

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

zai-org 开源 GLM-OCR 多模态文档理解模型

zai-org 发布并开源了多模态 OCR 模型 GLM-OCR,基于 GLM-V 编码器-解码器架构,引入多令牌预测(MTP)损失和全任务强化学习,并集成 CogViT 视觉编码器与 GLM-0.5B 语言解码器。该模型在 OmniDocBench V1.5 上取得 94.62 分排名第一,参数量仅 0.9B,支持 vLLM、SGLang、Ollama 等

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

LinkedIn 用多教师蒸馏将 AI 职位搜索训练提速 8 倍

LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Solstice-AI 发布 Qwen3.8-27B NVFP4 量化模型

Solstice-AI 在 Hugging Face 发布了 Qwen3.8-27B-TURBO-Fable-Cold-Fusion 的 NVFP4 量化版本,基于 DavidAU 的 Cold Fusion 合并模型进行下游量化与打包。该模型宣称在 Claude Code 评测框架下于 9 项基准中全面超越 Claude Opus 4.6 Max,并支持

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10905:CUDA/HIP Flash Attention 调优

llama.cpp 发布 b10905 版本,主要更新为 CUDA/HIP 上的 Flash Attention 调优(针对 gfx1201)。该改动在 RDNA4 上为 head size 256 启用 mma Flash Attention 并调整配置,同时在 AMD WMMA 上优先使用整块 tile 的 FA 网格而非 stream-k,并修订了 s

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布 1.66.0:worker 配置、trace 查询与流式超时更新

Mastra 发布 @mastra/core@1.66.0 等更新,为 Mastra Cloud 引入部署范围的 worker 配置清单与运行时拓扑对比端点,并增强 trace 查询能力,支持按 span 字段、metadata、feedback 和 scores 过滤,覆盖 Postgres、ClickHouse、DuckDB 等存储后端。同时新增可观测性

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering教程

会话追踪与成本控制助力诊断 AI Agent 故障

StackGen 首席工程师 Sabith K Soopy 在 CNCF 成员文章中分享了生产环境中 AI Agent 故障诊断的实践经验,指出标准应用监控无法解释 Agent 为何循环调用、调用无效端点或虚报完成工作。文章建议使用 Langfuse 捕获嵌套会话追踪,结合硬性迭代上限、单工具调用限制和统计监控来控制成本,并将有界指标导出至 Promethe

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 拟人聊天 GGUF 量化版发布

Hugging Face 用户 LessThanThreeAI 发布了 Qwen3.8-27B-Humanlike-Chat-GGUF,这是基于 huihui-ai/Huihui-Qwen3.8-27B-abliterated 量化并叠加 rank-256 Humanlike Chat LoRA 适配器的 27B 本地模型,主打拟人化角色扮演与个人聊天而非助

正文结构化主题已通过公开置信门槛
华为昇腾 Ascend PyTorch Activity一手来源开源

华为昇腾发布 TorchNPU:PyTorch 适配插件

华为昇腾社区发布 TorchNPU,这是面向昇腾 NPU 的 PyTorch 适配插件,使 PyTorch 框架可直接调用昇腾 NPU 算力。该插件复用上游 PyTorch 能力并针对昇腾 NPU 做深度适配,涵盖基础计算、分布式训练(FSDP2、DTensor、集合通信)、图模式加速、调试调优及内存管理等模块。最新版本 TorchNPU 26.0.0 已支

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10903 发布:修复 Vulkan argsort 竞态与越界

llama.cpp 发布 b10903 版本,修复了 Vulkan 后端 argsort 中的竞态条件和越界访问问题(PR #28705),其中越界访问可能解释 CI 中的失败。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
量子位商业

墨芯人工智能亮相外滩大会:以专用稀疏推理芯片提升算力效能

墨芯人工智能作为蚂蚁集团生态合作伙伴亮相2026 Inclusion·外滩大会,展示其AI计算卡产品,主打以专用稀疏推理芯片提升算力效能。其基于自研芯片的推理集群已在西北、西南、华东、华北四大片区数据中心部署,服务智能制造、生命科学、城市治理等场景,并即将推出新一代SparsePrime®计算卡。公司还于今年7月成为工信部人工智能标准化技术委员会成员单位,8