返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1720 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月1日周二 · 4 条
正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.26.0 发布:新增 API 预览与评估追踪,修复多项问题

Langfuse 发布了 v4.26.0 版本,主要新增了 API 规范预览和评估器执行追踪链接功能,并修复了结构化输出中的推理冲突、OpenAI 工具 schema 嵌套及无状态调用等问题。此外,该版本还优化了 OTel 数据解析和 Web 组件重构。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10724 发布:KV 缓存恢复性能大幅优化

llama.cpp 发布 b10724 版本,优化了 KV 缓存状态恢复时非连续单元格的散列读取性能,通过按连续运行批量复制,将恢复时间从 25-63 秒降至 221-424 毫秒,并增加了相关测试。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10723 发布:优化 Intel Xe-LP GPU 的 OpenCL 量化性能

llama.cpp 发布 b10723 版本,主要针对 Intel Xe-LP GPU 优化 OpenCL 量化路径,通过调整 Q4 K/Q5 K 的矩阵乘法分块大小和 N DST 参数,提升其 TG 和 PP 性能。该版本同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA BioNeMo 与 Claude Science 集成,实现蛋白质结构预测

NVIDIA 与 Anthropic 合作,将 BioNeMo Agent Toolkit 集成到 Claude Science 中,使 AI 代理能够直接调用 BioNeMo NIM 微服务进行蛋白质结构预测。该工具包将生命科学模型封装为代理可调用的技能,在内部基准测试中将任务正确率从 60% 提升至 100%,并将 token 效率提高约一倍。教程展示了

8月31日周一 · 16 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布 GLM-5.2 NVFP4 量化模型

NVIDIA 发布了 GLM-5.2 的 NVFP4 量化版本,该模型基于 ZAI 的 GLM-5.2,采用 MoE 架构和稀疏注意力,支持长上下文。量化使用 NVIDIA Model Optimizer,支持 SGLang 和 vLLM 推理,专为 Blackwell 硬件优化。模型以 MIT 许可证发布,适用于商业和非商业用途。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10721 发布:修复 WebGPU 偏移量崩溃问题

llama.cpp 发布 b10721 版本,主要修复了 WebGPU 后端中 ggml backend tensor get() 实现当偏移量不是 4 的倍数时可能崩溃的问题,并改进了代码可读性。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CU

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10720 发布:ROCm 新增 radix TOP K 支持

llama.cpp 发布 b10720 版本,主要更新是在 ROCm 后端为长行添加了 radix TOP K 支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10719 发布:为 M1 添加 fa-vec 调优

llama.cpp 发布 b10719 版本,主要更新是为 M1 芯片添加 fa-vec 调优(PR #28078),并提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件。该版本还包含对 KleidiAI 和 openEuler 构建的禁用说明,以及 UI 包。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10718 发布:CUDA MoE 融合扩展至多 token

llama.cpp 发布 b10718 版本,主要更新是将 CUDA 上的 MoE 融合扩展到 specdec 场景,此前 MOE glu 融合和 topk-router 融合仅限于单 token,现在支持多 token,并新增 SWIGLU CLAMP 案例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.25.0 发布:增强评估与 CSV 解析

Langfuse 发布 v4.25.0 版本,包含多项新功能、修复和重构。新功能包括定义标准化的 I/O 契约、增强 CSV 解析错误处理、改进 ClickHouse 查询 AST、持久化会话头部可见性、MCP 评估器输出定义、按数据集名称过滤评估样本等。修复涉及 API 历史数据访问限制、OTel 属性路径重建、UI 问题等。此外,还进行了多项代码重构和文

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

微软扩展Foundry模型路由器至28个区域并更新模型池

微软将 Foundry 模型路由器从两个区域扩展到 28 个全球标准部署区域和 21 个数据区域,并更新了模型池,新增了 Claude Opus 4.8 和 GPT-5.6 系列,移除了多个旧模型。默认配置的团队会自动接收更新,而自定义子集的团队则需手动调整。该更新强调 API 稳定性与行为稳定性的区别,并涉及路由模式、上下文窗口限制、成本附加费及合规性等细

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10715 发布:融合 DFlash 编码器提升性能

llama.cpp 发布 b10715 版本,主要更新是将 DFlash 编码器融合到 KV 缓存注入解码中,避免了设备到主机的数据传输和额外的图构建,提升了性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10714 发布:优化 Vulkan 批处理推理性能

llama.cpp 发布 b10714 版本,主要针对 Vulkan 后端在 Strix Halo 上的批处理推理进行了性能调优,通过为 RDNA3 架构设置静态 mat-vec 行数(4行)来提升矩阵向量乘法的速度。该版本提供了适用于多种平台和硬件(如 macOS、Linux、Windows、Android)的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10713 发布:为 WebGPU 添加 MUL MAT 内存支持

llama.cpp 发布 b10713 版本,主要更新是为 WebGPU 支持在 ggml 中添加 MUL MAT 操作到可能需要额外内存的操作列表中。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

海信发布家庭智能伴侣级AIOS JUOS,实现从被动响应到主动懂家

海信于8月31日发布行业首个家庭智能伴侣级AIOS——海信JUOS,该系统面向家庭全场景,适配电视、闺蜜机、投影等多终端,搭载自研星海大模型与四大原生引擎,实现从被动响应到主动服务的代际跃迁。JUOS通过超级小聚、AI个性桌面、小聚妙联等核心体验升级,并获人工智能终端智能化分级L3认证,计划9月起推送至首批机型。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位商业

范式与华为达成昇腾950算力战略合作

范式与华为达成战略合作,成为首批采用华为昇腾950芯片的AI企业。此次合作旨在应对境外算力不确定性,增强范式在金融、政务等行业的交付能力,并为其未来数年营收提供稳定基础。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10712 发布:Vulkan 新增 top k 基数选择优化

llama.cpp 发布 b10712 版本,主要更新为 Vulkan 后端新增 top k 基数选择着色器,用于 k = 1024 的场景,并针对 Qwen 3.8 Flash Next 模型添加了 top-k 测试和 QSA 融合优化。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10711 发布:修复 Hexagon CPY fence 错误

llama.cpp 发布 b10711 版本,主要修复了 Hexagon 后端中的 CPY fence 错误。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端,如 Vulkan、CUDA、ROCm、OpenVINO 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10710 发布:为 M2 添加量化格式调优

llama.cpp 发布 b10710 版本,主要更新为针对 M2 芯片添加了 Q4 1、Q5 0、Q5 1 量化格式的 fa-vec 调优。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。