返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月19日周六 · 16 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11050:修复 Metal FA 支持检查

llama.cpp 发布 b11050 版本,主要修复了 Metal 后端 Flash Attention 支持检查的问题(#29122)。该版本同步提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.1.274 更新:新增内存告警与 MCP 配置,修复多项问题

Claude Code 发布 2.1.274 版本更新,新增内存告警、MCP 启动等待时间配置、OpenTelemetry 追踪属性与事件、网关 Postgres 连接超时配置等能力,并修复了大量 MCP 连接、会话恢复、后台代理、网关稳定性及终端交互相关问题。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11049:测试架构生成 dummy 词表

llama.cpp 发布 b11049 版本,主要变更为 test-llama-archs 生成 dummy test vocab(#29084),该改动由 pi:llama.cpp/DeepSeek-V4-Flash-Vision-Exp 协助完成。发布同时提供 macOS/iOS、Linux、Android、Windows、openEuler 等多平台预

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11048:Metal 支持 qwen4exp HC 算子

llama.cpp 发布 b11048 版本,在 Metal 后端新增对 qwen4exp 所用 DSV4 HC 算子变体的支持,包括带逐元素 sigmoid 门控的 hc pre 以及使用恒等混合(comb 为 nullptr)的 hc post。该更新随版本一同提供 macOS、Linux、Windows、Android 等多平台预编译包。

正文结构化主题已通过公开置信门槛
量子位产品发布

华为汪涛:打造AI算力底座,昇腾960超节点与一年一代路线图

华为轮值董事长汪涛在2025全联接大会上公布昇腾芯片路线图:昇腾960DT研发提前三个季度,支持2 PFLOPS FP8、288GB HBM,并计划2028年昇腾970、2029年昇腾980,保持一年一代节奏。华为同时推出业界首个采用NPO光引擎的昇腾960超节点(4096卡、8 EFLOPS FP8),以Hi-ONE光引擎替代大量光模块,并推动CANN开源

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11047 修复 CUDA CUB argsort 原地键损坏问题

llama.cpp 发布 b11047 版本,修复了 CUDA 后端中 CUB argsort 因原地键缓冲区导致的排序损坏问题。原实现将 d keys in 与 d keys out 指向同一缓冲区,违反 CUB 双缓冲要求,导致排序结果错乱并引发下游 get rows 越界读取。修复方案是在全部六个调用点使用独立的 keys-out 缓冲区,并同步提供各

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

360与昇腾AI联合打造解决方案,为AI Agent全面提速

2026年9月17日华为全联接大会上,360集团与昇腾AI联合打造解决方案,以360智能体工厂为核心与昇腾AI深度协同,面向AI Agent场景实现全面提速。360智能体工厂支持自然语言生成智能体并组建多智能体协作蜂群,其蜂群多智能体协作技术使多角色协作任务从2小时缩短至20分钟,效率提升6倍。昇腾AI针对长序列推理和频繁KV Cache读写进行性能优化,内

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.34.3 发布:API 展示思考控制,支持 Nemotron H 视觉模型

Ollama 发布 v0.34.3 版本,GET /api/show 接口现在会返回每个模型的思考控制选项及默认值(如 low/high/max)。该版本还新增对 Nemotron H 视觉模型在 Apple Silicon 上通过 MLX 的支持,修复了从 HuggingFace 拉取模型的问题,并改进了 macOS 应用窗口行为。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11046:OpenCL 新增 flash attn bin kernel 支持

llama.cpp 发布 b11046 版本,主要变更为在 OpenCL 后端新增对 bin kernel flash attn f32 f16 bin 的支持,并对 prefill 阶段的 flash attention 做了保护性处理。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译包,覆盖 CUDA、Vul

正文结构化主题已通过公开置信门槛
SGLang Releases一手来源开源

SGLang v0.5.20 发布:新增多款模型与性能优化

SGLang 发布 v0.5.20,包含来自 237 位贡献者的 713 个 PR。该版本新增 GLM-5.3-Flash、Hy4-Preview、Qwen3.8-Flash-Next、K2 Horizon、Nanbeige4.2 等自回归模型以及 SenseNova-U1.5-8B-MoT、FastH3、VDN-H3 等扩散模型支持。同时引入 RL rol

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon SageMaker Inference 2026 年迄今新功能回顾

AWS 回顾了 Amazon SageMaker Inference 在 2026 年迄今发布的 13 项新能力,覆盖托管端点与 HyperPod Inference 两条部署路径。托管端点新增推理推荐与基准测试、容量感知实例池、OpenAI 兼容 API、容器缓存、可观测性、异步推理内联负载和前缀感知路由等七项功能。这些能力旨在降低生成式 AI 推理的部署

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA 发布 AIPerf:大规模 LLM 推理基准测试工具

NVIDIA 发布 AIPerf,作为 GenAI-Perf 的继任者,从零重写以解决 LLM 推理基准测试中客户端成为瓶颈的问题。AIPerf 采用多进程架构,通过 ZMQ 协调工作进程与结果处理服务,支持 15+ 端点类型、多种公开数据集和可调负载模式。文章以 Qwen3-0.6B 配合 vLLM 为例,演示了安装、启动服务及运行 profile 的完整

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

MariaDB 13 正式发布:扩展 Oracle 兼容性并改进开发者体验与可观测性

MariaDB Community Server 13.0 正式发布并达到 GA 稳定状态。该版本扩展了对 Oracle PL/SQL 的兼容性,新增 REF CURSOR 和 RECORD 类型支持,并为 UPDATE 语句引入 RETURNING 子句。此外还改进了查询优化器提示框架,并增强了可观测性与管理能力,如将复制角色暴露为系统变量。MariaDB

正文结构化主题已通过公开置信门槛
TechCrunch AI模型发布

ChatGPT 发明者推出非语言模型 Jev,开发者反响热烈

ChatGPT 与 RLHF 发明者之一 Diogo Almeida 离开 OpenAI 后创办 TypeSafe AI,本周发布非语言模型 Jev。Jev 基于 transformer,不输出文本而是输出概率(校准决策),因此成本极低、速度快且不会幻觉。开发者反馈其在分类、安全审查等自动化任务上比 ChatGPT Luna 5.6 快 5 至 18 倍,比

正文结构化主题已通过公开置信门槛
Google ADK Python Releases一手来源开源

Google ADK Python 发布 v2.9.2,修复 OpenTelemetry 事件名处理

Google ADK Python 发布 v2.9.2 版本,主要修复遥测行为:此前 OpenTelemetry 事件名称在非 Agent Engine 平台上会被丢弃,现在仅在 Agent Engine 上丢弃,其他平台保留事件名称,从而提升追踪的准确性和一致性。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布

Kimi K3 上线 Amazon Bedrock

Moonshot AI 的 Kimi K3 模型在 Amazon Bedrock 上线,据 Moonshot AI 称这是其最强模型,也是首个达到 2.8 万亿参数的开源模型,具备原生视觉能力和 100 万 token 上下文窗口,相比 Kimi K2 扩展效率提升约 2.5 倍。Kimi K3 是 Bedrock 上首个支持显式提示缓存的开源权重模型,可降

9月18日周五 · 4 条
正文结构化主题已通过公开置信门槛
量子位商业

无问芯穹与华环电子战略合作,共探国产异构算力AI基础设施

9月17日,无问芯穹与华环电子签署战略合作框架协议,双方将结合各自在异构算力管理与网络通信、硬件研发方面的优势,共同探索国产异构算力AI基础设施协同方案。合作内容包括联合推进智算中心解决方案的设计、软硬件适配与集成交付运维,以及探索以Token为标准化产出的“Token工厂”新模式。无问芯穹称其跨域训练系统已触达超37,000P算力、覆盖16种主流芯片,其M

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

将多模型 AI 智能体迁移至 Amazon Bedrock AgentCore runtime

AWS 博客介绍如何将基于 Hugging Face smolagents 构建的多模型医疗 AI 智能体从自管理的 Amazon ECS/Fargate 迁移到 Amazon Bedrock AgentCore runtime。迁移后由 AgentCore 托管容器生命周期、扩缩容、身份与可观测性,同时保留三模型编排(SageMaker 上的 BioM-E

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 发布新版 AgentCore runtime:弹性、优化且启动稳定

AWS 发布新版 Amazon Bedrock AgentCore runtime,针对生产级 AI Agent 的托管计算层进行优化。新版本改进了内存管理,会话结束后立即回收内存而非维持峰值占用,并实现与容器大小和并发量无关的稳定冷启动时间。该更新旨在支持从短对话到长时间自主运行的各种 Agent 工作负载,降低闲置成本并提升响应一致性。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

用编码代理在 SageMaker AI 上部署 Hugging Face 模型

AWS Machine Learning Blog 介绍如何用编码代理(Kiro、Claude Code)在 Amazon SageMaker AI 上部署 Hugging Face 模型。文章指出无引导的代理会因部署知识过时而选错服务容器(如 TGI 无法加载 Qwen3),导致健康检查失败和 GPU 浪费;为此 Hugging Face Skills 提