返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 14 条
正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布15

Claude Code 2.1.283 更新:新增模型管控与提示审计

Claude Code 发布 2.1.283 版本更新,新增网关提示头、可用/禁用模型管理设置、MCP 与 WebFetch/WebSearch 输出的 OpenTelemetry 追踪,以及 /doctor prompt-audit 审计命令等能力。同时修复了 SDK 会话工具调用丢失、MCP 后台进度通知、插件加载与校验、沙箱与权限对话框等多处问题。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布17

Prism ML 发布三值量化 Bonsai 2 27B GGUF 模型

Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1 0)或 7.21 GB(PQ2 0),相比

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源9

llama.cpp b11189:OpenCL 新增 Q5 K A8 二进制 GEMM 内核

llama.cpp 发布 b11189 版本,主要变更是为 OpenCL 后端新增两个二进制 GEMM 内核(kernel gemm noshuffle q5 k f32 32b trans ila a8 bin 和 kernel gemm noshuffle q5 k q8 1 dp4a ila a8 bin),分别覆盖非 dp4a 与 dp4a 的 A8

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp b11188 修复旧版 GLSLC 的 Vulkan 构建问题

llama.cpp 发布 b11188 版本,主要修复了旧版 GLSLC 编译器因不支持 cooperativeMatrix API 而导致的 Vulkan 构建问题。改动通过新增 GGML VULKAN COOPMAT GLSLC SUPPORT 宏检查、在创建前过滤不支持的 FA 两阶段内核,并将 Intel FA 着色器指针创建的锁保护移入 CM1 编

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp 发布 b11185:提取共享 Unicode 路径/字符串辅助函数

llama.cpp 发布 b11185 版本,主要变更是将共享的 Unicode 路径与字符串辅助函数提取到 common 模块(PR #29415),由 Adrien Gallouët 提交。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROC

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp b11183:Metal FA kernel 按数据类型拆分

llama.cpp 发布 b11183 版本,主要变更是将 Metal 后端的 flash attention(fa)kernel 按数据类型拆分为独立库,并附带一处注释小修正。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
智东西产品发布4

昇腾950超节点正式上市,主打十万亿大模型训推

华为在全联接大会2026期间正式上市昇腾950超节点,包括面向液冷数据中心的Atlas 950 SuperPoD和面向企业级风冷机房的Atlas 850E,称其为业界最大规模商用超节点。产品通过灵衢高速互联、统一内存编址、自研散热与电源等技术,宣称训练效率提升1.5-1.7倍、推理性能提升2-3倍、时延低于10ms,并已在互联网、金融、医疗等行业落地。昇腾同

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp b11182:新增精度策略与 W4A4 推理路径

llama.cpp 发布 b11182 版本,核心变更是新增 llama prec policy 精度策略并引入模型驱动的 W4A4(4位权重/4位激活)推理路径(PR #24364),由 NVIDIA 工程师 ynankani 提交,Georgi Gerganov 等人参与评审。该改动涉及 ggml CUDA 后端 mmq.cu 的 MXFP4 调度调整,

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业4

智元第20000台具身机器人交付长隆,超300台常驻乐园

智元在横琴长隆飞船乐园部署超300台具身机器人,覆盖导览、科普、零售、酒店等七大场景,首期部署后预计整体规模达数千台。同日,第20000台具身机器人远征A3 Ultra下线交付长隆,长隆×智元具身智能文旅联合研究院揭牌,并联合中国移动发布文旅场景大规模5G-A具身智能创新应用。智元称2026年为「具身智能部署态元年」,行业评价指标从本体参数与Demo完成度转

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程4

AWS 在 EKS 上用 EFA 和 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%

AWS 机器学习博客介绍了一种在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,声称吞吐量提升 40%。文章指出大规模 RLHF/GRPO 训练面临 rollout 生成与策略训练资源竞争、计算/内存/带宽平衡、以及从节点内 NVLink 到节点间低带宽通信转变三大挑战,其中专家并行(EP)的动态 all-to-a

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程4

在 SageMaker HyperPod 上用 SkyRL 加速多模态 RL 训练

AWS 博客介绍在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL 进行多模态强化学习训练。方案以 Qwen3-VL-8B 视觉语言模型为策略模型,采用 GRPO 算法训练其走 2D 迷宫,从 VisGym SFT 检查点出发,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。HyperP

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程4

NarrateAI:Amazon Bedrock 上的生产级 LLM 质量保障

AWS 博客介绍 NarrateAI 在 Amazon Bedrock 上为高管业务评审提供生产级 LLM 质量保障,服务超过 4000 名 AWS 高管。文章详述五种协同技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,实现约 99% 的数值准确率并支持实时流式响应。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程4

在 Amazon SageMaker AI 上部署 Qwen3-TTS 实时个性化语音

AWS 博客介绍如何在 Amazon SageMaker AI 上通过 JumpStart 部署阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型,实现实时语音克隆。该模型支持 10 种语言和跨语言克隆,仅需几秒参考音频即可复刻说话人音色,无需重新训练。部署采用 vLLM-Omni 容器和全托管实时推理端点,用户可

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布12

Jev AI 实用指南:System One 与可执行决策

Hugging Face 博客发布了一篇关于 Jev AI 的实用指南。Jev AI 是 TypeSafe 的旗舰模型和首个 System One 模型,定位为面向软件团队的决策工具,通过「状态 + 类型化问题」的接口返回选项、分数、是/否判断和概率信号,而非生成文本。文章将其与生成式 LLM 对比,说明它适合分类、路由、评分和安全检查等有界决策场景,并介绍

9月25日周五 · 6 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源7

llama.cpp b11181 发布:提高 HIP 版本要求以支持 fp8

llama.cpp 发布 b11181 版本,主要变更是提高 HIP 版本要求以支持 fp8,避免在 HIP 6.2 中缺少 hip fp8 e4m3 支持的问题。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源7

llama.cpp 发布 b11180:修复 RPC 分配缓存键

llama.cpp 发布 b11180 版本,主要修复了 RPC 后端中 get alloc size 缓存键未包含 nb 参数的问题,并将计算结果下限设为 ggml nbytes。该改动由 Georgi Gerganov 等人提交,旨在提升 RPC 内存分配计算的正确性。同时发布了覆盖 macOS、Linux、Windows、Android 等多平台及 C

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布10

Langfuse 发布 v4.46.0:新增实验对比与技能管理

Langfuse 发布 v4.46.0 版本,新增实验并排对比、数据集条目格式化 JSON、基础技能管理以及追踪表格 100 行分页选项等功能。同时修复了计费 webhook 时间戳解析、数据保留设置、图表与界面细节等多项问题,并进行了设计系统迁移和数据集读取性能优化。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering商业4

Perplexity 自研 CobbleDB 替换 DynamoDB,查询延迟降低 5 倍

Perplexity 将核心搜索服务层从 Amazon DynamoDB 迁移到自研的 Rust 分布式键值存储 CobbleDB,以解决向大语言模型提供多 KB 文档批次时的高延迟与高成本问题。新架构将持久化存储与热层检索解耦,使批量读取延迟降低约 5 倍,存储费用至少降低 20%。CobbleDB 由两名系统工程师配合 AI 编码智能体在两个月内完成,公

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源7

ggml-org 发布小米 MiMo-V2.6-Flash-RL 的 GGUF 量化版

ggml-org 在 Hugging Face 上发布了小米 MiMo-V2.6-Flash-RL 的 GGUF 量化版本,支持通过 llama.app 运行。该版本提供 MXFP4、Q2 K 等多种量化输出,并附带用于投机解码的 MTP 与 DFlash drafter sidecar,以及面向视觉和音频编码器的 Q8 0 mmproj。模型由 ggml-

正文结构化主题已通过公开置信门槛
THE DECODER商业3

AI推高成本:NSA测试耗资数十亿,医院保险账单战加剧

美国国家安全局向国会表示,今年将花费数十亿美元测试先进AI模型,其中算力是最大开支,人员薪酬也因需与AI实验室竞争而推高成本。在医疗领域,医院和保险公司利用AI进行账单编码与理赔审查,互相博弈导致护理成本上升,蓝十字蓝盾协会称医院借此两年多收近10亿美元。文章还指出,企业按token计费的模式使大客户算力支出高昂,OpenAI和Anthropic等提供商正通