返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月5日周六 · 13 条
正文结构化主题已通过公开置信门槛
Simon Willison's Weblog研究

GPT-6 Astra 图像生成对比:质量与成本优势显著

Simon Willison 在 2026 年 9 月 4 日获得 GPT-6 Astra 的访问权限,并用它生成不同推理级别的自行车鹈鹕 SVG 图像,与 GPT-5.6 Sol、Terra 和 Luna 进行对比。结果显示 Astra 生成的图像质量明显优于其他模型,且成本效率更高,低推理级别下仅需 9.55 美分即可获得比 Sol 任何级别更好的结果。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10816 发布:为 M3 添加 Metal 调优

llama.cpp 发布 b10816 版本,主要更新为在 Metal 后端为 M3 芯片添加剩余的 fa-vec 调优,包括 q4 0、q4 1、q5 0、q5 1 等量化格式。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp v0.4.0 发布:新增多模型支持与稀疏注意力

llama.cpp 发布 v0.4.0 版本,新增对 Qwen3.8-Flash-Next、Nemotron-3-Puzzle 等模型的支持,并引入按需张量读取、服务器每槽上下文限制和视频输入选项。核心更新包括 ggml 0.23.0 的稀疏闪存注意力与 RDMA 支持,以及多项多模态和服务器功能改进。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10814 发布:扩展 OpenCL 算子覆盖与拷贝优化

llama.cpp 发布 b10814 版本,主要扩展了 OpenCL 后端的算子覆盖范围:新增九个元素级一元操作(如 sgn、elu、hardswish 等),支持 f32/f16 及向量化变体;优化了连续张量的拷贝调度,将大行拷贝分散到整个设备;并将 CONCAT 操作扩展到所有非量化类型。这些改进在 Adreno 840/850 等设备上通过了测试,提

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10813 发布:新增 Adreno OpenCL SDPA 路径

llama.cpp 发布 b10813 版本,新增了针对 Adreno GPU 的 OpenCL xmem SDPA 路径,通过环境变量 GGML OPENCL XMEM SDPA 控制,并修复了数值误差优化 GQA/mask attention 的问题。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件

正文结构化主题已通过公开置信门槛
MIT Technology Review AI观点

AI 时代的内存与存储架构设计

本文由 Micron 赞助,探讨 AI 推理时代对内存和存储架构的新要求。文章指出,AI 推理工作负载多样且对延迟敏感,数据移动成为新瓶颈,企业需将数据中心视为集成系统,统筹计算、内存、存储和网络。Tirias Research 分析师 Jim McGregor 强调,优化整个网络和了解工作负载至关重要,内存和存储应从后台硬件提升为战略资产。

正文结构化主题已通过公开置信门槛
智东西研究

d-Matrix详解3D-DRAM AI芯片:带宽超100TB/s,能效比HBM高10倍

在Hot Chips 2026大会上,AI推理芯片初创公司d-Matrix详细介绍了其Raptor 3D-DRAM加速器,该芯片采用台积电N4逻辑裸片与3D DRAM面对面堆叠,单卡带宽超100TB/s,能效比HBM高10倍。Raptor通过Stream Blocking、Stream Flipping和Bank Chaining等创新技术解决了带宽浪费、I

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp 发布 b10809,版本升至 0.4.0

llama.cpp 发布 b10809 版本,将版本号升级至 0.4.0。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的预编译二进制文件,支持多种硬件后端,包括 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等。部分平台(如 macOS KleidiAI 和 openEuler)的构建被禁用

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Gemma 4 12B 推出 LiteRT-LM 格式,支持多模态与多令牌预测

litert-community 发布了 Gemma 4 12B 模型的 LiteRT-LM 格式版本,支持文本、视觉和音频模态以及多令牌预测,可在 macOS、Linux、Windows 和 Web 上部署。该模型基于 Google 的 Gemma 4 12B,适合桌面端离线使用,需 LiteRT-LM v0.17 或更高版本。模型文件大小约 6.9GB,

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA Jetson 边缘部署推理模型:优化与性能提升指南

NVIDIA 技术博客介绍了如何在 Jetson 边缘设备上部署和优化推理模型,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。文章指出,新一代紧凑型开放模型使边缘 AI 具备推理和智能体能力,并详细说明了 NVFP4 量化和投机解码如何提升推理性能。这些优化使模型能够在 Jetson 上本地运行,减少对数据中心的依赖,适

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

AWS 与 NVIDIA 合作:在 SageMaker HyperPod 上构建物理 AI 模型工厂

AWS 博客介绍了如何利用 NVIDIA Cosmos 3 在 SageMaker HyperPod 上构建物理 AI 模型工厂。Cosmos 3 采用混合 Transformer 架构,统一处理视频、图像、动作和声音,支持前向动力学、逆动力学和动作策略三种模式。该设计使数据生成、后训练和评估可在同一 GPU 集群上运行,提高资源利用率。文章提供了端到端示例

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出 HyperPod InstantStart:AI 代理驱动的 SageMaker 操作控制平面

AWS 发布了 HyperPod InstantStart,这是一个开源控制平面,用于通过 AI 代理驱动 SageMaker HyperPod 操作。它提供 Web UI、REST API 和 MCP 工具三种接口,统一后端 API,支持集群创建、节点恢复、训练和推理等操作。该设计将操作规则编码到控制平面 API 中,确保代理驱动的基础设施可靠。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.30.0 发布:实验功能增强与修复

Langfuse 发布了 v4.30.0 版本,主要更新包括实验功能中基于分数列重建结果网格、新增更差比较过滤器和按运行分数矩阵,以及修复了 SelectInput 文本截断问题。此外,还升级了 uuid 依赖并更新了 API 和代理相关文档。

9月4日周五 · 7 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10798 发布:构建信息输出可配置

llama.cpp 发布 b10798 版本,主要更新是让构建信息输出流可配置,llama print build info 函数现在接受调用者提供的 FILE 参数,默认仍为 stderr,但 llama-app 的版本命令改为输出到 stdout。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 发布 ROCmFPX 量化版本

Hugging Face 上发布了 Qwen3.8-27B 模型的 ROCmFPX 量化版本,该版本基于 BF16 原始模型,使用 imatrix 校准数据生成。这些量化模型无法在主流 llama.cpp 中运行,需要使用支持 ROCmFPX 格式的分支(如 ROCmFPX 或 LaurentZuijdwijk/llama.cpp)。该发布旨在提升 AMD

正文结构化主题已通过公开置信门槛
THE DECODER商业

Deepseek计划在内蒙古部署16万颗华为芯片,打造最大集群

Deepseek计划在内蒙古建设一个大型数据中心,部署至少16万颗华为下一代Ascend-950DT芯片,这将是已知最大的华为芯片集群,但仅用于推理,训练仍依赖英伟达硬件。由于生产限制和内存短缺,华为可能无法在一年内交付全部订单,而中国内存制造商CXMT首次小批量生产HBM3E,但技术仍落后三星等厂商三至五年。此举是中国政府推动芯片产业自主化的一部分。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 无审查版 W4A16 量化模型发布

noon-at-cgn 发布了 Qwen3.8-27B-Uncensored-W4A16-AutoRound,这是对 orcarouter/Qwen3.8-27B-Uncensored 的 W4A16 量化版本,该模型基于 Qwen3.8-27B 并移除了安全对齐。量化使用 Intel AutoRound 完成,保留了模型的 262,144 token 上下

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布沙箱模板、统一工作目录及反馈审查等更新

Mastra 发布 2026 年 9 月 3 日更新,引入可复用沙箱模板和统一工作目录选项,支持跨 Docker、E2B 等提供商。新增可观测性反馈审查工作流,以及服务器端定义的 toModelOutput 用于客户端工具。同时集成 Vitest 测试运行器,并包含多项破坏性变更。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Primitive AI 发布 Qwen3.8-Flash-Next NVFP4 量化版,单 GPU 可运行

Primitive AI 发布了 Qwen3.8-Flash-Next 的 NVFP4 量化版本,使 180B 参数的模型能在单张 96GB Blackwell GPU 上运行。该量化模型在 9 项基准测试中平均得分 92.2,支持 MTP 投机解码,并提供了详细的部署方案,包括 CPU 卸载和 NVMe 映射选项。

正文结构化主题已通过公开置信门槛
量子位商业

趋境科技与摩尔线程合作,国产AI Token方案性价比超国际先进算力

趋境科技与摩尔线程达成战略合作,基于趋境科技的国产PD异构技术和摩尔线程MTT S5000智算卡及MUSA平台,推出Token Pod联合解决方案,已投入生产并承接头部模型厂商的真实流量。该方案在同等生产标准下,性价比超越国际先进算力,实现了国产PD异构推理在生产环境的落地。双方计划将合作拓展至互联网、基础模型公司和运营商等行业。