返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月9日周三 · 20 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10874 发布:修复 Granite MoE 参数计数

llama.cpp 发布 b10874 版本,主要修复了 Granite MoE 模型未知参数计数的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布高级追踪查询、租户级删除及 Factory 看板更新

Mastra 发布 2026 年 9 月 9 日更新,核心亮点包括:新增高级追踪查询契约及 ClickHouse、DuckDB、Postgres 实现;支持租户级追踪删除与级联清理;为工作流控制流块添加元数据;Agent 频道新增 onAction 处理器;Factory 自定义看板成为一等公民。同时包含多项破坏性变更,涉及 @mastra/factory

正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.29.0 发布:默认 MRV2,新增多模型支持与性能优化

vLLM 发布 v0.29.0 版本,包含 594 个提交,来自 277 位贡献者。主要亮点包括 Model Runner V2 成为所有模型的默认执行器,新增多个模型支持(如 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA 等),并针对 Kimi K3 和 DeepSeek V4 进行了性能优化。此外,该版本引入了新的默

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10872 发布:修复 Jinja 模板 null 成员测试问题

llama.cpp 发布 b10872 版本,主要修复了 Jinja 模板中当可选变量默认为 null 时,在 map 中进行成员测试报错的问题,使其与 Jinja 的正常查找行为一致。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种构建,包括 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10871 发布:Vulkan 专用 iq4 xs 着色器提升性能

llama.cpp 发布 b10871 版本,新增了针对 Vulkan 后端的专用 iq4 xs 矩阵向量着色器,替代了通用回退实现,在 RDNA4 上使 token 生成速度提升约 6-17%。该版本还移除了一个无效的实验性分支,并提供了适用于 macOS、Linux、Windows、Android 等平台的多种二进制下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10870 发布:Vulkan 新增 f16 B 型流水线

llama.cpp 发布 b10870 版本,主要更新为 Vulkan 后端新增 f16 B 型矩阵乘法流水线,并为 Intel coopmat1 调整 warp tile 大小。该功能在密集矩阵乘法中已对所有厂商启用,而 MoE 部分仍仅限 Intel。同时提供了多平台预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10869 发布:优化测试线程使用并更新多平台构建

llama.cpp 发布 b10869 版本,主要更新为测试中数据初始化使用更少线程,并根据元素数量调整线程数。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Latent Space研究

OpenAI 称 AI 用 1 万智能体 88 小时解决纳维-斯托克斯难题

OpenAI 关联账号宣称,其 AI 系统在约 1 万个智能体协作下,于 88 小时内解决了纳维-斯托克斯千年难题中的有限时间奇点问题,耗资超 4000 万美元,涉及 1300 亿 token。该方法基于多智能体强化学习和并行测试时计算,但未提供定理陈述或证明细节,数学界尚未验证。该事件引发关于 AI 研究能力与计算规模的热议。

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.15 发布:增强 NumPy 2 兼容性与流式可靠性

阿里 FunASR 发布 v1.4.15 版本,主要改进包括 NumPy 2 兼容性、流式与训练可靠性修复,以及 MOSS 和部署文档更新。该版本还提供了与 llama.cpp 运行时配套的预编译二进制文件,支持多种平台。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

OpenBMB 发布首个昇腾原生 1.58 位三元大模型 BitCPM-CANN

OpenBMB 发布了 BitCPM-CANN 模型系列,这是首个基于华为昇腾 NPU 原生训练的端到端 1.58 位三元大语言模型系统。该系统将量化感知训练集成到 Megatron-LM 框架中,并使用 MindSpeed 加速,在昇腾 910B 上训练了 0.5B 至 8B 四个模型。在 11 项基准测试中,1B/3B/8B 模型保留了全精度性能的 95

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 Turbo LoRA 适配器发布,支持 ComfyUI 加速视频生成

drbaph 在 Hugging Face 发布了 MiniMax-H3 Turbo LoRA 适配器,专为 ComfyUI 优化,支持文本到视频和参考到视频生成。这些 LoRA 通过动态秩压缩技术,将模型大小减少最多 83%,同时保持高数值保真度,并加速推理步骤。该仓库包含多个版本的 LoRA 文件,并提供了详细的数值验证结果。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10868 发布:新增 MoE 模型的 IQ 类型处理

llama.cpp 发布 b10868 版本,主要新增对 MoE(混合专家)模型的 IQ 类型处理支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。此次更新旨在提升 MoE 模型在 llama.cpp 中的兼容性和

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布

GPT-6 Astra 登陆 Amazon Bedrock,强化企业级 AI 应用

OpenAI 的 GPT-6 Astra 模型已在 Amazon Bedrock 上正式可用,该模型具备更强的推理和判断能力,支持高达 100 万 token 的上下文窗口,并引入了显式和隐式提示缓存。它通过 OpenAI 的 Preparedness Framework 评估,成为首个达到网络安全能力 Critical 级别的模型,并集成了 AWS 的安全

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LTX-2.5-turbo-GGUF 发布:需更新 ComfyUI 加载器

ChrisColeTech 在 Hugging Face 上发布了 LTX-2.5-turbo-GGUF,这是基于 Lightricks/LTX-2.5 的量化模型,需使用更新的 GGUF Loader 在 ComfyUI 中加载。该模型目前处于实验阶段,旨在通过 GGUF 量化降低资源消耗。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源研究

Pathway 大脑启发架构在 SageMaker HyperPod 上开发

AWS 机器学习博客介绍了 Pathway 公司基于大脑启发的 BDH 架构,该架构在 Amazon SageMaker HyperPod 上进行训练。BDH 架构在潜在空间中进行推理,无需生成中间文本,通过稀疏局部交互和类突触连接维持状态,解决了 Transformer 在训练和推理中的低效问题。Pathway 声称其 1.5 亿参数的 BDH 模型在 A

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10867 发布:修复 iGPU 回归并默认禁用惰性加载

llama.cpp 发布 b10867 版本,主要修复了集成显卡(iGPU)上的性能回归问题,默认禁用惰性张量加载。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种硬件后端。

正文结构化主题已通过公开置信门槛
智东西产品发布

Arm推Neoverse CSS N4及AGI CPU,火山引擎等合作落地

Arm在Arm Everywhere China活动上推出新一代数据中心CPU计算子系统Neoverse CSS N4,并披露其首款自研服务器CPU AGI CPU在中国的生态合作进展,包括火山引擎、新紫光集团等合作伙伴。Neoverse CSS N4最高128核,性能较上代提升至2倍;AGI CPU面向AI数据中心,已获多家企业采用。Arm正通过IP、CS

正文结构化主题已通过公开置信门槛
智东西模型发布

面壁智能开源2B端侧模型MiniCPM5-2B,性能超Gemma 4

面壁智能联合OpenBMB开源了2B参数的端侧语言模型MiniCPM5-2B,该模型在4B以下开源模型中评测得分第一,智能密度超过谷歌Gemma 4 12B等更大模型。同时开源了强化学习框架Meshy和策略JustRL II,并完成英特尔、瑞芯微、Arm等平台的首日适配。此举旨在推动端侧Agent能力落地,降低使用成本。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

简化开源AI天气预报模型的运行

Hugging Face 与 Earthmover 联合发布博客,旨在简化开源 AI 天气预报模型的运行流程。文章指出,尽管模型权重开放,但计算、存储和带宽问题阻碍了实际应用。他们提供了使用 Earthmover 数据平台和 Hugging Face 的教程,演示如何运行 ECMWF AIFS、Microsoft Aurora 等模型,并对比 ERA5 数据

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源研究

AWS 基准测试:G7 Blackwell 实例在小型 LLM 推理中优于 G5/G6

AWS 在 SageMaker AI 上对 30B MoE 模型(Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B)进行了 G7(Blackwell)与 G5、G6、G6e 实例的推理基准测试。结果显示,G7 凭借原生 FP4 支持和更高内存带宽,在吞吐量、延迟和成本效益上优于前代实例。文章介绍了使用 SageMake