返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月4日周五 · 5 条
正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 多款 Claude 模型错误率升高已解决

Anthropic 报告其多个 Claude 模型(包括 Claude Mythos 5.1、Claude Fable 5.1 和 Claude Opus 5)出现错误率升高的问题,影响范围涉及 claude.ai、Claude API、Claude Code 和 Claude Cowork。团队已定位原因并部署修复,截至 9:16 PT 问题已解决,影响结

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

在 Amazon ECS 上为 Codex 部署 LiteLLM 网关连接 Bedrock

AWS 发布博客,介绍如何在 Amazon ECS 上部署 LiteLLM 网关,将 OpenAI ChatGPT Codex 连接到 Amazon Bedrock,实现集中式企业控制。该方案支持模型认证、路由、预算、速率限制和遥测,并提供了完整的部署步骤和架构说明。文章还讨论了直接访问 Bedrock 与使用网关的适用场景,以及 LiteLLM 作为客户自

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源产品发布

NVIDIA IFA 2026加速本地AI:RTX Spark与多模型更新

在IFA 2026上,NVIDIA联合微软及合作伙伴宣布加速本地AI推理,推出RTX Spark迷你PC,并简化Hermes Agent、OpenClaw和Perplexity Portable Computer等应用的本地模型设置。同时发布了多项模型更新,包括Nemotron 3.5 Lightning、GLM-5.3-Flash、Qwen3.8系列等,并

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA PAIR 测试版:本地网络虚拟推理路由器扩展 AI 计算

NVIDIA 发布了 Personal AI Router (PAIR) 的测试版,这是一个虚拟推理路由器,可将本地网络中的多台设备(如 RTX AI PC、DGX Spark 等)组合成动态计算集群,以缓解多智能体工作负载下的 GPU 瓶颈。PAIR 通过代理兼容 Ollama 和 LM Studio 接口,无需修改智能体代码即可将请求路由到可用节点。实测

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

英伟达推出免费工具 PAIR,将闲置电脑组建成个人 AI 数据中心

Nvidia 发布了免费开源软件 PAIR(Personal AI Router),可将家庭中闲置的电脑(如配备 RTX 显卡或 Apple M4 芯片的设备)连接起来,构建个人 AI 数据中心,用于本地 AI 推理和代理工作流。PAIR 通过六位码配对和 mTLS 加密确保安全,支持 Windows、Linux 和 macOS,目前提供测试版。此外,Nvi

9月3日周四 · 15 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

React Native ExecuTorch 发布 LLaMa 3.2 量化模型

software-mansion 在 Hugging Face 上发布了用于 React Native ExecuTorch 库的 LLaMa 3.2 模型仓库,包含 1B 和 3B 版本及其量化版本(.pte 格式),并提供了 QLoRa、SpinQuant 等优化版本。这些模型使用 ExecuTorch v0.6.0 导出,不保证向前兼容,用户需确保运行

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LFM2.5-Embedding-350M 模型发布 React Native ExecuTorch 版本

Hugging Face 发布了 LFM2.5-Embedding-350M 模型的 React Native ExecuTorch 版本,支持 XNNPACK 和 MLX 两种后端,分别适用于 Android/通用 CPU 和 Apple Silicon GPU。该模型为双向混合架构,输出 1024 维归一化嵌入,使用余弦相似度,并建议在检索时使用 'qu

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LFM2.5 模型家族发布,支持 React Native ExecuTorch

Hugging Face 上发布了 LFM2.5 模型家族,专为 React Native ExecuTorch 库设计,提供量化后的 .pte 格式文件,可直接在 ExecuTorch 运行时使用。该模型基于 LiquidAI 的 LFM2.5-VL-1.6B,支持图像与文本输入。用户需确保运行时与导出 .pte 文件所用的 ExecuTorch 版本兼容

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-Flash-Next MTP 草稿模型 GGUF 发布

Hugging Face 用户 quimmedes 发布了 Qwen3.8-Flash-Next 的 MTP(多 token 预测)草稿模型 GGUF 格式,支持推测解码,需配合其 fork 的 cafe-llama.cpp 引擎使用。该模型提供多种量化版本,并给出了详细的构建和运行示例,旨在提升解码速度。

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Claude Sonnet 5 错误率升高已解决

Anthropic 报告 Claude Sonnet 5 出现错误率升高的问题,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前问题已解决,团队正在监控结果。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10786 发布:const 传播及多平台二进制更新

llama.cpp 发布 b10786 版本,主要更新为将 const 传播到预处理类(PR #28310)。该版本提供了适用于 macOS、Linux、Windows、Android 及 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端,并附带了 UI 包。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

英伟达确认以129亿美元收购Hugging Face

英伟达确认以129.3亿美元收购AI模型托管平台Hugging Face。Hugging Face拥有300万个模型、100万个应用和50万个数据集,服务超过1800万开发者。英伟达CEO黄仁勋表示,Hugging Face将继续作为开放平台,支持开源和开放权重模型,且不强制使用英伟达计算。此次收购旨在扩大开发者访问,并可能将英伟达的算力与Hugging F

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10785 发布:Metal 稀疏注意力优化

llama.cpp 发布 b10785 版本,主要新增 Metal 上的稀疏 Flash Attention 支持,通过索引压缩和单遍扫描优化了预填充阶段的性能,并修复了多行寻址问题。该版本还包含测试用例和性能测试,并提供了多平台二进制下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10784 发布:修复 Metal GLU 调度问题

llama.cpp 发布 b10784 版本,主要修复了 Metal 后端中当 ne00=1 时 GLU 操作的调度问题,并禁用了相关的不明确测试。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Meta 发布 Muse Spark 1.3,以低价策略逼近头部模型

Meta 发布了 Muse Spark 1.3,这是其五个月内的第四款模型,xhigh 版本现已可用,max 版本处于有限预览阶段。该模型在代理任务上表现提升,但整体仍落后于 Claude Fable 5.1 等顶尖模型。其定价为每个任务 0.55 美元,是同性能级别中最便宜的,且 Meta 表示将推出开放权重版本。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10783 发布:mtmd 模块添加 const 限定符

llama.cpp 发布 b10783 版本,主要更新为在 mtmd 模块中多处添加 const 限定符,包括将 mtmd context 标记为 const,以及将 tokenize 函数的输入指针标记为 const,以支持多线程安全调用。该版本同时提供了适用于 macOS、Linux、Windows、Android 等平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10782 发布:修复多 GPU CUDA 并发流问题

llama.cpp 发布 b10782 版本,主要修复了多 GPU 场景下 CUDA 图优化被跳过的问题,通过显式设置设备允许每个分片并发流。该版本提供了适用于多种平台和硬件的二进制文件,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
量子位产品发布

陈大年复出创立StartLux,27B本地模型逼近DeepSeek万亿旗舰

陈大年复出创立本地模型公司StartLux,推出首款27B参数模型StartLux-V1.0-27B-Preview,在信通院MCP专项测试中综合得分排名第二,仅次于DeepSeek-V4-Pro。该模型可运行于消费级PC,Agent能力接近万亿级云端模型,采用Auto Research后训练技术。StartLux计划年内推出本地智能解决方案,推动本地模型商

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.28.0 发布:增强评估器功能与多项修复

Langfuse 发布 v4.28.0 版本,主要新增了评估器(evals)的提示词元数据追踪、专用执行列、告警管理、观察过滤器构建器等功能,并优化了实验表格的搜索和过滤体验。修复了包括 ClickHouse 时间戳处理、S3 上传、Redis 重连抖动等多项问题。该版本还统一了评估器名称字段、重命名了观察 API 中的 providedModelName

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10781 发布:修复 Vulkan FA dequant 路径

llama.cpp 发布 b10781 版本,主要修复了 Vulkan 后端中 FA dequant 路径的启用条件问题,当 ne[3] == 1 时跳过 nb[3] 检查,避免缓存未满时路径未启用。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、Open