返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月18日周二 · 10 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniCPM-o 2.6 推出 int4 量化版,手机端运行多模态模型

OpenBMB 发布了 MiniCPM-o 2.6 的 int4 量化版本,该版本通过 AutoGPTQ 量化技术将 GPU 内存占用降至约 9GB,使 GPT-4o 级别的多模态大模型(支持视觉、语音、实时语音对话等)能够在手机上运行。用户需从特定分支安装 AutoGPTQ 并使用 AutoGPTQForCausalLM 加载模型。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniCPM-V 4.5 AWQ 量化版发布,8B 参数超越 GPT-4o

OpenBMB 发布了 MiniCPM-V 4.5 的 AWQ 量化版本,该模型基于 Qwen3-8B 和 SigLIP2-400M,总参数 8B,在视觉语言任务上超越 GPT-4o-latest 和 Gemini 2.0 Pro 等专有模型。模型支持高效视频理解、可控的快速/深度思考模式,以及高分辨率 OCR 和文档解析。量化版本支持多种推理框架和本地部署

正文结构化主题已通过公开置信门槛
MLX Releases一手来源产品发布

MLX v0.32.1 发布:多项修复与性能改进

MLX 发布了 v0.32.1 版本,包含多项修复和改进。主要修复了 GGUF 元数据加载、CUDA 内核、Metal 性能、文档字符串等问题,并新增了零拷贝 CPU 导入、gather qqmm 等功能。这些更新提升了框架的稳定性和性能。

正文结构化主题已通过公开置信门槛
量子位产品发布

清华团队AI优化AI,打造国产万亿Token工厂

清华团队创立的清昴智能专注于AI自进化Infra,通过AI优化AI技术提升国产算力效率,将复杂算子开发周期从两周压缩至约1小时,模型适配周期从一个月降至1天至1周。公司已适配数十款国产芯片,并基于此打造日均万亿级Token工厂,提供Token售卖和平台输出两种商业模式。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

DeepSeek 缓存涨价 11 倍:长上下文需求暴涨,存储税时代来临

DeepSeek 于 8 月 17 日上调 V4 Pro API 价格,其中缓存命中价格在高峰时段涨幅高达 11 倍,从 0.025 元/百万 Token 涨至 0.3 元/百万 Token。涨价原因是长上下文需求激增导致后端缓存颠簸,存储、IO 和调度成本上升。文章分析了 DeepSeek 的 KV 压缩和冷热分层技术,并对比了 Anthropic 和 O

正文结构化主题已通过公开置信门槛
LangChain Releases一手来源产品发布

langchain-openai 1.5.2a1 发布:支持 OpenAI 3.0 SDK 与网关元数据

LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA 用 QAD 开发 Nemotron 3.5 Lightning NVFP4 模型

NVIDIA 发布了 Nemotron 3.5 Lightning NVFP4 检查点,通过量化感知蒸馏(QAD)将模型从 66 GB 压缩至 22 GB,同时实现高达 4 倍的吞吐量提升。该过程使用 NVIDIA Model Optimizer,先进行 PTQ 量化,再通过蒸馏恢复精度。文章详细介绍了 QAD 的两阶段流程、PTQ 配方选择及评估结果,表明

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源模型发布

NVIDIA Nemotron 3.5 Lightning 登陆 SageMaker JumpStart

AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStar

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10472 发布:修复 HIP 内存报告问题

llama.cpp 发布 b10472 版本,主要修复了 HIP 构建中错误使用 UMA 覆盖的问题,AMD APU 现在通过 hipMemGetInfo 报告准确内存,避免小内存系统上的过度承诺。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Groq 融资 3.5 亿美元,转型 AI 云服务提供商

AI 芯片初创公司 Groq 宣布获得 3.5 亿美元融资,由 Disruptive 领投,Nvidia 计划参投,估值 35 亿美元,较去年 9 月的 69 亿美元有所下降。Groq 正从 AI 芯片制造商转型为提供 Nvidia GPU 和 AI 基础设施服务的 neocloud 公司,计划到 2027 年将数据中心容量从 54 兆瓦扩展到 200 兆瓦

8月17日周一 · 10 条
正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 报告 Claude Opus 5 与 Sonnet 5 性能降级

Anthropic 报告 Claude Opus 5 和 Claude Sonnet 5 出现性能降级问题,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前 Opus 5 已恢复运行,Sonnet 5 仍处于降级状态,团队正在调查并实施修复。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源产品发布

DeepBeepMeep 发布 WanGP:低显存开源视频生成工具

DeepBeepMeep 发布了 WanGP,一个开源视频生成工具,支持 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV Video 等模型,最低仅需 6GB 显存,兼容旧 GPU,并提供 Web 界面、Lora 支持、队列系统等功能。该工具旨在让低配置用户也能使用先进的视频生成模型。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.12.0 发布:新增 v4 迁移 UI 与多项修复

Langfuse 发布 v4.12.0 版本,包含多项功能改进、修复和优化。主要新增了 v4 迁移 UI 开关、PostHog 导出失败通知、过滤器侧边栏搜索等功能,并修复了多个 UI 和 API 问题。此外,该版本明确了 v3 API 的弃用日期为 2026 年 11 月 16 日,并更新了 Gemini 模型定价。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10470 发布:改进标签推送流程并更新多平台构建

llama.cpp 发布 b10470 版本,主要更新是改进了发布流程,在 release.yml 中显式创建并推送 git 标签,使标签创建幂等且不依赖 Releases API。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种二进制构建,包括 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LocalAI 发布 Gemma 4 26B-A4B Heretic APEX 量化模型

LocalAI 团队发布了 Gemma 4 26B-A4B Heretic(去审查版)的 APEX 量化 GGUF 模型,采用混合专家架构,支持视觉理解。该模型通过 Heretic 工具进行任意秩消融以减少拒绝行为,同时保持性能。APEX 量化策略针对 MoE 模型优化,提供多种精度配置以适应不同硬件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LocalAI 发布 Gemma 4 26B MoE 的 APEX 量化版

LocalAI 团队发布了 Gemma 4 26B-A4B 模型的 APEX 量化版本,该模型基于 TeichAI 对 Google Gemma 4 的 Claude Opus 推理蒸馏版本。APEX 是一种针对 MoE 模型的量化策略,通过按张量角色分类并应用分层精度梯度来优化性能。该模型支持视觉,并可通过 LocalAI 运行。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LocalAI 发布 Gemma 4 26B-A4B APEX 量化 GGUF 模型

LocalAI 团队发布了 Gemma 4 26B-A4B 的 APEX 量化 GGUF 模型,该模型基于 Google 的 Gemma 4 26B-A4B,采用 APEX 量化策略,提供多种精度配置文件,并包含视觉投影器。模型支持本地运行,通过 llama.cpp 构建,旨在优化 MoE 模型的推理效率。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LocalAI 发布 Qwopus3.6-35B-A3B-Coder APEX-MTP GGUF 量化模型

LocalAI 团队发布了 Qwopus3.6-35B-A3B-Coder 的 APEX-MTP GGUF 量化版本,该模型基于 Qwen3.6-35B-A3B 架构,内置 MTP 多头预测头,支持自推测解码,无需单独草稿模型。提供了多种量化配置,包括 I-Balanced、I-Quality 等,并包含视觉投影器,支持图像理解。该发布旨在提升 MoE 模型

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LocalAI 发布 Qwopus3.6-35B-A3B-Coder 的 APEX 量化版本

LocalAI 团队发布了 Qwopus3.6-35B-A3B-Coder 的 APEX 量化版本,该模型是基于 Qwen3.6-35B-A3B 的 MoE 编码模型,支持视觉。APEX 量化策略针对 MoE 模型按张量角色分类并应用分层精度梯度,提供多种量化配置以适应不同硬件。该模型还包含 MTP 头,支持自推测解码,并可通过 LocalAI 运行。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

Mistral AI发布Shieldstral:3B小模型重构AI安全审核范式

Mistral AI 于2026年8月4日发布Shieldstral,一款3B参数的多模态安全分类器,支持通过自然语言自定义审核规则,统一审核文本、图片及图文混合内容。该模型采用三层设计,将审核任务转化为Yes/No判断,通过对比式训练和合成数据提升规则匹配能力,在多个基准上超越更大参数模型。Shieldstral降低了部署门槛,展示了小模型在垂直场景中的潜