MiniCPM-o 2.6 推出 int4 量化版,手机端运行多模态模型
OpenBMB 发布了 MiniCPM-o 2.6 的 int4 量化版本,该版本通过 AutoGPTQ 量化技术将 GPU 内存占用降至约 9GB,使 GPT-4o 级别的多模态大模型(支持视觉、语音、实时语音对话等)能够在手机上运行。用户需从特定分支安装 AutoGPTQ 并使用 AutoGPTQForCausalLM 加载模型。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
OpenBMB 发布了 MiniCPM-o 2.6 的 int4 量化版本,该版本通过 AutoGPTQ 量化技术将 GPU 内存占用降至约 9GB,使 GPT-4o 级别的多模态大模型(支持视觉、语音、实时语音对话等)能够在手机上运行。用户需从特定分支安装 AutoGPTQ 并使用 AutoGPTQForCausalLM 加载模型。
OpenBMB 发布了 MiniCPM-V 4.5 的 AWQ 量化版本,该模型基于 Qwen3-8B 和 SigLIP2-400M,总参数 8B,在视觉语言任务上超越 GPT-4o-latest 和 Gemini 2.0 Pro 等专有模型。模型支持高效视频理解、可控的快速/深度思考模式,以及高分辨率 OCR 和文档解析。量化版本支持多种推理框架和本地部署
MLX 发布了 v0.32.1 版本,包含多项修复和改进。主要修复了 GGUF 元数据加载、CUDA 内核、Metal 性能、文档字符串等问题,并新增了零拷贝 CPU 导入、gather qqmm 等功能。这些更新提升了框架的稳定性和性能。
清华团队创立的清昴智能专注于AI自进化Infra,通过AI优化AI技术提升国产算力效率,将复杂算子开发周期从两周压缩至约1小时,模型适配周期从一个月降至1天至1周。公司已适配数十款国产芯片,并基于此打造日均万亿级Token工厂,提供Token售卖和平台输出两种商业模式。
DeepSeek 于 8 月 17 日上调 V4 Pro API 价格,其中缓存命中价格在高峰时段涨幅高达 11 倍,从 0.025 元/百万 Token 涨至 0.3 元/百万 Token。涨价原因是长上下文需求激增导致后端缓存颠簸,存储、IO 和调度成本上升。文章分析了 DeepSeek 的 KV 压缩和冷热分层技术,并对比了 Anthropic 和 O
LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处
NVIDIA 发布了 Nemotron 3.5 Lightning NVFP4 检查点,通过量化感知蒸馏(QAD)将模型从 66 GB 压缩至 22 GB,同时实现高达 4 倍的吞吐量提升。该过程使用 NVIDIA Model Optimizer,先进行 PTQ 量化,再通过蒸馏恢复精度。文章详细介绍了 QAD 的两阶段流程、PTQ 配方选择及评估结果,表明
AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStar
llama.cpp 发布 b10472 版本,主要修复了 HIP 构建中错误使用 UMA 覆盖的问题,AMD APU 现在通过 hipMemGetInfo 报告准确内存,避免小内存系统上的过度承诺。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
AI 芯片初创公司 Groq 宣布获得 3.5 亿美元融资,由 Disruptive 领投,Nvidia 计划参投,估值 35 亿美元,较去年 9 月的 69 亿美元有所下降。Groq 正从 AI 芯片制造商转型为提供 Nvidia GPU 和 AI 基础设施服务的 neocloud 公司,计划到 2027 年将数据中心容量从 54 兆瓦扩展到 200 兆瓦
Anthropic 报告 Claude Opus 5 和 Claude Sonnet 5 出现性能降级问题,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前 Opus 5 已恢复运行,Sonnet 5 仍处于降级状态,团队正在调查并实施修复。
DeepBeepMeep 发布了 WanGP,一个开源视频生成工具,支持 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV Video 等模型,最低仅需 6GB 显存,兼容旧 GPU,并提供 Web 界面、Lora 支持、队列系统等功能。该工具旨在让低配置用户也能使用先进的视频生成模型。
Langfuse 发布 v4.12.0 版本,包含多项功能改进、修复和优化。主要新增了 v4 迁移 UI 开关、PostHog 导出失败通知、过滤器侧边栏搜索等功能,并修复了多个 UI 和 API 问题。此外,该版本明确了 v3 API 的弃用日期为 2026 年 11 月 16 日,并更新了 Gemini 模型定价。
llama.cpp 发布 b10470 版本,主要更新是改进了发布流程,在 release.yml 中显式创建并推送 git 标签,使标签创建幂等且不依赖 Releases API。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种二进制构建,包括 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等
LocalAI 团队发布了 Gemma 4 26B-A4B Heretic(去审查版)的 APEX 量化 GGUF 模型,采用混合专家架构,支持视觉理解。该模型通过 Heretic 工具进行任意秩消融以减少拒绝行为,同时保持性能。APEX 量化策略针对 MoE 模型优化,提供多种精度配置以适应不同硬件。
LocalAI 团队发布了 Gemma 4 26B-A4B 模型的 APEX 量化版本,该模型基于 TeichAI 对 Google Gemma 4 的 Claude Opus 推理蒸馏版本。APEX 是一种针对 MoE 模型的量化策略,通过按张量角色分类并应用分层精度梯度来优化性能。该模型支持视觉,并可通过 LocalAI 运行。
LocalAI 团队发布了 Gemma 4 26B-A4B 的 APEX 量化 GGUF 模型,该模型基于 Google 的 Gemma 4 26B-A4B,采用 APEX 量化策略,提供多种精度配置文件,并包含视觉投影器。模型支持本地运行,通过 llama.cpp 构建,旨在优化 MoE 模型的推理效率。
LocalAI 团队发布了 Qwopus3.6-35B-A3B-Coder 的 APEX-MTP GGUF 量化版本,该模型基于 Qwen3.6-35B-A3B 架构,内置 MTP 多头预测头,支持自推测解码,无需单独草稿模型。提供了多种量化配置,包括 I-Balanced、I-Quality 等,并包含视觉投影器,支持图像理解。该发布旨在提升 MoE 模型
LocalAI 团队发布了 Qwopus3.6-35B-A3B-Coder 的 APEX 量化版本,该模型是基于 Qwen3.6-35B-A3B 的 MoE 编码模型,支持视觉。APEX 量化策略针对 MoE 模型按张量角色分类并应用分层精度梯度,提供多种量化配置以适应不同硬件。该模型还包含 MTP 头,支持自推测解码,并可通过 LocalAI 运行。
Mistral AI 于2026年8月4日发布Shieldstral,一款3B参数的多模态安全分类器,支持通过自然语言自定义审核规则,统一审核文本、图片及图文混合内容。该模型采用三层设计,将审核任务转化为Yes/No判断,通过对比式训练和合成数据提升规则匹配能力,在多个基准上超越更大参数模型。Shieldstral降低了部署门槛,展示了小模型在垂直场景中的潜