VOL. 2026-W36 · 12 STORIES · WEEKLY SIGNALS
AI HOT RADAR 周报
2026-08-31 — 2026-09-06 · PUBLISHED · 约 8 分钟
本周AI行业围绕推理效率与多模态能力两条主线推进
本周AI行业围绕推理效率与多模态能力两条主线推进。llama.cpp 连续发布三个版本,聚焦投机解码修复、后端内存分配优化及参数重命名,持续打磨本地推理基础设施。DeepSeek 密集发布 V4-Pro 正式版、V3.1 混合推理模型及 V4-Flash-Vision-Exp 视觉模型,均强调 Agent 能力增强,并同步调整 API 定价与格式,显示其正加速构建面向智能体的模型矩阵。Mistral 同样在 API 端发力,更新端点并发布旗舰模型新版本,同时首次推出音频模型与转录 API,将能力边界扩展至多模态。阿里 FunASR 则针对字幕生成质量进行细节修复。整体来看,头部厂商在强化推理性能与多模态覆盖的同时,均将 Agent 场景作为核心优化方向,而开源社区与云服务商(如 Cloudflare 的 AI Search)则从基础设施层面降低智能体应用的开发门槛。
本周主线
3 个章节 · 12 条情报- 01产品发布llama.cpp b10701 修复 NVFP4 草稿模型投机解码问题5
- 02模型发布DeepSeek-V4-Pro 正式版发布,增强 Agent 能力并调整 API 定价6
- 03API 与平台更新Mistral AI 发布新旗舰模型并更新 API 端点1
产品发布
PRODUCT RELEASE5 篇llama.cpp b10701 修复 NVFP4 草稿模型投机解码问题
llama.cpp 发布 b10701 版本,修复了 DFlash2 NVFP4 草稿模型在投机解码中因未传递 Q、K、V 和输出投影的缩放因子而导致接受 token 极少的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种硬件加速后端。
llama.cpp b10699 发布:优化后端内存分配与 RPC 支持
llama.cpp 发布 b10699 版本,新增 ggml_backend_op_alloc_size_may_expand 函数,用于处理 Metal、SYCL、WebGPU 等后端在特定算子上的额外内存需求,并优化了 RPC 后端的内存分配查询逻辑。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
llama.cpp b10700 发布:重命名参数并更新多平台构建
llama.cpp 发布 b10700 版本,将命令行参数 --tensor-read-lazy 重命名为 --lazy-mode,并新增 -lzm 简写。该版本同步更新了 README 文档,并提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
FunASR 1.4.10 发布:修复超长中文字幕边界问题
阿里 FunASR 发布 1.4.10 版本,修复了超长中文句子的可读字幕回退边界问题,通过平衡时长和长度并优先考虑 Jieba 词边界、标点、脚本转换和真实时间戳间隙,改善了字幕生成质量。在混合中韩样本上,84 个源片段生成了 133 个字幕,无时长或长度违规。该版本还包含已验证的 llama.cpp 运行时归档,支持多种平台和硬件变体。
Cloudflare 推出 AI Search,简化代理和开发者的自定义数据搜索
Cloudflare 推出了 AI Search 服务,为 AI 代理和开发者提供内置的搜索和检索功能,支持代理集成、多模态搜索,并与其他 Cloudflare 工具无缝集成。该服务自动处理爬取、解析、嵌入、向量数据库和搜索 API 等端到端搜索流程,并支持无 sitemap 的自动发现模式。AI Search 可通过单个命令创建搜索实例,并可通过 Worker 或公共端点集成到现有应用或 MCP 服务器中。定价方面,默认模型的嵌入和重排序免费,答案生成和查询重写按模型使用计费,测试期间免费。
模型发布
MODEL RELEASE6 篇DeepSeek-V4-Pro 正式版发布,增强 Agent 能力并调整 API 定价
DeepSeek 发布 V4-Pro 正式版,同步上线 APP、网页端和 API,模型名 deepseek-v4-pro。该版本显著增强 Agent 能力,在多项基准测试中表现优异,并原生支持 OpenAI Responses API 格式,适配 Codex。同时新增思考强度控制(low/high/max),并调整 API 定价,采用峰谷定价策略,闲时价格减半,新价格于 2026 年 8 月 17 日生效。
DeepSeek 发布多模态视觉模型 V4-Flash-Vision-Exp
DeepSeek 发布了实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,已上线 API 平台,用户可通过设置 model='deepseek-v4-flash-vision-exp' 访问。该模型在纯文本能力上与正式版持平,但在视觉理解的 Agent 基准测试中大幅提升,接近 Opus-4.8。
DeepSeek 发布 V3.1 混合推理模型,提升 Agent 能力
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级为 DeepSeek-V3.1,分别对应非思考模式和思考模式。新模型采用混合推理架构,支持两种模式,思考效率较 R1-0528 提升,并通过后训练优化增强了 Agent 能力,在 SWE-bench 等基准上表现优异。
Mistral 发布首批音频模型及转录 API
Mistral 平台发布了首批音频模型,包括 Voxtral Small 和 Voxtral Mini,用于聊天场景,以及 Voxtral Mini Transcribe 用于转录,并通过 audio/transcriptions API 提供。这些模型标志着 Mistral 进入音频领域。
Mistral 发布 open-mixtral-8x22b 模型及新 tokenizer
Mistral 平台发布了新模型 open-mixtral-8x22b(又称 open-mixtral-8x22b-2404),并指出该模型在函数调用时 tool_call_id 不能为空。同时,Mistral 还发布了三个版本的 tokenizer,适用于商业和开放权重模型。
MiniMax H3 模型镜像仓库发布
Patarapoom 在 Hugging Face 上发布了一个名为 h3-vbvr 的模型仓库,包含 MiniMax H3 模型和 VBVR 子集的 6 个文件,共 40.77 GB。这些文件未经修改,仅为了在 RunPod Serverless 环境中减少加载数据量而重新托管。每个文件遵循其上游仓库的许可条款,仓库本身不提供许可证。
API 与平台更新
API UPDATE1 篇Mistral AI 发布新旗舰模型并更新 API 端点
Mistral AI 更新了其 API 端点,重命名了三个端点并新增了两个模型端点,同时发布了新的旗舰模型 Mistral Large 和 Mistral Small 的最新版本。API 新增了函数调用和 JSON 模式功能,La Plateforme 平台增加了多币种支付和企业管理功能,并推出了新的聊天界面 Le Chat。