VOL. 2026-08 · 120 STORIES · MONTHLY REVIEW
AI HOT RADAR 月报
2026-08-01 — 2026-08-31 · PUBLISHED · 约 71 分钟
本月AI行业格局呈现三条主线:推理效率的极致化、世界模型与物理AI的…
本月AI行业格局呈现三条主线:推理效率的极致化、世界模型与物理AI的加速落地、以及开源生态的深度分化。在推理侧,OpenAI自研芯片Jalapeño宣称能效与延迟大幅超越Blackwell,而NVIDIA则通过NVLink Fusion与NVHBM强化定制AI基础设施,芯片层竞争白热化;同时,投机解码与量化技术成为软件侧主流优化路径,GLM-5.3-Flash、Qwen3.8-27B等模型均推出多版本量化与草稿模型,llama.cpp、vLLM等推理框架密集迭代,显示推理成本与延迟仍是行业核心痛点。世界模型方面,NVIDIA发布Cosmos3全模态系列,Anthropic推出MHS标准统一AI控制物理硬件接口,配合Code-as-World等研究,物理AI正从单一模态走向全模态、从感知走向具身控制,但该方向仍处早期,成熟度有待观察。开源生态呈现分化:一方面,Qwen3.8、GLM-5.3等大模型通过量化、投机解码、MoE切分等方式向消费级硬件渗透,如16GB显存可运行27B模型;另一方面,企业级部署更强调高可用与治理,如Salesforce多可用区方案、AWS Claude网关。跨条目的归纳判断是:行业正从'模型能力竞赛'转向'系统效率与部署成熟度竞赛',同一模型通过多种优化手段适配不同硬件与场景,而物理AI的标准化接口(如MHS)可能成为下一阶段的关键卡位点。
本月格局
9 个章节 · 120 条情报- 01研究进展Code-as-World:用可执行代码表示物理世界进行推理19
- 02产品发布OpenAI 发布自研推理芯片 Jalapeño,性能超越 Blackwell64
- 03模型发布GLM-5.3-Flash NVFP4 量化版发布:体积缩减70%17
- 04开源项目three.ws 开源栈:为 AI 代理提供身体、大脑、钱包与工作2
- 05API 与平台更新OpenAI Node SDK v7.6.0 发布:新增混淆字段与安全增强3
- 06教程与实践AWS 展示 SageMaker AI 与 Bedrock AgentCore 构建多智能体工作流3
- 07行业与商业谷歌Gemini市场份额下滑,ChatGPT和Claude持续增长5
- 08观点扎克伯格发布AI宣言:四大要点解读3
- 09其他ai@5.0.2344
研究进展
RESEARCH19 篇Code-as-World:用可执行代码表示物理世界进行推理
arXiv 论文提出 Code-as-World 范式,将物理世界表示为可执行代码,通过智能体循环(提出、执行、渲染、验证)从多模态观测中构建可执行世界模型。该模型用于训练视觉语言模型进行定量物理推理,Code-as-World-VL 在 QuantiPhy 基准上达到最先进性能,超越领先专有模型。
Muon优化器通过谱范数控制缓解任务干扰,提升持续学习与模型合并性能
该研究将持续学习中的灾难性遗忘和模型合并中的权重解缠误差统一为任务干扰现象,并证明其可归结为逐层的Frobenius内积。理论分析表明,优化器通过控制更新的谱范数来影响任务干扰,而Muon优化器恰好通过构造调节该因子。实验显示,将AdamW替换为Muon在八任务模型合并基准上平均提升最高5.02个准确率点,并在持续学习多个协议上取得一致增益。
Rasch测量理论用于LLM评估:以LLM作为评分者的案例研究
该研究将Rasch测量理论应用于LLM评估,以LLM作为评分者标注仇恨言论为例,分析了九个LLM与人类评分者的差异。研究发现LLM在严重性、项目校准、问题顺序鲁棒性、目标身份敏感性和评分量表使用上系统性地偏离人类,这些差异在标准评估中会被掩盖。作者主张RMT应纳入LLM评估工具箱。
模态成熟度指数:评估全模态模型多模态能力的基准
arXiv 论文提出 Modality Maturity Index (MMI) 基准,用于评估全模态模型在文本、图像、音频、视频和文档五种模态及其组合上的输入输出能力。MMI 包含 893 个问题,并引入 Modality Presence Score (MPS) 衡量模态生成能力。测试五个前沿模型发现 MPS 仅 15.6 至 34.9,表明现有模型多模态能力严重不足。
Procedura:基于程序化控制的智能体 3D 建模
arXiv 论文提出 Procedura,一个基于大语言模型的智能体 3D 建模框架,通过将形状表示为带类型约束的程序化装配(CSG),实现高精度、可编辑且具有部件分解的 3D 生成。在 P3D-Bench 和 MechBench-36 上,Procedura 超越了原生 3D 生成器和先前的 3D 代码智能体,无需 3D 训练即可从文本提示生成精细的多部件形状。
GeoRA:为RLVR设计的几何感知低秩适配,获ACL 2026杰出论文
美团履约技术团队与北京大学联合提出了GeoRA,一种专为RLVR设计的低秩适配方法,通过谱先验和欧氏先验定位RLVR偏好的稀疏更新区域,再用SVD压缩为低秩适配器。实验表明,GeoRA在1.5B到32B的Qwen和Llama模型上,于数学、医学、代码等RLVR任务中稳定优于LoRA、PiSSA等基线,且训练参数降低99.5%,显存降低28.5%。该工作被ACL 2026接收为杰出论文,并已在美团AI骑手招聘场景中落地,效果与全参训练相当,相比LoRA提升约12%。
PACE:因子引导的长视频证据获取框架
香港科技大学团队提出PACE框架,用于长视频问答中的证据获取。PACE采用两阶段方法:先基于问题因子索引片段描述,再结合候选答案进行对比验证。在MMR-V基准上,PACE达到42.6%准确率,优于Deep Video Discovery等基线,并在多个长视频基准上表现一致。
NeuronFuzz:利用安全神经元引导模糊测试评估大语言模型安全性
NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移至开源和专有模型。
证据感知检索在RAG中的下游效用评估
本研究评估了RAG中证据感知检索评估的下游效用,发现其虽能改变检索排名,但在训练、系统选择及答案质量预测上并不稳定。人类注释确认过滤保留了证据,但不同评估器对答案质量改善结论不一,凸显了评估信号有效性的组合问题。
KVBoost:块级 KV 缓存复用与偏差引导重计算加速 LLM 推理
KVBoost 是一个面向 HuggingFace 兼容解码器模型的块级 KV 缓存复用系统,通过双哈希键控和偏差引导的重计算,解决了共享内容出现在提示任意位置时的缓存命中问题。在 Qwen2.5-3B 模型上,KVBoost 相比全量重计算实现了 4.49 倍的 TTFT 加速,比 vLLM 前缀缓存快 16%,且无质量损失。该系统支持 KV 量化、磁盘溢出缓存和自适应分块,可作为生产就绪的推理加速层。
等变细胞层用于分子电子结构:连接层上同调与E(3)等变哈密顿学习
本文提出了一种新的等变细胞层网络(ECSN),将分子电子结构哈密顿量建模为细胞层的拉普拉斯算子,并证明了其与E(3)等变哈密顿学习之间的联系。该方法通过层上同调提供了非键轨道的拓扑不变量,并在数值实验中验证了嵌入精度、等变性和旋转泛化能力。该工作统一了等变消息传递网络与拓扑深度学习,为电子结构预测提供了新的理论框架。
有限Newton-Schulz的平滑效应:Muon在非光滑非凸优化中的优势
本文研究了Muon优化器中有限Newton-Schulz迭代在非光滑非凸优化中的作用。作者通过在线到非凸转换分析,证明有限Newton-Schulz迭代将不连续的极分解映射平滑为Lipschitz映射,从而使得Muon能够收敛到驻点,而精确极分解更新可能无法收敛。该结果首次表明有限Newton-Schulz迭代是有益的而非近似误差,并扩展至一般谱映射。
临界深度平衡模型的响应重整化
本文提出了一种名为响应重整化(Response Renormalization)的框架,用于改善深度平衡模型(DEQ)的训练稳定性。该方法通过在后向传播中提升选定的近极点分母,同时保留未提升的响应通道,从而控制临界邻域内的伴随放大。实验表明,在23个多物理场系列中,使用该方法训练的模型在超过98%的静态和95%的瞬态比较中,测试误差与精确隐式微分训练的模型相差不超过5%。
重正化群流匹配:可扩展的局部生成建模
本文提出重正化群流匹配(RGFM)框架,利用重正化群流作为概率路径,从长波长到短波长逐步生成数据,实现局部生成建模。理论证明RGFM概率流可由局部速度场近似,计算成本随系统体积近线性增长。在FFHQ图像上,RGFM相比局部流匹配显著提升全局一致性和FID分数。
AIREP:AI 运行时治理中逐决策证据的协议
AIREP 协议提出了一种用于记录 AI 运行时治理决策的标准化格式,每个决策对应一个签名的 JSON 记录,包含决策动词、策略依据、输入输出哈希及证据引用。记录通过 SHA-256 哈希链实现防篡改和可验证性,并设计了中立性测试以保持供应商无关性。该协议旨在填补现有遥测、模型卡和治理框架在单决策证据记录方面的空白,支持审计、监管和部署场景。
SimGuide:程序化多上下文表示实现个性化代理规划
本文提出 SimGuide 方法,将用户上下文结构化为类型化、领域特定的 Sims 块,并用程序化示例进行约束,以解决个性化 AI 代理将用户视为单一实体而导致的冲突问题。作者构建了 SimBench 基准(47 个任务),实验表明程序化约束的 Sims 在 GPT-4o 上比 RAG 方法提升 7.9 个偏好遵循点,并在 Claude Sonnet 4.5 上得到验证。此外,基于 Sim 类型的 LoRA 微调比基于用户身份的适配额外提升 7.3 ROUGE-L 点,表明表示格式是首要设计变量。
追踪稀有书籍运输:终点是亚马逊 AI 训练设施
404 Media 通过在一批约1000本稀有书籍中放置苹果 AirTag 进行追踪,发现这批书最终被送往亚马逊位于拉斯维加斯的 LAS8 设施 VGT3 区域,该区域被证实会破坏性扫描大量书籍,用于 AI 训练。此前已有猜测称匿名买家大量购书是为了 AI 训练数据,此次追踪提供了直接证据。
非洲AI心理健康聊天机器人:系统综述与文化适应性框架
该论文对2017至2025年间52项关于AI心理健康聊天机器人的实证研究进行了系统综述,发现这些工具在提升可及性和缓解焦虑抑郁方面具有潜力,但多数系统基于西方模型和英语设计,缺乏对非洲文化、语言和基础设施的适应性。作者提出了一个融合非洲文化价值观、多语言设计、移动优先优化和伦理保障的文化适应性数字心理健康(CADMH)框架,为非洲医疗保健中的AI聊天机器人整合提供指导。
面向大规模供应链的可靠LLM决策引擎:架构、安全与性能保证
本文提出了一种名为LLM-DE的混合架构,将大语言模型与数学优化、概率预测和安全约束决策过滤相结合,用于大规模供应链运营中的需求预测、库存优化、运输路线规划和中断缓解。该架构通过安全过滤模块确保决策符合预定的安全与合规水平,旨在弥合AI推理与运筹学系统之间的差距,提供更智能、更安全且可扩展的供应链决策。研究为下一代智能供应链基础设施提供了实用的理论和算法基础。
产品发布
PRODUCT RELEASE64 篇OpenAI 发布自研推理芯片 Jalapeño,性能超越 Blackwell
在 Hot Chips 37 大会上,OpenAI 发布了自研推理芯片 Jalapeño,宣称其能效和延迟优于 NVIDIA GB200/GB300,实测每瓦性能提升 1.5-1.9 倍,端到端延迟降低 1.7-3.6 倍,并计划年底部署。此外,多个研究强调 agent 的 harness 质量和记忆系统设计对性能影响重大,而 Perplexity 推出了本地化产品 Portable Computer。
llama.cpp b10707 发布:优化 kv-cells 扫描提升长上下文生成速度
llama.cpp 发布 b10707 版本,优化了 kv-cells 的序列扫描逻辑,在保持行为不变的前提下提前终止扫描。该优化显著提升了长上下文下的生成速度,例如在 RTX PRO 6000 上 55k 上下文从 56.3 t/s 提升至 74.3 t/s,132k 上下文从 33.6 t/s 提升至 50.9 t/s。
llama.cpp b10715 发布:融合 DFlash 编码器提升性能
llama.cpp 发布 b10715 版本,主要更新是将 DFlash 编码器融合到 KV 缓存注入解码中,避免了设备到主机的数据传输和额外的图构建,提升了性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种二进制文件。
Agno v3.0.3:知识库按页摄入与工具集更新
Agno 发布 v3.0.3,为知识库引入按页网站摄入和按文件文件夹摄入,每页/每文件独立行,支持摘要驱动刷新、失败隔离和级联删除。新增 SitemapReader 和 PageFetcher 以改进 URL 抓取,PDF 条目可引用,并提供 KnowledgeManagementTools 和 AgentOS 知识路由。修复了多页 URL 删除时向量残留、截断读取误删页面等问题,并新增两个 cookbook 示例。
llama.cpp b10718 发布:CUDA MoE 融合扩展至多 token
llama.cpp 发布 b10718 版本,主要更新是将 CUDA 上的 MoE 融合扩展到 specdec 场景,此前 MOE glu 融合和 topk-router 融合仅限于单 token,现在支持多 token,并新增 SWIGLU_CLAMP 案例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件。
Agno v3.0.2 发布:新增集成与 MCP 改进
Agno 发布 v3.0.2 版本,包含多项行为变更、新集成和改进。行为变更包括运行元数据优先级调整、MCPConfig 拒绝未知字段、推理检测改为询问提供商等。新集成支持 Synthorai 模型提供商、WaveSpeed 图像视频生成、Serply 搜索工具包和 AtomicMail 邮件工具包。改进包括将 Agent/Team/Workflow 作为 MCP 工具发布、工具包作为 MCP 工具、MCP 工具标题和注释支持等。
Langfuse v4.25.0 发布:增强评估与 CSV 解析
Langfuse 发布 v4.25.0 版本,包含多项新功能、修复和重构。新功能包括定义标准化的 I/O 契约、增强 CSV 解析错误处理、改进 ClickHouse 查询 AST、持久化会话头部可见性、MCP 评估器输出定义、按数据集名称过滤评估样本等。修复涉及 API 历史数据访问限制、OTel 属性路径重建、UI 问题等。此外,还进行了多项代码重构和文档更新。
Xinference v3.3.0 发布:新增多模型支持与路由功能
Xinference 发布 v3.3.0 版本,新增了对多个模型的支持,包括 Qwen3.8、DeepSeek V4 Flash、GLM-Image、Kimi-K3 等,并引入了 token 感知的虚拟模型路由、Anthropic Messages 协议适配器、世界模型生成等新功能。此外,该版本还增强了音频、图像、视频等多模态能力,并修复了若干 bug。
Open WebUI v0.11.2 发布:性能优化与安全修复
Open WebUI 发布 v0.11.2 版本,新增终端文件更丰富的预览、减少消息处理开销、优化模型列表刷新和 WebSocket 性能,并引入新的请求过滤步骤。同时修复了聊天中断问题,并包含安全与访问控制修复,建议生产环境及时更新。
Anthropic 发布 MHS 标准,统一 AI 控制物理硬件接口
Anthropic 推出了 Model Hardware Standard (MHS),旨在为 AI 代理提供统一接口以控制和读取物理设备,如实验室和工厂中的显微镜和机械臂。该标准基于 MCP 扩展,可将设备集成时间从数周缩短至数小时。早期测试显示,Claude 能自主优化工作流程并生成无需语言模型运行的脚本,但在物理因果理解上仍有局限,需要人工监督。
Google AI Mode 新增航班价格追踪、积分兑换和酒店预订功能
Google 在 AI Mode 中推出三项旅行规划新功能:航班价格追踪、积分/里程兑换查询以及酒店预订。用户可在对话中设置价格提醒,查看合作伙伴的积分兑换信息,并通过 Google Pay 完成酒店预订。这些功能已在全球或美国逐步上线,支持多家航空公司、酒店集团和预订平台。
LiteLLM v1.100.0-rc.1 发布:镜像签名验证与多项修复
LiteLLM 发布 v1.100.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和功能更新,包括 Anthropic 消息处理、复杂性路由器、提示缓存节省报告、模型注册表更新、代理搜索工具、MCP 工具集强制、以及多个测试和 UI 改进。
FunASR v1.4.9 发布:修复多项问题并捆绑 llama.cpp 运行时
阿里 FunASR 发布 v1.4.9 版本,主要修复了字幕分割、自动模型、Paraformer 时间戳预测器及实时长尾保留等问题,并新增了 MOSS 说话人日志的 SGLang 路径文档。该版本还捆绑了 llama.cpp/GGUF 运行时 v0.2.6,提供多平台预编译二进制文件,支持 Linux、macOS 和 Windows 的多种硬件加速选项。
llama.cpp b10693 发布:支持 Hexagon 设备发现与按需会话
llama.cpp 发布 b10693 版本,主要新增对 Hexagon 设备发现和按需创建会话的支持,包括运行时发现可用 NPU 核心、延迟会话分配及清理设备接口,并提前拒绝不存在的设备。该版本同时提供多平台预编译二进制文件,涵盖 macOS、Linux、Windows、Android 等。
vLLM v0.28.0 发布:Kimi-K3 与 DeepSeek V4 性能优化
vLLM 发布 v0.28.0 版本,包含 584 个提交,重点优化了 Kimi-K3 和 DeepSeek V4 的性能,支持稀疏 MLA、DCP、FlashKDA 等特性,并改进了推测解码和模型运行器。该版本还引入了新的默认配置、破坏性变更,并扩展了模型支持,如 Muse Glimmer、Ling 3.0 Flash 等。
NVIDIA Dynamo 影子引擎恢复:秒级恢复 LLM 推理容量
NVIDIA Dynamo 推出影子引擎恢复预览功能,通过 GPU 内存服务(GMS)在活动引擎旁保持一个完全初始化的空闲引擎,并共享权重,避免冷重启。在 GLM-5.2 双工作节点部署中,故障恢复时间从 283 秒降至 7.3 秒,提速约 39 倍。该功能解决了权重与进程绑定及初始化状态不可转移的问题,支持 vLLM、SGLang 和 TensorRT-LLM 集成。
llama.cpp b10684 发布:改进 SYCL 显存适配算法
llama.cpp 发布 b10684 版本,改进了 SYCL 后端中 --fit 算法对 --fit-target 的遵循,更准确地计算给定上下文大小所需的峰值显存,避免 OOM 并减少过度保留。在 Arc b70 上测试,使用 unsloth 的 qwen3.8(Q4_K_XL)模型,配合 q8_0 KV 和 MTP,在 --fit-target 1 下可实现 262144 上下文完全可用。
llama.cpp b10696 发布:为 M3 Pro 添加 fa-vec 调优
llama.cpp 发布 b10696 版本,主要更新是为 Apple M3 Pro 芯片添加 fa-vec 调优,以解决相关性能问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
EdgeFirst 发布 Model Zoo,提供真实硬件上的 YOLO 模型性能基准
EdgeFirst 发布了 Model Zoo,提供在真实硬件上测量并公开验证的 YOLO 模型性能数据,覆盖多种 NPU 和平台。所有测量结果均可复现,并附有详细的验证会话链接。该资源旨在帮助开发者基于可验证的数据选择边缘 AI 加速器,而非依赖厂商宣称的 TOPS 值。
llama.cpp b10688 发布:为 M2 添加 fa-vec 调优
llama.cpp 发布 b10688 版本,主要更新是为 Apple M2 芯片添加了 fa-vec 调优(PR #27940),以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Anthropic 发布模型硬件标准预览,加速 AI 驱动实验室自动化
Anthropic 与 HHMI Janelia 研究园区合作,发布了模型硬件标准(MHS)的研究预览版,旨在让 AI 代理安全操作物理设备。MHS 通过标准化驱动和自然语言标签,将设备集成时间从数周缩短至数分钟,并支持多设备并行操作。该标准已提供给首批科研实验室和制造商,未来将开源。
Salesforce 利用 SageMaker 推理组件实现多可用区高可用
Salesforce 在构建 Agentforce 时,面临 Amazon SageMaker AI 推理组件(IC)默认放置策略无法满足多可用区(Multi-AZ)高可用合规要求的问题。AWS 通过新增 SchedulingConfig 参数(含 AvailabilityZoneBalance 和 PlacementStrategy)实现了 IC 副本跨 AZ 和实例的精细放置控制。Salesforce 采用 SPREAD 策略优先故障隔离,实现了 8 倍基础设施成本降低,同时满足 2-AZ 合规要求。
NVIDIA 发布 NVLink Fusion 与 NVHBM,提升定制 AI 基础设施性能
NVIDIA 发布了 NVLink Fusion 和 NVHBM 技术,旨在帮助超大规模企业和 AI 原生公司将其定制 XPU 和 CPU 集成到 NVIDIA AI 基础设施中。NVHBM 是定制 HBM 基底芯片技术,相比标准 HBM4e 可提供高达 30% 的带宽提升、25% 的计算芯片面积增加和 15% 的功耗降低。该技术通过减少内存接口面积和优化功耗,支持更大模型和更复杂的推理工作负载,并加速定制 AI 工厂的上市时间。
NVIDIA 发布 CUDA Python 1.0:稳定 API 与统一平台访问
NVIDIA 发布 CUDA Python 1.0,提供从 Python 访问完整 CUDA 平台的官方支持,包括 cuda.core、cuda.compute、cuda.bindings 等组件。该版本引入语义化版本控制,确保 API 稳定性,并统一了 Python GPU 生态的基础层,使不同库(如 Numba、cuda.compute)能在同一 GPU 缓冲区和流上协作。此举使 Python 成为与 C++ 同等的 CUDA 一等公民,降低了开发者使用高级平台功能(如绿色上下文)的门槛。
Amazon SageMaker Feature Store 推出批量写入与记录发现新 API
AWS 宣布为 Amazon SageMaker Feature Store 推出两个新 API:BatchWriteRecord 和 ListRecords。BatchWriteRecord 允许在单个 API 调用中跨多个特征组写入最多 25 条记录,支持部分成功语义和 TTL 控制,解决了高吞吐量管道中逐条调用 PutRecord 的性能瓶颈。ListRecords 支持分页枚举在线存储中的记录标识符,适用于 Standard 和 In-Memory 存储层,解决了记录丢失后无法恢复的问题。这些 API 旨在提升 ML 特征管理的效率和可操作性。
AWS 发布 Claude 应用网关企业部署参考架构
AWS 发布了一篇关于部署 Anthropic Claude 应用网关(Claude apps gateway)的博客,该网关为 Claude Code 和 Claude Desktop 提供集中治理层,支持身份验证、模型访问控制、成本归属和支出限制。参考部署使用 AWS Fargate、RDS PostgreSQL、内部负载均衡器和 OIDC 身份提供商,确保企业级安全性和可扩展性。该网关解决了身份、策略、成本等治理需求,并支持与 Amazon Bedrock 或 Claude Platform 集成。
OpenCompass v0.5.4 发布:集成多模态评估与多轮推理
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安装兼容性。
Google ADK Python 2.8.0 发布:新增 A2A 任务模式与 Model Armor 防护
Google 发布了 ADK Python 2.8.0 版本,新增了 A2A 任务模式、Model Armor 防护插件、NVIDIA NIM 集成示例、数据代理工具集、BigQuery SQL 注入防护、自定义 LLM 客户端注入、Vertex AI API 版本配置、流式工具调度、实时模式视频支持、MCP 遥测、LLM 评估并行化、内存库支持、会话保留、子代理升级事件等多项功能。该版本还增强了遥测指标,包括 token 消耗和推理调用计数。
MCP Python SDK v2.1.0 发布:增强客户端与内容支持
MCP Python SDK 发布 v2.1.0 版本,主要更新包括:Client 可直接接受 StdioServerParameters 对象,提示消息支持图像和音频,并导出相关消息类。请求体大小限制扩展到 SSE 和 OAuth 端点。行为变更包括:处理程序异常不再向客户端暴露详细信息,而是记录日志并返回通用错误;内容块返回注解不再自动生成 outputSchema,除非显式指定 structured_output。修复了 TypedDict 工具结果、递归返回类型、HTTP 通知确认等问题。
Dify v1.17.0 发布:Agent 沙箱、技能管理、统一追踪等新特性
Dify 发布 v1.17.0 版本,新增多项功能:Agent 支持 E2B 云沙箱、构建时快照和工作区级技能管理;工作流中可复用 LLM 环境变量;循环和迭代节点支持人工输入;提供统一追踪、Cloudflare Turnstile 验证码、Azure Key Vault KMS、TiDB 混合搜索等。此外,改进了无障碍性、工作流稳定性和内部测试质量。
llama.cpp 0.3.0 发布:新增多模态模型与多项推理优化
llama.cpp 0.3.0 版本发布,新增 dots3-note 多模态模型及 DSA-ISWA KV 缓存,支持 GLM-4.5-Air 的 MTP 预测,并为 DeepSeek 4 添加张量分割模式和多序列回滚修复。ggml 升级至 v0.22.0,服务器新增调试参数,Web UI 支持标签页聊天导航。
Transformers v5.16.0 发布,新增 Qwen4-Exp 等模型支持
Hugging Face Transformers 库发布 v5.16.0,新增多个模型支持,包括 Qwen4-Exp、GraniteSpeech5、Step3p7、CohereCompass 以及 ESMC 和 ESMFold2。这些模型覆盖了混合架构、语音识别、视觉语言、蛋白质语言与折叠等领域,提升了 Transformers 对前沿模型的支持能力。
DeepSpeed v0.19.6 补丁发布:修复与 Apple Silicon 支持
DeepSpeed 发布了 v0.19.6 补丁版本,包含多项修复和功能改进,如修复 Ulysses 序列并行中的检查点选择、ZeRO-3 冻结参数问题,并新增对 Apple Silicon (MPS) 的支持(包括 Metal FusedAdam 内核)。此外,还实现了可配置的梯度求和归约、原生主机内存固定后端,以及 AutoTP 的不均匀分片和通用检查点支持。这些更新提升了 DeepSpeed 在多种硬件和场景下的稳定性和性能。
llama.cpp b10672 发布:OpenVINO 更新与 NPU 支持增强
llama.cpp 发布 b10672 版本,主要更新 OpenVINO 后端至 2026.3.1,新增对 whisper.cpp 的支持,并优化 Qwen3.5 在 NPU 上的运行。该版本还引入了新的算子支持(如 RELU、POOL_2D 等),并修复了静态形状和分块预填充等问题。
Mastra 发布更新:新增文件代理调度、Oracle 存储及 QuickJS 传输
Mastra 发布 2025 年 8 月 12 日更新,为基于文件的代理新增 schedules 目录以声明周期性任务,并推出 @mastra/oracledb 存储提供程序、QuickJS 进程内代码模式传输、动态工作流构建器 API 及自定义 createRoute() 路由。同时包含多项破坏性变更,如存储工作流更名为动态工作流,频道代理回复默认以 markdown 发布。
NVIDIA TensorRT Model Connect:两命令部署开放模型
NVIDIA 发布了 TensorRT Model Connect,这是一个开源参考实现集合,旨在简化开放模型在 TensorRT 上的部署。用户可以通过两条命令将 Hugging Face 模型转换为原生 C++ 推理应用,无需深入编译器知识。该项目提供语义级和模块级 API,支持自定义 GPU 内核集成,并利用 AI 原生开发流程和夜间发布保持与开放模型生态同步。
Amazon Bedrock AgentCore Evaluations 实现跨框架代理评估
AWS 发布了 Amazon Bedrock AgentCore Evaluations,该服务通过 OpenTelemetry 标准解耦了代理评估与具体框架,支持 LangGraph、LlamaIndex、OpenAI Agents SDK 等多种框架。它自动读取调用代理、推理和工具执行三类 span,并利用 LLM-as-a-judge 进行统一评分,无需修改代理代码。此举解决了评估工具碎片化问题,提升了生产环境中代理评估的兼容性和效率。
Amazon OpenSearch Service MCP Apps 实现 IDE 内可观测性验证
AWS 发布了 Amazon OpenSearch Service MCP Apps,该功能扩展了 Model Context Protocol,使 AI 代理的工具调用能返回交互式可视化结果(如追踪瀑布图、服务拓扑图),直接在 IDE 聊天窗口中渲染。这解决了可观测性代理验证环节需要切换浏览器、手动核对的问题,让工程师在对话线程内完成验证。MCP Apps 由本地 MCP 服务器、IDE 和 OpenSearch UI 应用协同工作,数据保留在用户 AWS 账户中,确保控制权和安全性。
AWS 在 SageMaker HyperPod 上推出新的 Ray 集成能力
AWS 宣布在 SageMaker HyperPod 上推出新的 Ray 集成能力,使数据科学家能够通过 SageMaker Studio 直接创建和管理 Ray 集群,无需编写 Kubernetes 清单或使用 kubectl。该集成支持远程作业提交、交互式开发环境(JupyterLab/Code Editor)、自动故障恢复、分层检查点以及通过 SageMaker JumpStart 加载模型权重到 Ray Serve 端点。这些功能基于开源 KubeRay 和标准 Ray API,现有脚本无需修改即可运行。
FunASR v1.4.7 发布:修复 SenseVoice 解码并新增 MOSS 适配
阿里 FunASR 发布 v1.4.7 版本,主要修复了 SenseVoice 模型在 llama.cpp 运行时中的解码问题,并新增了可选的实时解码性能分析功能。同时,该版本为 MOSS 说话人日志模型添加了 AutoModel 运行时适配器,并发布了配套的 llama.cpp v0.2.5 运行时下载。
Deepgram 增强 SageMaker AI 可观测性,推出计费与引擎级指标
Deepgram 宣布在 Amazon SageMaker AI 上推出两项新的可观测性功能:Deepgram Enhanced Metrics 和 Prometheus/OpenTelemetry 支持。前者通过 CloudWatch Embedded Metric Format 将计费和用量指标直接发布到用户的 CloudWatch 账户,无需额外代理或权限;后者提供引擎级和每 GPU 的指标。这些功能帮助用户在 AWS Marketplace 网络隔离环境下实现计费对账和容量规划,同时保持数据驻留和合规性。
Mastra 发布新存储后端、沙箱增强及多项破坏性变更
Mastra 发布 2026 年 8 月 26 日更新,新增 Elasticsearch 和 Valkey 存储后端,以及 E2B Desktop 计算机使用沙箱提供商。沙箱现在支持运行时环境控制和更安全的关闭行为,同时改进了可观测性、评分和流式会话体验。此版本包含多项破坏性变更,如 LSP 默认关闭和部分 API 调整。
LangChain 发布 1.4.0a2,推出 MCP 适配器集成
LangChain 发布了 langchain 1.4.0a2 的 alpha 预览版,引入了第一方适配器 langchain.mcp,可将任何 MCP 服务器转换为 LangChain 工具,直接用于 create_agent。该适配器支持多种传输方式,提供结构化输出、错误处理以及可选的 elicitation 中断机制,允许服务器在调用中向人类提问。此版本为 alpha 版本,API 可能在正式版前调整。
llama.cpp b10311 修复 Qwen3-TTS 重复文本问题
llama.cpp 发布 b10311 版本,修复了 Qwen3-TTS 生成时文本流重复输入的问题。该问题源于非流式预填充与流式覆盖层不匹配,导致模型在生成时重复读取文本。修复后,覆盖层改为与预填充匹配的单个 tts_pad 行。
AWS 推出 AI 驱动的元数据修正与协调工作流
AWS 机器学习博客介绍了一种基于 AI 的元数据修正与协调工作流,该工作流利用 Amazon Bedrock 上的大语言模型进行模式对齐和修正建议,结合 S3、DynamoDB、Cognito 和 ECS 构建。系统通过人工参与验证和自主代理驱动两种方式,支持模式对齐、字段验证和修正建议,旨在自动化元数据管理,提升数据互操作性和开放科学支持。
LLM 0.32 发布:支持推理轨迹、OpenAI Responses 与服务端工具
Simon Willison 发布了 LLM 0.32,这是该项目自启动以来最重要的版本,新增了对推理轨迹、OpenAI Responses API、服务端工具和内容寻址日志的支持。该版本还引入了新的模型(如 GPT-5.6 系列)和 Python API 改进,包括流式事件和消息列表参数。同时,llm-anthropic 等插件也获得了重大更新,增加了 WebSearch、CodeExecution 和 AnthropicMCP 等工具。
AWS 推出 Bedrock AgentCore 浏览器工具,自动化遗留 Web 应用
AWS 推出了 Amazon Bedrock AgentCore Browser Tool,结合 Strands Agents,提供全托管的云浏览器服务,使 AI 代理能够通过安全隔离的会话自动化操作遗留 Web 应用。该工具通过 Playwright 和 WebSocket 的 CDP 连接,支持任何基于 HTTP/HTTPS 的遗留系统,解决了传统 RPA 在复杂界面、合规审计和可扩展性方面的不足。文章提供了参考架构和 Terraform 部署蓝图,帮助企业实现遗留系统工作流的现代化。
Flue 2 引入 React 风格 Hooks,重新定义代理开发
Flue 2 由 Astro 创建者 Fred Schott 发布,引入了受 React 启发的 Agent Hooks,使代理能够动态管理状态、监听生命周期事件并附加资源。Schott 认为代理必须依赖 harness 环境,Flue 基于开源 Pi 构建,旨在提供比传统 web 框架更灵活的代理组合方式。该框架已用于构建支持机器人和分诊机器人,并强调与 Claude Code 等编码代理的集成。
llama.cpp b10328 发布:新增 Docker 工具隔离支持
llama.cpp 发布 b10328 版本,主要新增了基于 Docker 的初始工具隔离支持,用于在服务器环境中隔离工具执行。该版本还提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制包,并更新了相关文档。
llama.cpp b10410 发布:SYCL 后端 FP16 自动提升优化
llama.cpp 发布 b10410 版本,主要更新为在 SYCL 后端的非 oneDNN 路径中移除单独的 FP32 类型提升,改用自动 FP16 提升。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 等。
Agno v2.8.7 发布:新增 AdvisorTools 与多项修复
Agno 发布了 v2.8.7 版本,新增了 AdvisorTools、OpenRouteService 工具包、组件感知的调度工具和文件系统工具包名称覆盖功能。同时修复了多个 bug,包括 Cohere 采样参数、持久化组件工具再水化、SQLite 崩溃和音频工具结果处理等问题。该版本还排除了有问题的 nltk 3.10.1 依赖。
llama.cpp b10275 发布:修复 Windows OEM 输出解码问题
llama.cpp 发布 b10275 版本,主要修复了内置工具中 Windows OEM 输出解码为 UTF-8 的问题,确保子进程输出在 JSON 层正确显示,避免字符丢失。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
llama.cpp b10223 发布:修复 CI 错误并更新多平台构建
llama.cpp 发布 b10223 版本,主要修复了部分 CI 错误。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
LangChain 发布 langchain-core 1.6.0 版本
LangChain 发布了 langchain-core 1.6.0 版本,包含多项修复和功能改进。主要更新包括新增标准模型异常类型、优化工具模式序列化、延迟导入 transformers 以提升性能,以及修复多个与工具注入参数、RunnablePick 反序列化和模板处理相关的问题。
Semantic Kernel .NET 1.80.0 发布:更新 OpenAPI 与 Gemini 支持
Semantic Kernel 发布了 .NET 1.80.0 版本,主要更新包括更新 OpenAPI HTTP 客户端默认设置、在 Gemini 连接器中支持 FunctionChoiceBehavior 函数列表、移除已迁移的 .NET MEVD 提供程序并添加重定向 README,以及升级 Testcontainers 和 CommunityToolkit.VectorData.InMemory 等依赖包。
Vercel AI SDK 6.0.260 发布:修复流式对象与工具执行问题
Vercel AI SDK 发布 6.0.260 版本,包含多项修复:拒绝 streamObject 结果承诺并在提供者流错误时报告失败完成;启用 ignoreIncompleteToolCalls 时过滤初步工具输出;当模型调用以不安全的结束原因结束时,阻止自动工具执行。
Vercel AI SDK 5.0.241 发布:修复流对象与工具执行问题
Vercel AI SDK 发布 5.0.241 版本,包含三项修复:拒绝 streamObject 结果承诺并在提供者流错误时报告失败完成;启用 ignoreIncompleteToolCalls 时过滤初步工具输出;当模型调用以不安全完成原因结束时阻止自动工具执行。这些修复增强了 SDK 的稳定性和安全性。
Vercel AI SDK 发布 ai@6.0.252 补丁更新
Vercel AI SDK 发布 ai@6.0.252 版本,主要包含两个补丁更新:允许不支持重排序模型的提供商满足 Provider 类型要求,以及将 Chat onFinish 回调中抛出的错误传播到发起请求。同时更新了 @ai-sdk/gateway 依赖至 3.0.171。
Vercel AI SDK 7.0.63 发布:修复推理块 ID 并增强 Provider 兼容性
Vercel AI SDK 发布 7.0.63 版本,主要修复了 UI 消息流中推理块的 ID 保留问题,并允许不支持重排序模型的提供商分配给 Provider。同时更新了 @ai-sdk/gateway 依赖至 4.0.50。
AI 约会应用 Ditto 获 920 万美元融资,用聊天匹配取代滑动
Ditto 是一款面向大学生的 AI 约会应用,由 UC Berkeley 辍学生 Allen Wang 和 Eric Liu 创立,通过 iMessage 聊天界面和 AI 匹配算法,每周三安排线下约会,旨在取代传统的滑动式约会应用。该应用已获得 15 万注册用户和 920 万美元种子资金,并计划在保障安全的前提下扩展到更多学校。
DeepBeepMeep 发布 WanGP:低显存开源视频生成工具
DeepBeepMeep 发布了 WanGP,一个开源视频生成工具,支持 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV Video 等模型,最低仅需 6GB 显存,兼容旧 GPU,并提供 Web 界面、Lora 支持、队列系统等功能。该工具旨在让低配置用户也能使用先进的视频生成模型。
Anthropic 报告 Claude Opus 5 与 Sonnet 5 性能降级
Anthropic 报告 Claude Opus 5 和 Claude Sonnet 5 出现性能降级问题,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前 Opus 5 已恢复运行,Sonnet 5 仍处于降级状态,团队正在调查并实施修复。
阿维塔07L上市,搭载华为乾崑智驾ADS 5
阿维塔07L正式上市,推出三个版型,限时权益价21.99万-26.99万元。该车首批搭载华为乾崑智驾ADS 5,配备896线激光雷达和WEWA 2.0架构,辅助驾驶里程超137亿公里。新车旨在以智能化和设计美学重塑20-30万级纯电SUV市场,推动辅助驾驶普及。
2027款艾瑞泽8 PRO上市,8.99万元起主打油电同智
奇瑞汽车于2026年8月10日在鄂尔多斯发布2027款艾瑞泽8 PRO,售价8.99万元起,主打赛级性能、油电同智和全球安全。新车搭载高通骁龙8255芯片和高速NOA等智能功能,并提供1.6T和2.0T动力选项。该车型旨在重塑燃油家轿价值标杆,推动燃油车智能化升级。
模型发布
MODEL RELEASE17 篇GLM-5.3-Flash NVFP4 量化版发布:体积缩减70%
LibertAI 发布了 GLM-5.3-Flash 的 NVFP4 量化版本,将模型从 598.5 GiB 压缩至 181 GiB,体积减少 70%,余弦相似度达 0.99665。该量化仅针对路由专家 FFN,保留注意力、视觉塔等关键部分为 BF16,确保多模态行为与原始模型一致。模型支持 vLLM 和 SGLang,但需要特定配置,且已修复 GB10 上的兼容性问题。
NaviDC-OCR:轻量级文档解析模型,统一数字与拍摄文档
StarDoc-AI 发布了 NaviDC-OCR,一个约 1.2B 参数的开源视觉语言模型,专为文档解析设计,统一处理数字和相机拍摄文档。该模型引入了多节点共识投票、几何感知建模、曲率引导采样等技术,在 OmniDocBench 和 Wild_OmniDocBench 基准上达到最先进性能,且无需去畸变预处理。模型采用 Apache-2.0 许可证,支持中英日文。
Ornith-1.5-35B-A3B Abliterated 多量化等级 GGUF 发布
gbuzhf 发布了 Ornith-1.5-35B-A3B 模型的 abliterated 版本,并提供了九个不同量化等级的 GGUF 文件,每个都嵌入了 MTP 头。测量显示 abliteration 对模型的影响(KLD 0.0151)小于 Q6_K 量化(KLD 0.0222),且 abliteration 与量化损伤近似正交,不会使模型恢复拒绝行为。
Nemotron 3.5古兰经双头ASR模型v5
该模型基于NVIDIA Nemotron 3.5流式ASR(0.6B)微调,用于全古兰经诵读识别,支持Uthmani脚本及泰吉威德符号,并增加音素头用于错误检测。最佳检查点(step 78000)在留出集上达到CER 2.76%、WER 4.43%、变音符号F1 98.27%。训练数据包含179,376个片段(约868小时),模型参数全部可训练。
Inco AI 发布 DFlash 2 草稿模型,加速 GLM-5.3-Flash 投机解码
Inco AI 发布了 DFlash 2 草稿模型,用于 GLM-5.3-Flash 的投机解码。该模型采用块扩散技术,单次预测整个 token 块,并通过轻量选择器保持解码无损。用户可通过 SGLang 集成使用,模型以 CC BY-NC-ND 4.0 许可发布,仅限研究用途。
Transformers v5.16.1 发布,支持 GLM-5.3-Flash 多模态模型
Hugging Face 发布 Transformers 库 v5.16.1,重点支持 GLM-5.3-Flash 模型。该模型是 GLM-5 系列首个原生多模态模型,拥有 320B 总参数和 18B 激活参数,性能超越 GLM-5.2,价格仅为十分之一,在编码和智能体基准上接近 Claude Opus 4.8。此外,该版本还包含若干小修复,如恢复张量并行 API 的向后兼容性,并固定 ESMFold2 的内核版本以增强安全性。
RadixArk 发布 Qwen3.8-27B-DSpark 投机解码草稿模型
RadixArk 发布了 Qwen3.8-27B-DSpark,这是一个为 Qwen3.8-27B 目标模型设计的投机解码草稿模型,使用 SpecForge 训练并由 SGLang 提供服务。该模型在 17 个工作负载上平均接受长度提升 26.45%,吞吐量最高提升 3.16 倍,相比 EAGLE 和自回归基线有显著性能提升。
Whittle MoE 27B:从 Qwen3.8 切分出的路由器修复型混合专家模型
Hugging Face 上发布了新模型 logic65/Qwen3.8-Whittle-MoE-27B-A17.8B,这是一个从 Qwen3.8-27B 中通过后验方式切分出的混合专家模型,总参数 27B,激活参数 17.8B。该模型通过仅训练路由器(冻结专家)恢复了性能,并新增了停止信号以解决推理中止问题。v2.2.1 修复了推理中止缺陷,但 GGUF 文件尚未更新。模型为研究预览版,计算预算已耗尽,依赖捐赠支持。
Qwen3.8-27B 推出 16GB VRAM 优化 GGUF 量化版
Hugging Face 用户 tooltd 发布了 Qwen3.8-27B 的 GGUF 量化版本,针对 16GB VRAM 优化,采用自定义混合精度量化方法 ZB-ZipBrain,结合重要性矩阵校准和率失真边际成本,自动寻找帕累托最优的比特分配。该模型在 16GB 显卡上约 4 BPW,12GB 显卡上约 3 BPW,并通过基准测试对比了多种量化方法的困惑度和 KL 散度,声称在低比特下保持较好质量。
Qwen3.8-Flash-Next在NVIDIA GB300 NVL72上支持代理编码
阿里巴巴发布了Qwen3.8-Flash-Next模型权重,作为Qwen4架构的预览,供开发者实验和评估。该模型是一个多模态MoE模型,主模型125B参数,附加51B N-gram嵌入,每token激活6B参数,原生上下文窗口262,144 token,可通过YaRN扩展到1M。NVIDIA提供了Day 0功能支持,包括SGLang、vLLM和TensorRT LLM,并在GB300 NVL72上验证推理性能,同时提供NeMo AutoModel和NeMo RL的微调与强化学习配方。该模型专为高容量、上下文密集型应用设计,如代理编码、文档处理和工具驱动工作流,其混合架构结合了Gated DeltaNet和Qwen Sparse Attention,以解决长上下文下的注意力计算和KV缓存瓶颈。在GB300 NVL72上,模型实现了每GPU每秒超过16K tokens的吞吐量,每用户每秒超过200 tokens,支持高吞吐低延迟的代理编码应用。
NVIDIA发布Cosmos3全模态世界模型系列
NVIDIA发布了Cosmos3系列全模态世界模型,包括Cosmos3-Edge、Nano、Super等多个版本,支持从文本、图像、视频和动作轨迹生成视频、图像、音频和动作输出,用于机器人、自动驾驶和智能空间等物理AI应用。该系列基于Mixture-of-Transformers架构,参数规模从4B到64B不等,并采用OpenMDW1.1许可证,可商用。
NVIDIA 发布 Nemotron-3-Super 120B 混合架构大模型
NVIDIA 发布了 Nemotron-3-Super-120B-A12B-FP8 大型语言模型,采用 LatentMoE 混合架构,总参数 120B,激活参数 12B,支持最长 1M token 的上下文,并内置多 token 预测(MTP)以加速生成。该模型针对智能体工作流、长上下文推理和高吞吐量场景(如 IT 工单自动化)进行了优化,支持多种语言,并采用 NVIDIA 开放模型许可。模型已可在 Hugging Face 上下载,并提供了技术报告和预训练/后训练数据集。
RedHatAI 发布 Qwen3.8-27B-NVFP4 量化模型
RedHatAI 发布了 Qwen3.8-27B-NVFP4,这是对 Qwen/Qwen3.8-27B 的混合精度量化版本,采用 FP4/FP8 方案,MLP 投影量化为 FP4,注意力投影和最终 MLP 层量化为 FP8,KV 缓存量化为 FP8,语言模型头保持全精度。该模型使用 LLM Compressor 结合 AWQ 与 GPTQ 在 perfectblend 数据集 512 样本上校准,检查点约 24.7 GB,相比 BF16 的约 54 GB 减少约 70% 的磁盘和显存需求。在 GSM8K Platinum、MATH-500、AIME 2025、GPQA Diamond、IFEval 和 SWE Bench 上评估,精度恢复率接近或超过 BF16 基线。
IBM 发布 Granite Speech 5.0 Turbo CTC:超快语音识别模型
IBM 发布 Granite Speech 5.0 Turbo CTC 系列,包含两个 470M 参数的英语语音识别模型,在 NVIDIA H200 GPU 上实现超过 12,600 RTFx 的吞吐量,可每秒转录超过 3.5 小时的语音。模型采用编码器-only 设计,相比前代速度提升 20 倍以上,适合边缘设备使用。非商业版本(CC-BY-NC-SA-4.0)在 OpenASR 上 WER 为 4.85%,Apache 2.0 版本为 5.00%。
Qwen3.8-27B-heretic-dflash:非官方 5 层 DFlash 投机解码草稿模型
jfan 发布了非官方的 Qwen3.8-27B-heretic-dflash 模型,这是一个基于 DFlash 架构的 5 层投机解码草稿模型,专为目标模型 trohrbaugh/Qwen3.8-27B-heretic-ara 设计。该模型目前训练至 10k/60k 步,在 Apple M5 Pro 上实现了约 41.6% 的解码加速,支持 MLX、vLLM 和 SGLang 等推理框架。
Google 发布 GlucoFM:面向连续血糖监测的基础模型
Google Research 发布了 GlucoFM,一种用于连续血糖监测(CGM)数据的轻量级自监督基础模型。该模型采用双流设计,分别建模缓慢血糖趋势和短期偏差,在糖尿病风险、胰岛素抵抗等多项代谢预测任务中超越了现有模型(如 GluFormer),并在餐后血糖反应预测中取得最低平均绝对误差。模型在 109,066 小时的未标记 CGM 数据上预训练,展现出强大的跨数据集迁移和少样本适应能力。
LFM2.5 模型家族发布,支持 React Native ExecuTorch
Hugging Face 上发布了 LFM2.5 模型家族,专为 React Native ExecuTorch 库设计,提供量化后的 .pte 格式文件,可直接在 ExecuTorch 运行时使用。该模型基于 LiquidAI 的 LFM2.5-VL-1.6B,支持图像与文本输入。用户需确保运行时与导出 .pte 文件所用的 ExecuTorch 版本兼容。
开源项目
OPEN SOURCE2 篇three.ws 开源栈:为 AI 代理提供身体、大脑、钱包与工作
three.ws 是一个开源平台,为 AI 代理提供 3D 生成、动画、支付和分发能力。其代码以 Apache-2.0 协议在 GitHub 上开源,模型托管在 Hugging Face。平台通过多引擎路由实现免费优先的 3D 生成,并支持照片到虚拟形象、骨骼动画、x402 支付标准及 MCP 集成。该平台旨在将代理的“身体、大脑、钱包和分发”整合为单一产品。
condense-json 1.0 发布:压缩 JSON 重复字符串
Simon Willison 发布了 condense-json 1.0 版本,这是一个用于压缩 JSON 中重复字符串的库,通过替换对象将重复内容替换为特殊语法,并支持反向解压。该库已有一年半历史,此次更新包含一些非破坏性修复,主要用于节省 SQLite 日志存储空间,如 LLM 生成的日志。
API 与平台更新
API UPDATE3 篇OpenAI Node SDK v7.6.0 发布:新增混淆字段与安全增强
OpenAI 发布了 Node SDK v7.6.0,新增了 ChatCompletionChunk 的混淆字段、项目驻留和用量单位字段,并支持后端中介的 Realtime WebRTC 调用及命名数据驻留端点。同时,该版本强化了 X.509 工作负载令牌交换和租户隔离,并修复了多项安全漏洞,包括流式响应中的身份验证和事件流边界问题。
OpenAI Python SDK v3.4.0 发布:新增 API 字段并修复多项问题
OpenAI 发布了 Python SDK v3.4.0,新增了 ChatCompletionChunk 的混淆字段、项目驻留配置和成本数量单位等 API 功能,并修复了多个 Azure 认证、WebSocket 重定向和 SSE 解码等问题。该版本还改进了文档和代码结构,提升了 SDK 的稳定性和安全性。
OpenAI Java SDK v4.53.0 发布:新增数据驻留与 WebRTC 支持
OpenAI 发布了 Java SDK v4.53.0,新增了 ChatCompletionChunk 混淆、项目驻留和用量单位支持、后端中介的 Realtime WebRTC 调用、固定别名 X.509 传输能力以及命名数据驻留端点。同时修复了并发 JSON 反序列化失败和流 ID 保留等问题,并升级了多个依赖。
教程与实践
TUTORIAL3 篇AWS 展示 SageMaker AI 与 Bedrock AgentCore 构建多智能体工作流
AWS 展示了如何将 SageMaker AI 上的 OpenAI 兼容端点与 Bedrock AgentCore 运行时结合,构建多智能体工作流。该架构通过 Bedrock AgentCore 容器连接编排器(Claude Haiku 4.5)、预算智能体(Claude Sonnet 4.6)和财务分析智能体(Qwen 3.5 9B),实现成本优化、数据驻留和模型灵活性。文章重点介绍了集成机制,包括如何通过自定义 OpenTelemetry 跨度获取 SageMaker 端点的令牌级可观测性,以及 vLLM 流式响应中 stream_options 参数的必要性。
llama.cpp 支持多种小型 OCR 模型,可在低端设备运行
llama.cpp 现已支持多种小型 OCR 模型,可在低端设备(如 4GB VRAM 的 GPU 或 CPU)上运行。文章介绍了如何使用 llama-cli 和 llama-server 运行这些模型,并通过 REST API 集成到应用中。支持的模型包括 GLM-OCR、Deepseek-OCR 等,并提供了提示词格式、量化选择及减少幻觉的建议。
利用 Amazon Bedrock AgentCore 加速并购尽职调查
AWS 博客介绍了使用 Amazon Bedrock AgentCore 加速并购尽职调查的多智能体系统。该系统通过编排多个 AI 代理,自动完成数据收集、分析和合规检查,将原本需要数周的工作缩短至数小时。文章提供了两种实现路径:使用 Amazon Quick 集成方案或基于 AgentCore 的自定义架构,并强调了治理、可追溯性和知识积累的重要性。
行业与商业
BUSINESS5 篇谷歌Gemini市场份额下滑,ChatGPT和Claude持续增长
根据Pangram、OpenRouter和Similarweb的最新数据,谷歌的Gemini在AI市场份额上持续下滑,从12%降至1.9%,而OpenAI的ChatGPT保持50%以上份额,Anthropic的Claude从4.3%升至14.9%。Similarweb显示谷歌网站市场份额微降,但同比仍大幅增长。数据来源各有局限,但均指向Gemini使用率下降,这可能与谷歌DeepMind近期领导层变动有关。
英伟达投资15亿美元于软银数据中心项目,助力OpenAI设施
英伟达宣布向软银和OpenAI关联的数据中心开发商SB Energy投资15亿美元,并承诺提供高达1050亿美元的信贷支持,用于建设俄亥俄州辛辛那提附近的OpenAI Ports-Pike数据中心。该设施初期规模4.25吉瓦,可扩展至8吉瓦,英伟达将成为其唯一计算基础设施供应商。项目还包括一座92亿瓦的天然气发电厂,预计耗资330亿美元,但天然气价格可能因竞争而上涨。
英伟达缩减OpenAI数据中心担保,Anthropic营收激增
英伟达因投资者压力,将其对OpenAI数据中心项目的担保金额从原计划的2500亿美元削减至不到1200亿美元,该项目由软银旗下SB Energy开发,总容量10吉瓦。与此同时,Anthropic季度营收从Q1的47.3亿美元翻倍至Q2的115亿美元以上,同比增长14倍,并计划以近1万亿美元估值上市。这些数据对AI泡沫论构成挑战。
Flock CEO呼吁隐私与安全妥协,回应监控技术滥用争议
Flock Safety CEO Garrett Langley在福克斯新闻采访中呼吁在隐私和安全之间寻求“妥协”,以应对公司因监控摄像头、无人机和车牌识别技术可能被滥用而面临的公众强烈反对。《华盛顿邮报》报道了46起警察滥用Flock技术的案例,包括跟踪配偶。Flock已采取缩短数据保留时间等措施,但ACLU等组织对其效果表示怀疑。
吉他公司 D'Addario 承认促销视频使用 AI 音乐
乐器公司 D'Addario 在否认数周后,承认其促销视频中使用了 AI 音乐生成工具 Suno。该公司最初否认指控,并给出多种解释,但在吉他手 Rhett Shull 分析原始 Logic 文件后,最终承认错误并道歉。公司表示将要求员工和创意伙伴披露生成式 AI 的使用,并加强内容审核。
观点
OPINION3 篇扎克伯格发布AI宣言:四大要点解读
Meta CEO 马克·扎克伯格发布长篇宣言《未来属于每个人》,阐述其对超级智能 AI 发展的愿景,包括推动数据中心建设、开放 AI 模型、呼吁减少政府监管但加强网络安全合作。该宣言旨在塑造 Meta 作为负责任 AI 领导者的形象,并影响公众和政策制定者。
编码代理的关键技能:不止于代码审查
Simon Willison 在其博客中讨论了使用编码代理的关键技能,即自信地指示更改并验证更改的正确性。他认为逐行审查代码并非最有效的验证方式,并提到了其他验证方法。文章还列出了近期相关文章,包括关于概念完整性、Qwen 3.8 27B 模型以及 OpenAI 对 Hugging Face 的意外攻击。
不要做 AI 的“肉代理”
Niklas Gruhn 提出了一个新术语“肉代理”,指那些盲目复制粘贴 AI 输出给他人的人。作者 Simon Willison 建议人们在使用 AI 时,应阅读、理解并验证输出,然后用自己语言撰写回复,以增加价值。