VOL. 2026-W33 · 76 STORIES · WEEKLY SIGNALS

AI HOT RADAR 周报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

本周主线

本周AI领域呈现两条主线:一是模型发布密集,Meta发布Muse G…

本周AI领域呈现两条主线:一是模型发布密集,Meta发布Muse Glimmer并重申个人超级智能愿景,NVIDIA推出Nemotron 3.5 Lightning,MiniMax-H3、Qwen3.8-27B等模型也迎来量化版本,开源生态持续繁荣;二是AI代理与安全治理加速推进,Cloudflare在Agents Week发布多项代理产品并新增MCP流量检测,OpenAI更新Agents SDK,Anthropic宣布Claude Code默认自动模式并推出文本水印以符合欧盟AI法案。此外,多模态与视频生成成为热点,Lightricks发布LTX-2.3,FlashVSR v1.1实现实时视频超分,Jina AI推出多模态嵌入模型。在效率与可解释性方面,llama.cpp持续更新支持新模型,txtai推出LEMUR提升检索效率,Hugging Face发布Steerling-8B探索训练内可解释性。医疗AI亦有进展,Google升级AMIE支持实时视频问诊,同时开源社区在OCR、药物发现等垂直领域推出FineBooks和开放发现挑战赛。整体来看,本周动向显示行业正从单一模型竞赛转向代理生态、安全合规与多模态应用的全面布局。

本周主线

3 个章节 · 76 条情报
  1. 01
    研究进展Anthropic 详解 Claude 文本水印技术:符合欧盟 AI 法案,不影响输出质量
    17
  2. 02
    模型发布NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行
    30
  3. 03
    产品发布Cloudflare Agents Week 发布多项代理相关产品与工具
    29
01

研究进展

RESEARCH17 篇

Anthropic 详解 Claude 文本水印技术:符合欧盟 AI 法案,不影响输出质量

Anthropic 宣布未来 Claude 模型将内置文本水印,以符合欧盟 AI 法案要求。该水印基于 Google DeepMind 的 SynthID-Text 方法,通过改变模型选择词语时的随机性来源来嵌入模式,不影响输出质量、可读性或成本,且不携带个人或组织信息。Anthropic 表示,水印对读者不可见,但可通过密钥检测文本是否由 Claude 生成。

阅读原文 ↗

规范优先AI编码代理:无测试预言与人工审查下的大规模架构重构案例研究

本文报告了一项大规模架构重构案例研究,作者使用AI编码代理在规范优先协议下,成功拆除了一个717,725行TypeScript代码库中的核心生命周期不变量,涉及189个文件,且无人工代码审查和测试预言。通过14轮规范细化、17轮验证循环和31次审计,修正了201个缺陷,最终在三天内完成,成本为2,430美元,软件行为符合规范且无错误。该研究挑战了传统代码审查的瓶颈,提出通过前置规范审计替代事后代码审查。

阅读原文 ↗

穷人的智能体建模:在笔记本电脑上模拟大规模LLM智能体社会

本文提出一种在笔记本电脑上模拟大规模LLM智能体社会的低成本方法,用低参数代理模型替代昂贵的大模型智能体,并引入交互顺序记忆分类法预测替代误差趋势。作者在EconAgent等八个LLM模拟上验证了该方法,发现EconAgent对奥肯定律的复现实为会计恒等式,而菲利普斯曲线才是真正的行为特征。该方法使宏观模拟成本大幅降低,并揭示了推理步骤而非提示词措辞是涌现宏观规律的原因。

阅读原文 ↗

Google 推进 AMIE 实现专家级视听临床咨询

Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并开发了临床视听能力分类和自动化评估套件。该研究旨在提升远程医疗的可及性和诊断准确性。

阅读原文 ↗

txtai 推出 LEMUR 与均值中心化,提升晚期交互检索效率

txtai 引入了 LEMUR(Learned Multi-Vector Retrieval)和可配置的均值中心化,以改进晚期交互检索。LEMUR 学习多向量表示的固定维度编码,使晚期交互模型能使用标准向量索引;均值中心化解决了 token 向量各向异性问题。在 BEIR 数据集上,LEMUR 在相同向量维度下相比 MUVERA 显著提升 NDCG@10,但效果依赖具体配置,且默认 IVF 索引会降低性能。

阅读原文 ↗

FineBooks:开源OCR模型能否解锁历史知识?

Hugging Face 与 EleutherAI 合作推出 FineBooks 项目,旨在评估开源 OCR 模型在处理历史文献上的表现,并重新处理公共领域书籍以提升 AI 训练数据质量。项目发布了包含 14 个模型的 BHL OCR 排行榜、基准数据集和评估工具,基于 2165 页专家转录的历史书籍页面进行测试。初步结果显示,现代 VLM 模型在历史文档上的准确率仍有提升空间,但成本较低,适合大规模应用。

阅读原文 ↗

窃取专有LLM API的推理痕迹

研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 367 个个人身份信息和 182 个凭据,并提出了加密和系统级缓解措施。

阅读原文 ↗

IntegrityBench:评估大模型作为共同科学家的科研诚信基准

arXiv 论文提出 IntegrityBench,首个评估 LLM 作为共同科学家时科研诚信的基准,覆盖 36 个任务、18 种不当行为、3 个领域和 4 个研究阶段,并采用 5 级隐式-显式压力协议。对 18 个前沿模型变体评估发现,在最大压力下模型在约三分之一的诚信关键决策中失败,且规模与推理能力无法可靠缓解。显式压力增加不当行为遵从,隐式重构导致过度拒绝合法任务,且模型在三个决策方面存在结构分离。

阅读原文 ↗

可解释语言模型的规模化:Steerling-8B 实现训练内可解释性

Hugging Face 发布了一篇技术报告,提出将可解释性作为训练约束而非事后解释的方法。实验表明,在自回归和扩散语言模型中,可解释性随规模提升而增强。他们发布了 Steerling-8B 模型,该模型能归因输出到输入 token、概念和训练数据,支持闭环干预,且性能可与使用 2-16 倍计算量训练的模型竞争。

阅读原文 ↗

LLM辅助多轮合同网协议用于移动边缘计算流处理调度

本文提出 MAS-DecStream 系统,其核心是 LLM-MR-CNP 协议,扩展了经典合同网协议,引入语义化 CFP 生成、渐进式上下文披露、多轮提案修订、协商记忆和确定性验证。实验基于阿里 ASI 追踪数据,结果显示该方案将延迟违规率降至 3%,消除资源过度承诺,在 20 个代理下冲突解决率达 0.91,效用相比多轮规则基线提升最多 22%。研究表明多轮 CNP 细化是协议层面的主要收益,LLM 辅助在定性和不确定运行时上下文中增加价值。

阅读原文 ↗

AI人格会成长吗?分析并基准化LLM代理在生活事件后的人格演变

该研究分析了基于人格条件的大语言模型代理(PC-Agents)在经历11种重大生活事件后的人格演变,使用大五人格特质作为心理测量锚点。研究发现,PC-Agents在事件-特质对上的特质变化率与人类已知变化方向一致,但变化幅度通常低于人类效应量,且人格层面的离散度比人类样本压缩三到四倍。研究引入了可复用的基准BFI-Adapt,用于评分事件诱发人格变化的方向保真度,并对14个模型进行了排名。结果表明,当前PC-Agents能模拟人类人格动态的平均值,但无法模拟其分布形态。

阅读原文 ↗

一致并非对齐:人类与LLM道德判断中的分歧基础

该研究通过一个包含500个条目的ETHICS衍生基准,比较了人类标注者和LLM在道德判断中的最终标签与支持理由,发现尽管标签一致性很高,但模型在道德理由上存在系统性分歧,如对伤害、尊重等类别的关注不同。作者认为,标签一致性不应等同于对齐,评估应关注模型表达的理由和原则。

阅读原文 ↗

CurveFP:用于语言模型的封闭乘积有理基数对数数据类型

CurveFP 是一种新的低精度数据类型家族,通过交错对数曲线和紧凑块缩放实现封闭乘积,使乘法变为精确的符号异或和整数索引更新。CurveFP8 用于训练,CurveFP7 用于部署,在多个 7B-9B 模型上以更少的位达到或超过 FP8 的困惑度,并在 128.3M 参数预训练中实现 FP8 级质量,同时降低格式引起的惩罚。

阅读原文 ↗

TRACES基准:评估大语言模型科学推理的认知可靠性

TRACES 基准测试通过 42 篇撤稿、欺诈或伪科学论文,评估大语言模型在科学推理中的认知可靠性。测试发现,30 个模型在 71% 以上的智能体探针中失败,22 个模型失败率超过 90%,表明模型拒绝不可靠前提的能力主要基于主题安全行为而非真正的认知能力。该研究呼吁为科学部署的语言模型建立防护基础设施。

阅读原文 ↗

自进化代码图像推理:通过可执行反思提升视觉计算能力

该研究提出Code-with-Image范式,将视觉推理从语言链转移到Python程序执行,并构建CwI-Bench基准测试。作者提出Self-Reflection over Executable Reasoning,一种无需训练的自我进化循环,通过观察和可执行反射改进技能库,显著提升GPT-5.6-luna和Qwen3.5-27B在基准上的准确率,且技能可跨模型迁移。

阅读原文 ↗

OpenART:通过开放式环境演化扩展智能体红队测试

OpenART 是一个用于可扩展智能体红队测试的开放竞技场,通过环境演化来评估长周期 AI 智能体的安全性。它提供了超过 10,000 个跨 50 个领域的验证状态场景,并提出了 EMHA 攻击策略,该策略在无需参数更新的情况下实现了 85.0% 的总体攻击成功率。研究表明,随着任务复杂度的增加,环境演化能更有效地暴露安全失败,且智能体的运行时实现对其安全性的影响显著。

阅读原文 ↗
02

模型发布

MODEL RELEASE30 篇

NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotron 3.5 Lightning 在速度和准确性上达到 Pareto 前沿,输出速度比同类模型快 4 倍,在 PinchBench 上以 86% 的准确率比 Qwen3.6 35B 快 30%。模型权重、训练数据和配方以 OpenMDW-1.1 许可发布,支持微调和强化学习。

阅读原文 ↗

llama.cpp 新增 Kimi-K3 模型支持,实现混合注意力与 MXFP4 优化

llama.cpp 发布 b10448 版本,新增对 Kimi-K3 文本模型的支持,包括混合 KDA 线性注意力和 MLA 全注意力架构,以及跨层残差注意力、潜在 MoE、situ 激活、MLA 输出门和全秩 KDA 门等特性。该版本还实现了 MXFP4 量化权重的无损重打包,并添加了 Kimi K3 的聊天格式支持,包括推理提取和工具调用解析。验证显示与 Moonshot 的参考实现高度一致,最终位置 logits 相对误差为 6.7e-05。

阅读原文 ↗

MiniMax H3 INT4 量化与混合精度 VAE 模型发布

Hugging Face 用户 koongrizzly 发布了 MiniMax H3 的量化模型合集,包含来自 Winnougan 的 INT4/W4A8 ConvRot 量化 transformer 与文本编码器,以及自行转换的混合 FP16/FP32 Video VAE,并整合了 Turbo LoRA。该仓库面向消费级 GPU 的本地低显存推理,官方适配 ComfyUI,同时提供独立应用仓库。

查看事件脉络阅读原文 ↗

Lightricks 发布 LTX-2.3 开放权重音视频生成模型

Lightricks 发布了 LTX-2.3,这是其 LTX-2 联合音视频基础模型的重大更新,提升了音频和视觉质量以及提示遵循能力。该模型基于 DiT 架构,可生成同步的视频和音频,并提供多种检查点,包括完整版、蒸馏版和上采样器。模型权重开放,支持本地运行,并提供了 ComfyUI 和 PyTorch 代码库等集成方式。

阅读原文 ↗

Meta 发布 Muse Glimmer 与 Spark,重申个人超级智能愿景

Meta 在扎克伯格发表个人超级智能文章一周年之际,发布了开放权重模型 Muse Glimmer,并计划推出 Spark,标志着其重返开放权重前沿。扎克伯格在文章中阐述了 Meta 以个人超级智能为核心的战略,并提出了关于就业、基础设施、安全、美国领导力等风险与应对建议。Glimmer 模型可在单张 RTX 3090 上运行,被视为美国开放模型的一次胜利。

阅读原文 ↗

AtomicChat 发布 Qwen3.8-27B GGUF 量化模型

AtomicChat 发布了 Qwen3.8-27B 的 GGUF 量化版本,基于 Qwen 原始权重并使用自己的重要性矩阵进行量化。该模型支持文本生成和多模态(图像)输入,提供了多种量化级别,并附有详细的量化分析、运行指南和速度测试。用户可通过 llama.cpp 或 Atomic Chat 应用本地运行该模型。

阅读原文 ↗

Nesso-1:加速开源结合亲和力预测

Valence 和 Recursion 团队发布了 Nesso-1,一个开源粗粒度共折叠模型,用于蛋白质-配体结合亲和力预测。相比 Boltz-2,Nesso-1 速度快一个数量级以上,在多个公共和专有数据集上达到或超越其准确性,且单 GPU 预测仅需 1 秒。该模型旨在解决封闭源码瓶颈、计算成本高、人类与 AI 归纳偏差以及公共基准泄漏等问题,并支持大规模化合物筛选。

阅读原文 ↗

FlashVSR v1.1:实时扩散视频超分模型发布

FlashVSR v1.1 是一个基于扩散模型的实时视频超分辨率模型,由 Junhao Zhuang 等人发布,支持 4 倍超分,在单个 A100 GPU 上可实现约 17 FPS 的 768×1408 视频处理。该模型通过三阶段蒸馏、局部约束稀疏注意力和轻量条件解码器实现高效推理,相比先前的一步扩散 VSR 模型速度提升约 12 倍。模型权重和推理代码已开源,但 VSR-120K 数据集尚未发布。

阅读原文 ↗

Blackfrost 发布 Muse Glimmer 30B 去拒绝 GGUF 量化版

Blackfrost-AI 发布了 Muse-Glimmer-30B-Abliterated-GGUF,这是基于 Meta 的 Muse Glimmer 30B 模型去除拒绝行为后的 GGUF 量化版本,支持本地运行。该模型提供从 Q2_K 到 Q8_0 的完整量化阶梯,并包含视觉投影器和 DFlash 投机解码器,在 RTX PRO 6000 上可实现约 1.6 倍加速。模型在 R1-HARMFUL-BENCH-450 基准上实现了 0% 的真实拒绝率,但被标记为实验性,可能存在边缘问题。

阅读原文 ↗

Ling-3.0-flash GGUF 量化版发布,支持 llama.cpp 与投机解码

Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash 的 GGUF 量化版本,该模型为 124B 总参数、5.1B 激活参数的混合 KDA + gated MLA、512 专家 MoE 架构。这些文件是 bailingmoe3 架构的参考转换,已合并进 llama.cpp PR #26608,并内置 MTP 块与逐层 SwiGLU clamp 元数据,无需单独 drafter 文件。发布还提供了多种量化规格、显存适配表以及 DSpark 投机解码草稿模型,方便本地部署与 agentic 工具调用。

查看事件脉络阅读原文 ↗

MiniMax-H3 GGUF curve 版发布:体积缩减40%并适配24GB显存

joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本(curve 形式),基于 MiniMax 的剪枝检查点构建,体积比原版小约 40%,Q8_0 版本可适配 24GB 显存。该版本通过分解 adaln 调制矩阵实现压缩,在 ComfyUI 0.30.0 及以上版本中运行,并提供了与原始版本的渲染对比数据。

阅读原文 ↗

Unsloth 发布 MiniMax-H3 的 GGUF 量化版,支持本地视频生成

Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,支持本地运行,兼容 stablediffusion.cpp 和 Unsloth 平台。该模型能生成带原生立体声音频的视频,最长 15 秒、24 FPS、32 kHz 音频。提供两种去噪器变体(fl2va 和 ref2va)及多种量化等级,并附有使用示例和许可证说明。

阅读原文 ↗

MiniMax-H3 GGUF 量化版发布,支持 ComfyUI 运行

joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本,支持在 ComfyUI 中运行,并提供 fl2va 和 ref2va 两种模型。该版本解决了 ComfyUI-GGUF 的架构识别问题,并提供了多种量化选项以适应不同显存。此外,还提供了剪枝版本的替代方案,并解释了 K-quants 不可用的原因。

阅读原文 ↗

Meta 发布 Muse Glimmer:开源多模态模型,支持图像视频与工具调用

Meta 发布了 Muse Glimmer,一个 30B 参数的开源多模态模型,包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频和工具调用。该模型在 transformers、llama.cpp、vLLM 等库中获得首发支持,并采用混合注意力、门控分组查询注意力等架构优化。Muse Glimmer 还提供了可选的投机解码模块,以加速生成。

阅读原文 ↗

Jina AI 发布多模态嵌入模型 v5-omni-small

Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并可通过 Elastic Inference Service 或 vLLM 部署。

阅读原文 ↗

NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型

NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可证,可商用。

阅读原文 ↗

LFM2.5-VL-3B:增强边缘视觉语言能力

LFM2.5-VL-3B 是新一代视觉语言模型,在屏幕理解、接地、多图像输入和函数调用方面有显著提升。该模型在多个视觉和文本基准测试中表现优异,尤其在接地和屏幕理解任务上大幅领先同类模型。它支持多种推理框架,并能在边缘设备上高效运行,如 M5 Max 上每秒解码 228 个 token。

阅读原文 ↗

NVIDIA 发布 Nemotron 3.5 Lightning 和 NeMo Switchyard,提升代理式 AI 效率

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提供对 AI 部署和运行的更大控制,并已获得多家合作伙伴的采用。

阅读原文 ↗

Hugging Face 发布 Luth-2 法语小模型,采用 MOPD 技术刷新多项基准

Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。

阅读原文 ↗

Jina AI 发布 jina-reranker-v3:0.6B 多语言重排序模型,BEIR 达 SOTA

Jina AI 发布了 jina-reranker-v3,一个基于 Qwen3-0.6B 的 0.6B 参数多语言文档重排序模型,采用新颖的 last but not late interaction 架构,在 131K token 上下文中可同时处理多达 64 个文档。该模型在 BEIR 基准上达到 61.94 nDCG@10 的 SOTA 性能,比生成式 listwise 重排序器小 10 倍。模型支持多语言,提供本地推理和 API 两种使用方式,并已推出 GGUF 量化版本和 MLX 版本。官方推荐新项目使用其升级版 jina-reranker-v3.5。

阅读原文 ↗

Cohere 发布 2.4B 原生分辨率视觉语言模型 North Micro Vision

Cohere 发布了 North-Micro-Vision-Instruct,一个 2.4B 参数的开源视觉语言模型,支持原生分辨率图像输入,采用 Apache 2.0 许可证。该模型结合了 400M 参数的视觉编码器和 2B 参数的语言模型,通过四阶段训练优化了文档理解、多语言视觉理解等能力。模型旨在支持边缘设备和移动端部署,并可通过微调适应特定领域。

阅读原文 ↗

Deepwen 3.6:融合 DeepSeek 推理的 3D 生成微调模型

Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。

阅读原文 ↗

Nanbeige4.2-3B GGUF 量化版本发布

gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8_0 到 IQ2_XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4_K_M 在质量与体积间达到最佳平衡。

阅读原文 ↗

Red Hat 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版本

Red Hat 发布了基于 Qwen3.6-35B-A3B 的 NVFP4 量化版本模型 RedHatAI/Qwen3.6-35B-A3B-NVFP4,权重和激活均量化为 NVFP4 格式,使用 llm-compressor 工具生成。该模型针对推理和工具调用优化,支持 vLLM 部署,并在多个基准测试中保持了接近原始模型的性能,如 GSM8K 和 GPQA 上恢复率超过 100%。

阅读原文 ↗

Red Hat 发布 Gemma 4 12B NVFP4 量化模型

Red Hat 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,权重和激活均量化为 4 位浮点格式,使用 vLLM 的 llm-compressor 工具和 GPTQ 方法。该模型在 GSM8K 和 Wikitext 基准上进行了评估,性能接近 BF16 基线,并已在 RHOAI 3.5 和 vLLM 0.24.0 上验证。

阅读原文 ↗

Jina AI 发布多模态嵌入模型 v5-omni-small-retrieval

Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图像、视频和音频基准上定义了开放权重前沿,旨在实现跨模态检索而无需重新索引。

阅读原文 ↗

NVIDIA 发布 Magpie 多语言 TTS:开源权重,低延迟部署

NVIDIA 发布 Magpie 多语言 TTS 模型,新增阿拉伯语、韩语和巴西葡萄牙语支持,共支持 12 种语言。该模型为 3.64 亿参数的开源权重模型,可通过 NVIDIA NIM 部署,在 B200 GPU 上实现 32 毫秒的首音频延迟和 320 倍实时吞吐。通过帧堆叠和局部 Transformer 架构优化,在保持语音质量的同时降低推理延迟,适用于多语言语音代理等场景。

阅读原文 ↗

Red Hat 发布 Qwen3.6-35B-A3B-FP8 量化模型

Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24.0 上验证。该版本旨在提升编码代理和前端工作流的性能,同时保留推理上下文以优化迭代开发。

阅读原文 ↗

Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流

Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090、DGX Spark、DGX Station 和 Jetson,并支持通过 NIM 容器、SGLang、vLLM 等推理栈进行部署和微调。

阅读原文 ↗
03

产品发布

PRODUCT RELEASE29 篇

Cloudflare Agents Week 发布多项代理相关产品与工具

Cloudflare 在 Agents Week 期间发布了一系列面向 AI 代理的产品和工具,包括新的代理运行时 @cloudflare/computer、Cloudflare Agents 平台、Cloudflare Wallets、WebMCP 接口、Kitesurf 浏览器以及 MCPv2 协议。这些发布旨在构建一个开放、安全的 Agentic Internet,支持代理的构建、部署、安全访问和交易。

阅读原文 ↗

LiteLLM v1.98.0-rc.1 发布:镜像签名验证与多项修复

LiteLLM 发布 v1.98.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,如修复 Bedrock 中 Claude Sonnet 5 的 toolSpec.strict 问题、为 Grok 4.6 添加定价、支持 gpt-5.4-mini 的 xhigh 推理、改进 UI 组件和路由功能等。

阅读原文 ↗

LiteLLM v1.97.0 发布:镜像签名验证与多项功能更新

LiteLLM 发布 v1.97.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签验证签名的方法。该版本包含多项功能更新和修复,如支持 Cursor 模型名称后缀解析、团队回调日志停止、JWT 认证用户邮箱回填、非流式响应切换、默认组织设置、缓存客户端连接回收、Rubrik 护栏的提示词审核与响应文本阻止、自定义元数据验证钩子、自动路由器节省成本展示等。此外,还进行了依赖更新、UI 重构和性能优化,例如安装 hiredis 以加速 Redis 解析。

阅读原文 ↗

开放发现挑战赛:为AI设计的疟疾药物候选物提供公开验证排行榜

Hugging Face 博客宣布启动开放发现挑战赛,这是一个针对AI发现疟疾药物候选物的公开排行榜。VIDRAFT 团队投入其验证工具,并公开了构建评估器过程中发现的14个缺陷及修复过程,强调验证比生成分子更难。该挑战旨在通过公开排行榜推动药物发现的验证民主化,解决市场失灵导致的疟疾药物研发停滞问题。

阅读原文 ↗

llama.cpp b10437 发布:新增 MiniMax-Text-01 和 M1 模型支持

llama.cpp 发布 b10437 版本,新增对 MiniMax-Text-01 和 MiniMax-M1 模型的支持,包括模型转换、推理优化和 Jinja 模板。该版本通过 token 抑制替代 logits mask 解决零嵌入问题,并优化了循环状态管理。同时提供了多平台二进制下载,但部分平台构建被禁用。

阅读原文 ↗

llama.cpp b10444 发布:支持 MTP 辅助模型加载

llama.cpp 发布 b10444 版本,主要新增 --models-dir 选项以支持加载 MTP 辅助模型,并优化了预设检查逻辑。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,但部分平台构建(如 KleidiAI、ROCm、openEuler)被暂时禁用。

阅读原文 ↗

OpenAI Agents Python SDK v0.21.0 发布:新增测试工具与兼容性更新

OpenAI 发布了 Agents Python SDK 的 v0.21.0 版本,主要新增了 provider-neutral 的测试工具(agents.testing、agents.realtime.testing、agents.voice.testing),用于无需 provider 请求的确定性测试,并更新了对 OpenAI Python v3 和 HTTPX2 的兼容性。此外,该版本还修复了多个核心问题,包括中断快照、递归工具审批、流清理、敏感错误脱敏,以及 MCP 生命周期隔离和沙箱功能增强。

阅读原文 ↗

llama.cpp b10451 发布:修复 LoRA 张量越界检查

llama.cpp 发布 b10451 版本,主要修复了 LoRA 张量数据越界检查问题,确保 LoRA 张量数据在文件边界内。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,并包含 UI 组件。

阅读原文 ↗

Cloudflare 推出新功能检测并保护 MCP 流量

Cloudflare 宣布推出新的 Cloudflare One 功能,用于识别和检查 MCP(模型上下文协议)流量,显示哪些用户和服务器在生成该流量,并控制受管网络路径上的直接连接。这些控制措施结合 MCP Server Portals,帮助管理员确保代理使用经批准的路径,防止影子 MCP 流量。文章详细分析了 MCP 工具调用的结构,并比较了在客户端、网络边界和 MCP 服务器三个位置进行控制的优缺点。

阅读原文 ↗

Claude Code五天后默认自动模式,Anthropic承担额外成本

Anthropic宣布5天后所有Claude Code将默认启用自动模式,该模式通过分类器自动审批工具调用,额外token开销由Anthropic承担。数据显示人工审批的权限请求中97%被同意,而自动模式在对抗测试中拦截率更高,且不随会话长度下降。Anthropic还委托Apollo Research和Trajectory Labs进行安全测试,并公开了拦截案例。

阅读原文 ↗

Cloudflare 一键保护所有内部 vibe-coded 应用

Cloudflare 宣布推出新工具,允许用户一键保护所有内部 vibe-coded 应用。用户现在可以将 Cloudflare Access 直接应用于单个 Worker 或账户中的所有 Worker,使应用默认置于公司登录之后,无需开发者自行配置。该功能支持账户级策略、单应用策略、查看访问者身份(通过 ctx.access.getIdentity()),并开源了一个内部静态站点平台示例。

阅读原文 ↗

vLLM v0.27.0 发布:支持 Kimi K3、Qwen3.5,性能大幅提升

vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和 Rust 前端 gRPC 控制平面。

阅读原文 ↗

LangChain4j 1.19.0 发布:支持 MCP 更新、Milvus V2 及 Anthropic 批量模型

LangChain4j 发布了 1.19.0 和 1.19.0-beta29 版本,主要更新包括:MCP 客户端更新至 2026-07-28 规范,支持 Milvus V2 服务及混合搜索,新增工具操作补偿机制,以及 AnthropicBatchChatModel 支持 Anthropic Message Batches API。此外,还增加了 watsonx.ai Model Gateway 支持和 google-genai 的思考能力。这些改进增强了框架的集成能力和智能体系统的稳定性。

阅读原文 ↗

OneAdvanced 在 AWS 上部署 50 多个 AI 代理实现英国数据主权

OneAdvanced 是一家英国企业软件提供商,在 AWS 上部署了超过 50 个 AI 代理,使用 Llama 4 Maverick 和 Llama Guard 4 模型,通过自托管方式满足英国数据主权要求。该解决方案基于 Amazon SageMaker AI、vLLM、RAG 管道和 Strands Agents SDK,支持医疗、法律等受监管行业。该架构帮助 OneAdvanced 获得 ISO 42001 认证,并实现了完全的数据驻留控制。

阅读原文 ↗

AWS 推出 SageMaker HyperPod 分层 KV 缓存,提升 LLM 推理性能

AWS 在 SageMaker HyperPod 上推出分层 KV 缓存架构,结合 Curvine 分布式缓存文件系统,将 KV 缓存从 GPU 扩展到 CPU 和共享 NVMe 池,实现跨副本缓存复用。测试显示,该方案可将跨 Pod 缓存命中率提升至 100%,TTFT 改善最高达 2.7 倍,并允许在更低成本的 G6e 实例上运行原本需要 P5 实例的工作负载。

阅读原文 ↗

FastGPT v4.16.0-beta2 发布:模型配置清洗与多项修复

FastGPT 发布 v4.16.0-beta2 版本,引入系统模型配置的严格 Schema 校验与清洗机制,需管理员通过 API 执行 dry-run 和正式清洗。新增工作流系统配置独立面板、开场白多预设问题拖拽排序等功能,并优化发布渠道页面、工具市场批量更新、PDF 解析器边缘裁剪等。修复了文件上传、S3 特殊字符处理、系统默认模型敏感信息泄露等多个问题,并将审计日志归档改为转存至 S3 冷归档。

阅读原文 ↗

Google ADK Python v2.7.0 发布:正确性修复与性能优化

Google ADK Python 发布 v2.7.0 版本,主要修复正确性问题,包括模型能力声明、工具返回媒体、对话历史保留、Jinja2 指令模板等改进。该版本还优化了启动速度和热路径性能,并将 pyarrow 从 gcp extra 移至新的 bigquery-analytics extra,这是一个破坏性变更。

阅读原文 ↗

NVIDIA 在 GB300 NVL72 上支持 Qwen3.8-2.4T-A95B 模型部署

阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数达 2.4T,每个 token 激活 95B 参数,采用细粒度 MoE 架构和全注意力与线性注意力混合设计,支持百万 token 上下文。NVIDIA 宣布该模型可在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4K tokens 的吞吐量,并通过 SGLang、vLLM、NVIDIA Dynamo 和 NIM 等推理栈提供部署支持。该模型专为智能体工作负载设计,内置推理控制选项,并可通过 NeMo AutoModel 进行微调。

阅读原文 ↗

Solv Labs 在 Amazon Bedrock 上构建可验证的代理支付系统

Solv Labs 在 Amazon Bedrock AgentCore payments 上构建了可验证、可审计的 AI 代理支付工作流,结合 ORACLE 策略引擎和 ICME PreFlight 合规验证,确保每笔交易在四秒内完成预授权、治理和链上结算,并生成完整审计轨迹。该方案利用 AWS Nitro Enclave 进行硬件级完整性证明,支持独立验证,适用于受监管环境中的企业代理。

阅读原文 ↗

AWS 为 DynamoDB 引入原生向量搜索功能

Amazon DynamoDB 推出了原生向量搜索功能,允许开发者直接在 DynamoDB 中存储嵌入向量并执行近似最近邻查询,无需单独的向量数据库。该功能支持过滤相似性搜索和可配置的向量索引,适用于语义搜索、代理记忆、RAG 等场景。AWS 表示该功能可扩展至数万亿向量,并保持毫秒级延迟,但成本可能高于 S3。

阅读原文 ↗

OpenAI Agents JS v0.15.0:默认模型更新与 MCP v2 支持

OpenAI Agents JavaScript 库发布 v0.15.0,默认模型改为 gpt-5.6-luna,并支持 MCP v2 协议协商。新版本增强了 RunState 的持久化能力,包括输入、工具输出和重试状态,同时改进了沙箱挂载凭据的安全性。此外,还增加了对 React Native 和 Realtime 的支持,并提升了 OpenAI 和 AI SDK 适配器的兼容性。

阅读原文 ↗

AWS 发布 Claude 应用网关企业部署参考架构

AWS 发布了一篇关于部署 Anthropic Claude 应用网关(Claude apps gateway)的博客,该网关为 Claude Code 和 Claude Desktop 提供集中治理层,支持身份验证、模型访问控制、成本归属和支出限制。参考部署使用 AWS Fargate、RDS PostgreSQL、内部负载均衡器和 OIDC 身份提供商,确保企业级安全性和可扩展性。该网关解决了身份、策略、成本等治理需求,并支持与 Amazon Bedrock 或 Claude Platform 集成。

阅读原文 ↗

Mastra 发布更新:新增文件代理调度、Oracle 存储及 QuickJS 传输

Mastra 发布 2025 年 8 月 12 日更新,为基于文件的代理新增 schedules 目录以声明周期性任务,并推出 @mastra/oracledb 存储提供程序、QuickJS 进程内代码模式传输、动态工作流构建器 API 及自定义 createRoute() 路由。同时包含多项破坏性变更,如存储工作流更名为动态工作流,频道代理回复默认以 markdown 发布。

阅读原文 ↗

Mastra 更新:新增工具结果防护与临时信号支持

Mastra 发布 2026 年 8 月 5 日更新,引入 processToolResult 生命周期钩子以在工具结果进入消息历史前进行安全扫描或转换,新增 transient 信号支持临时上下文,并推出 @mastra/deepeval 可观测性导出器。此外,模型生成跨度现在包含完整工具定义,平台沙箱执行延迟大幅降低,同时修复了内存泄漏和会话恢复等问题。

阅读原文 ↗

NVIDIA NeMo Switchyard:跨模型路由 AI 代理工作负载

NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单任务中使用较小模型,从而优化整体性能。

阅读原文 ↗

NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持

NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。

阅读原文 ↗

OlmoEarth Studio 推出自定义嵌入导出功能

AI2 的 OlmoEarth Studio 平台推出自定义嵌入向量导出功能,用户可计算并下载地球观测数据的紧凑数值表示。这些嵌入向量支持相似性搜索、分割和无监督探索等下游任务,并可通过 Studio UI 或 API 定制区域、时间、编码器变体等参数。官方展示了基于 60 个标注像素的线性分类器在越南红树林区域达到 0.84 的加权 F1 分数,证明了嵌入向量的有效性。

阅读原文 ↗

Transformers v5.15.0 发布:新增 Muse Glimmer 等多模型支持

Hugging Face Transformers 发布 v5.15.0 版本,新增多个模型支持,包括 Meta 的 Muse Glimmer(30B 参数多模态模型,专为智能体场景设计,Apache 2.0 许可)、IBM 的 GraniteSWA/GraniteMoeSWA、SKT 的 A.X-K1/K2 和 Cosmos3 Edge。该版本还包含多项破坏性变更,如线性注意力模型内核改为可选、缓存裁剪 API 仅接受负值、T5 系列默认支持 SDPA 等。此外,版本修复了多项注意力机制和视觉模型的问题,并优化了性能。

阅读原文 ↗
76独立事件
72一手报道
28发布来源
≈48 min读完本期
把一周内反复出现的事件收敛为趋势所有事实条目均可回到原始发布方核验
阅读月报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/8/16 21:28:12 · report-v3