VOL. 2026-08-12 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-12 · PUBLISHED · 约 9 分钟
今日AI行业焦点集中在多模态模型与推理效率的突破上
今日AI行业焦点集中在多模态模型与推理效率的突破上。Jina AI 连续发布两款多模态嵌入模型,支持文本、图像、视频和音频的统一向量表示,并与文本模型对齐,简化了跨模态检索流程。同时,NVIDIA 推出 Nemotron 3.5 Lightning 30B 混合架构模型,以3B激活参数支持长达1M上下文,专为单GPU部署优化,进一步推动边缘与高效推理。在应用层面,AWS 生态成为企业落地AI的关键平台,OneAdvanced 部署50多个AI代理实现英国数据主权,Solv Labs 则构建了可验证的代理支付系统。此外,安全研究揭示专有LLM API存在推理痕迹可互换的架构漏洞,可能被利用绕过反蒸馏机制,引发对模型保护的新担忧。整体来看,行业正加速向多模态、高效推理与安全合规并重的方向发展。
今日看点
3 个章节 · 12 条情报- 01研究进展Google 推进 AMIE 实现专家级视听临床咨询4
- 02模型发布Jina AI 发布多模态嵌入模型 v5-omni-small4
- 03产品发布OneAdvanced 在 AWS 上部署 50 多个 AI 代理实现英国数据主权4
研究进展
RESEARCH4 篇Google 推进 AMIE 实现专家级视听临床咨询
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并开发了临床视听能力分类和自动化评估套件。该研究旨在提升远程医疗的可及性和诊断准确性。
窃取专有LLM API的推理痕迹
研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 367 个个人身份信息和 182 个凭据,并提出了加密和系统级缓解措施。
空架还是丢钥匙?回忆是参数化事实性的瓶颈
Google Research 的研究人员提出知识剖析框架,发现前沿大模型(如 Gemini3 和 GPT-5)的事实编码接近饱和,但回忆能力不足,导致许多事实错误源于无法检索而非未编码。他们构建了包含 2150 个事实的 WikiProfile 基准,并评估了 13 个模型,结果表明扩展模型规模主要改善编码而非回忆,且长尾事实和反向问题的瓶颈在于利用而非获取。
CurveFP:用于语言模型的封闭乘积有理基数对数数据类型
CurveFP 是一种新的低精度数据类型家族,通过交错对数曲线和紧凑块缩放实现封闭乘积,使乘法变为精确的符号异或和整数索引更新。CurveFP8 用于训练,CurveFP7 用于部署,在多个 7B-9B 模型上以更少的位达到或超过 FP8 的困惑度,并在 128.3M 参数预训练中实现 FP8 级质量,同时降低格式引起的惩罚。
模型发布
MODEL RELEASE4 篇Jina AI 发布多模态嵌入模型 v5-omni-small
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并可通过 Elastic Inference Service 或 vLLM 部署。
LFM2.5-VL-3B:增强边缘视觉语言能力
LFM2.5-VL-3B 是新一代视觉语言模型,在屏幕理解、接地、多图像输入和函数调用方面有显著提升。该模型在多个视觉和文本基准测试中表现优异,尤其在接地和屏幕理解任务上大幅领先同类模型。它支持多种推理框架,并能在边缘设备上高效运行,如 M5 Max 上每秒解码 228 个 token。
Jina AI 发布多模态嵌入模型 v5-omni-small-retrieval
Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图像、视频和音频基准上定义了开放权重前沿,旨在实现跨模态检索而无需重新索引。
NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可证,可商用。
产品发布
PRODUCT RELEASE4 篇OneAdvanced 在 AWS 上部署 50 多个 AI 代理实现英国数据主权
OneAdvanced 是一家英国企业软件提供商,在 AWS 上部署了超过 50 个 AI 代理,使用 Llama 4 Maverick 和 Llama Guard 4 模型,通过自托管方式满足英国数据主权要求。该解决方案基于 Amazon SageMaker AI、vLLM、RAG 管道和 Strands Agents SDK,支持医疗、法律等受监管行业。该架构帮助 OneAdvanced 获得 ISO 42001 认证,并实现了完全的数据驻留控制。
AWS 推出 SageMaker HyperPod 分层 KV 缓存,提升 LLM 推理性能
AWS 在 SageMaker HyperPod 上推出分层 KV 缓存架构,结合 Curvine 分布式缓存文件系统,将 KV 缓存从 GPU 扩展到 CPU 和共享 NVMe 池,实现跨副本缓存复用。测试显示,该方案可将跨 Pod 缓存命中率提升至 100%,TTFT 改善最高达 2.7 倍,并允许在更低成本的 G6e 实例上运行原本需要 P5 实例的工作负载。
Solv Labs 在 Amazon Bedrock 上构建可验证的代理支付系统
Solv Labs 在 Amazon Bedrock AgentCore payments 上构建了可验证、可审计的 AI 代理支付工作流,结合 ORACLE 策略引擎和 ICME PreFlight 合规验证,确保每笔交易在四秒内完成预授权、治理和链上结算,并生成完整审计轨迹。该方案利用 AWS Nitro Enclave 进行硬件级完整性证明,支持独立验证,适用于受监管环境中的企业代理。
Mastra 发布更新:新增文件代理调度、Oracle 存储及 QuickJS 传输
Mastra 发布 2025 年 8 月 12 日更新,为基于文件的代理新增 schedules 目录以声明周期性任务,并推出 @mastra/oracledb 存储提供程序、QuickJS 进程内代码模式传输、动态工作流构建器 API 及自定义 createRoute() 路由。同时包含多项破坏性变更,如存储工作流更名为动态工作流,频道代理回复默认以 markdown 发布。