VOL. 2026-08-12 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-08-12 · PUBLISHED · 约 9 分钟
当日AI行业最显著的变化集中在多模态与医疗AI的突破:Google升…
当日AI行业最显著的变化集中在多模态与医疗AI的突破:Google升级AMIE系统支持实时视频问诊,Jina AI连续发布两款多模态嵌入模型,均支持文本、图像、视频和音频输入。同时,安全领域出现重大隐患,研究人员发现可窃取Anthropic、OpenAI和Google专有LLM API的推理痕迹,绕过反蒸馏机制。模型发布方面,NVIDIA推出Nemotron 3.5 Lightning 30B混合架构模型,LFM2.5-VL-3B增强边缘视觉语言能力,llama.cpp新版本大幅提升pocket-tts性能。此外,AWS与OpenAI合作在Bedrock上推出Daybreak网络安全模型,Mistral推进AI主权战略,NVIDIA JetPack 7.2.1新增Agentic视频技能,共同构成当日多元化的行业进展。
今日看点
3 个章节 · 12 条情报- 01研究进展Google 推进 AMIE 实现专家级视听临床咨询4
- 02模型发布Jina AI 发布多模态嵌入模型 v5-omni-small4
- 03产品发布NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持4
研究进展
RESEARCH4 篇Google 推进 AMIE 实现专家级视听临床咨询
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并开发了临床视听能力分类和自动化评估套件。该研究旨在提升远程医疗的可及性和诊断准确性。
窃取专有LLM API的推理痕迹
研究人员发现,Anthropic、OpenAI 和 Google 等大型语言模型提供商返回给客户端的加密推理痕迹块在不同会话、用户和模型间可互换,存在架构漏洞。通过将该痕迹注入同一提供商的较弱模型中,可强制其解码并输出明文,从而绕过反蒸馏机制,实现私有数据提取、隐藏危险信息泄露和隐形提示注入。研究团队从公共仓库中解码了 315,320 个推理块,恢复了 367 个个人身份信息和 182 个凭据,并提出了加密和系统级缓解措施。
CurveFP:用于语言模型的封闭乘积有理基数对数数据类型
CurveFP 是一种新的低精度数据类型家族,通过交错对数曲线和紧凑块缩放实现封闭乘积,使乘法变为精确的符号异或和整数索引更新。CurveFP8 用于训练,CurveFP7 用于部署,在多个 7B-9B 模型上以更少的位达到或超过 FP8 的困惑度,并在 128.3M 参数预训练中实现 FP8 级质量,同时降低格式引起的惩罚。
基于层丛的联邦表示学习框架
本文提出了一种基于层丛的联邦表示学习框架(SFRL),通过可学习的层丛限制映射和流形约束的几何对齐正则化,在无需共享全局潜在空间的情况下实现异构智能体间的语义对齐。该框架利用层丛拉普拉斯算子的二次粘合正则化,在少量共享样本上评估惩罚项,并提出了交替优化的分散式算法Sheaf-FRL,证明了其在确定性和随机设置下收敛到一阶稳定点。在语义通信的协作分类任务中,SFRL在局部和通信后分类准确率上优于基线方法,并对潜在空间维度压缩表现出更强的鲁棒性。
模型发布
MODEL RELEASE4 篇Jina AI 发布多模态嵌入模型 v5-omni-small
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并可通过 Elastic Inference Service 或 vLLM 部署。
LFM2.5-VL-3B:增强边缘视觉语言能力
LFM2.5-VL-3B 是新一代视觉语言模型,在屏幕理解、接地、多图像输入和函数调用方面有显著提升。该模型在多个视觉和文本基准测试中表现优异,尤其在接地和屏幕理解任务上大幅领先同类模型。它支持多种推理框架,并能在边缘设备上高效运行,如 M5 Max 上每秒解码 228 个 token。
Jina AI 发布多模态嵌入模型 v5-omni-small-retrieval
Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图像、视频和音频基准上定义了开放权重前沿,旨在实现跨模态检索而无需重新索引。
NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可证,可商用。
产品发布
PRODUCT RELEASE4 篇NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
AWS与OpenAI合作在Bedrock上推出Daybreak网络安全模型
AWS与OpenAI合作,将Daybreak Red和Daybreak Blue两款网络安全模型引入Amazon Bedrock,供符合条件的客户使用。Daybreak Red提供GPT-5.6 Cyber模型,Daybreak Blue提供GPT-5.6 Sol模型,均支持漏洞发现、检测工程和事件响应等任务。这些模型在Bedrock上运行,具备零操作员访问、加密和IAM策略等安全控制,且推理数据不用于训练。OpenAI表示,安全研究人员已通过Daybreak Red在Chrome的V8引擎中发现两个零日漏洞。
llama.cpp b10369 发布:支持 pocket-tts 并优化性能
llama.cpp 发布 b10369 版本,主要更新是支持 pocket-tts 文本到语音模型。该实现将转置卷积重构为 GEMM 加 col2im,使 CUDA 上每帧生成时间降低 80%,CPU 上降低 50%,输出与参考实现高度一致。同时新增了语言包特定参数(如帧尾填充、短文本填充)和模型变体支持,并更新了文档。
Mistral推进AI主权:区域推理、开放模型与欧洲新基建
Mistral AI 宣布三项举措以推进AI主权:推出区域端点和优先服务层级,支持第三方开放模型(如Z.ai的GLM-5.2),并组建联盟确保欧洲长期AI算力,目标到2030年建设1GW容量。这些措施旨在让企业和国家控制模型、基础设施和算力,同时保持区域合规和可靠性。