VOL. 2026-10-02 · 12 STORIES · DAILY INTELLIGENCE

AI HOT RADAR 日报

新一期发布后,可按你的时区发送
REPORT DELIVERY

把报告送到邮箱

订阅整期 AI 行业简报,不会逐条发送动态。我们会先发送确认链接,未经确认不会投递。

  1. 1发送确认邮件链接 24 小时有效
  2. 2你点击确认防止他人冒用邮箱
  3. 3投递下一期报告含摘要、在线原文与退订链接
推送周期

按 Asia/Shanghai 当地时间 08:30 后投递已发布的下一期报告;不会补发确认前的历史期刊, 可随时从邮件退订。

今日看点

NVIDIA 发布基于 Eagle VLM 架构的约 17 亿参数多…

NVIDIA 发布基于 Eagle VLM 架构的约 17 亿参数多模态重排序模型 llama-nemotron-rerank-vl-1b-v2,成为当天最受关注的模型发布。推理与工程侧同步推进,Ray 2.59.0 将 Ray Data LLM 与 Ray Serve LLM 转为正式稳定并升级 vLLM,SGLang v0.5.21 新增多模型支持,Claude Code 2.1.287 引入 Claude Mods 插件机制与内置侧边代理。安全方面,PydanticAI v2.53.0 修复了并发限流器的高危槽位泄漏漏洞。研究侧则出现 STATERA 零样本仿真到现实质量估计、面向 LLM 的快速多项式超越函数以及 Adam 与自然梯度下降几何关系等多项工作。

今日看点

5 个章节 · 12 条情报
  1. 01
    模型发布NVIDIA 发布多模态重排序模型 llama-nemotron-rerank-vl-1b-v2
    4
  2. 02
    产品发布Ray 2.59.0 发布:LLM API 转正,新增外部 shuffle 与默认 token 认证
    3
  3. 03
    研究进展STATERA:用冻结时序管片零样本仿真到现实估计隐藏质量
    3
  4. 04
    开源项目SGLang v0.5.21 发布:新增多模型支持与性能优化
    1
  5. 05
    安全PydanticAI v2.53.0:修复并发限流高危漏洞并新增多项功能
    1
01

模型发布

MODEL RELEASE4 篇

NVIDIA 发布多模态重排序模型 llama-nemotron-rerank-vl-1b-v2

NVIDIA 发布 llama-nemotron-rerank-vl-1b-v2 多模态重排序模型,基于 Eagle VLM 架构(SigLIP 2 400M 视觉编码器 + Llama 3.2 1B 语言模型),约 17 亿参数,采用交叉编码器结构。该模型可对图像、文本或图文混合的文档页面与查询进行相关性打分,用于视觉 RAG 流程中对候选文档重排序。模型在 ViDoRe V1/V2/V3 等基准上评估,支持商业使用,遵循 NVIDIA 开放模型许可。

查看事件脉络阅读原文 ↗

DiffuRefill-1B:1.08B 掩码扩散语言模型预训练中

Hugging Face 上出现一个名为 DiffuRefill-1B 的 1.08B 参数掩码扩散语言模型预训练检查点,目前训练约进行到一半(约 10 万步 / 20 万步,约 460 亿有效 token)。该模型采用置信度定向重填充解码,整段序列约需 20 次并行去噪即可生成,而自回归模型每 token 需一次前向。训练通过 DiLoCo 在 3-5 台单 GPU 机器上同步进行,作者称其英语流畅但事实性仍不可靠,尚未做指令微调。

查看事件脉络阅读原文 ↗

Jared Palmer 发布 Kev-0.8B 决策模型

Jared Palmer 发布 Kev-0.8B,一个基于 Qwen3.5-0.8B-Base 的决策模型,通过 LoRA 适配器和指针头实现,可在笔记本或 4GB GPU 上运行。模型接收文档和带类型的问题,单次前向传播输出校准后的选项概率分布,不生成文本,并兼容 TypeSafe 的 System One API。在多个测试集上准确率从 0.515 到 0.851 不等,域外表现明显弱于 Kev-4B。

查看事件脉络阅读原文 ↗

Laya AI 模型:工作原理、本地运行与评估指南

Convai Innovations 发布开源权重、非自回归决策模型家族 Laya,输入为状态加若干类型化问题,输出带概率信息的答案对象,采用 Apache 2.0 许可并支持本地推理。英文检查点基于 ModernBERT-large(约 4.21 亿参数),多语言检查点基于 mmBERT,提供 Router 在检查点间选择。文章强调其概率需在自有任务上校准,且仅适用于有界决策步骤,不能替代生成式 LLM。

查看事件脉络阅读原文 ↗
02

产品发布

PRODUCT RELEASE3 篇

Ray 2.59.0 发布:LLM API 转正,新增外部 shuffle 与默认 token 认证

Ray 发布 2.59.0 版本,Ray Data LLM 与 Ray Serve LLM 正式 GA/稳定,并升级至 vLLM 0.27.0。Ray Data 引入外部磁盘 shuffle(shuffle_v2)及 Join/Aggregation 支持,新增 ORC、多路径 Lance、视频读取参数等数据源能力。安全方面,本地集群默认启用 token 认证,dashboard 对 runtime_env 脱敏并修复 Hudi 读取的远程代码执行风险。Ray Serve 新增可配置背压响应、声明式 tracing 配置以及 gang 调度部署的 scale-to-zero 支持。

查看事件脉络阅读原文 ↗

DGX Spark手册:本地AI推理的实用指南

文章介绍了NVIDIA DGX Spark桌面AI设备,尽管其内存带宽较低(273 GB/s),但通过MoE架构和推测解码等技术,能够高效运行智能模型,并支持多台堆叠以提升内存和带宽。作者认为该设备适合个人或小家庭使用,功耗低、安静,但价格已从3999美元上涨至4699美元甚至更高。

查看事件脉络阅读原文 ↗

Claude Code 2.1.287 发布:新增 Claude Mods 与内置侧边代理

Claude Code 发布 2.1.287 版本更新,新增 Claude Mods 插件机制,允许插件修改更深层行为,并内置「You should know」侧边代理来提醒用户或 Claude 可能遗漏的问题。本次更新还改进了 agents 视图过滤、OpenTelemetry 事件字段、MCP 服务器 URL 提示等能力,并修复了大量关于远程会话、权限提示、屏幕阅读器模式、Bedrock/Vertex 模型检查等方面的缺陷。

查看事件脉络阅读原文 ↗
03

研究进展

RESEARCH3 篇

STATERA:用冻结时序管片零样本仿真到现实估计隐藏质量

研究者提出 STATERA,一种基于部分冻结的 V-JEPA 视频骨干网络加轻量时序 tubelet 混合器的架构,用于从单目短视频中估计不透明非对称刚体的隐藏质心(CoM)。同时发布 HiddenMass Benchmark,包含 5 万条 MuJoCo 轨迹和 63 段带物理标定真值的真实测试序列。仿真中归一化 CoM 误差从 DINOv2 的 41.7% 降至 25.2%,零样本 sim-to-real 迁移下物理捕捉率从 2.6% 提升到 41.0%。

查看事件脉络阅读原文 ↗

面向 LLM 的快速多项式超越函数

该论文研究用短多项式程序替代 LLM 中 sigmoid、tanh、SiLU 等超越函数,以缓解 GPU 上 SFU 与矩阵/内存管线扩展不均衡造成的瓶颈。作者在 GB200 上对四个集成任务(dense SiLU、tanh-softcapped attention、sigmoid attention、routed-expert SwiGLU)用 BF16 三次或四次多项式替换原生实现,训练步吞吐分别提升 2.7%、2.9%、8.0%,sigmoid attention 前向提升 7.4%。论文还通过同 checkpoint 消融和配对预训练比较评估模型行为,并开源拟合工具与内核代码。

查看事件脉络阅读原文 ↗

Adam 与自然梯度下降的几何距离研究

该论文研究 Adam 优化器与自然梯度下降(NGD)之间的几何关系,将 Adam 的完整更新规则(含动量)建模为对角经验 Fisher 近似,并分析对角截断、经验标签替换和时间滞后带来的几何偏差。作者在良态线性回归、病态线性回归、逻辑回归和非凸小型神经网络四种损失景观上测量 Adam 与真实 NGD 的偏差,发现偏差在良态场景较低,但在病态和神经网络场景显著上升。研究还发现更高的几何漂移与初期优化变慢相关,但不影响最终目标最小化,且改进的经验 Fisher(iEF)比标准 EF 路径更稳定。结论认为 Adam 的优化能力可能来自结构近似误差与动量平滑的平衡,而非紧密跟踪自然梯度路径。

查看事件脉络阅读原文 ↗
04

开源项目

OPEN SOURCE1 篇

SGLang v0.5.21 发布:新增多模型支持与性能优化

SGLang 发布 v0.5.21 版本,包含来自 227 位贡献者的 779 个 PR。新增 DeepSeek-V4.1 Flash、GigaChat 3.5、MiMo-V2.6、DiffusionGemma、Qwen-Image 2.1 等十余个模型支持,并引入 PD 实例动态切换、Rust 前缀缓存、Decisions API 与 Score API 等关键特性。性能方面,DeepSeek-V4.1 长提示首 token 提速 22%,Kimi K3 在 PD 服务中预填充吞吐提升 20.6%。

查看事件脉络阅读原文 ↗
05

安全

SECURITY1 篇

PydanticAI v2.53.0:修复并发限流高危漏洞并新增多项功能

PydanticAI 发布 v2.53.0,修复了 ConcurrencyLimitedModel 中一个高危并发槽位泄漏漏洞(GHSA-6fqq-452j-qhrp),该漏洞在流式请求提前退出或取消时可能导致共享限流器的所有请求被阻塞。此版本还调整了限流器共享规则,并新增 ToolCallJudge、托管子代理、多个 CLAI2 插件及可观测性设置等特性。

查看事件脉络阅读原文 ↗
12独立事件
12一手报道
8发布来源
≈9 min读完本期
逐条速览当天值得追踪的 AI 变化所有事实条目均可回到原始发布方核验
阅读周报 →
已发布总述由 deepseek-v4-flash 生成;条目来自已保存的精选与 Story,事实以原文为准。生成于 2026/10/2 21:16:19 · report-v3