VOL. 2026-09-22 · 12 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-22 · PUBLISHED · 约 10 分钟
今天最值得关注的是模型发布密集落地:Anthropic 推出 Cla…
今天最值得关注的是模型发布密集落地:Anthropic 推出 Claude Opus 5.5,成本较 Opus 5 降低 40%;小米开源 MiMo-V2.6-Pro,以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数,训练成本约 300 万美元;poolside 则发布面向本地智能体编程的 33B MoE 模型 Laguna XS.2。研究侧的主线是效率与架构解耦,RBS-Attention 以免训练稀疏预填充缓解长上下文开销,注意力感知路由尝试在 MoE 中耦合路由与注意力,Meta AI 的 SJR 双模型架构则把多模态内容理解与政策分类拆开。工程与生态方面,vLLM v0.30.0 新增多模型支持,NVIDIA 将 TensorRT 多设备推理集成进 Dynamo-Triton,推理侧的跨设备与多模型服务能力继续补强。
今日看点
4 个章节 · 12 条情报- 01研究进展RBS-Attention:面向长上下文LLM的半径受限稀疏预填充4
- 02模型发布poolside 发布 Laguna XS.2:33B MoE 本地智能体编程模型5
- 03产品发布NVIDIA TensorRT 多设备推理集成 Dynamo-Triton,跨多 GPU 服务模型2
- 04开源项目vLLM 发布 v0.30.0:新增多模型支持与性能优化1
研究进展
RESEARCH4 篇RBS-Attention:面向长上下文LLM的半径受限稀疏预填充
该论文提出 RBS-Attention,一种免训练的稀疏预填充方法,用于缓解长上下文 LLM 推理中密集自注意力预填充的开销。作者指出块质心评分会因「均值稀释」而漏掉块内高度相关的 token,因此设计双分支选择:质心基分支捕捉平均相关性,救援分支利用最大键块半径及其随提示、层、头变化的分布来识别可能被低估的块。在 H100 上,该方法在 Qwen3-30B-A3B-Instruct-2507-FP8 的 128K 上下文下实现 20.65 倍独立预填充注意力加速、11.92 倍 vLLM 预填充注意力加速和 5.97 倍端到端首 token 时间加速,并在 Qwen3-32B 上取得接近密集注意力的 RULER 与 LongBench-v2 质量。
Meta AI 提出 SJR 双模型架构解耦多模态内容审核
Meta AI 提出 Summarize-Judge-Refine(SJR)双模型架构,将多模态内容理解与政策分类解耦:多模态 Content Model 生成结构化文本摘要,纯文本 Policy Model 依据政策定义对摘要分类。通过 GRPO 迭代协同训练和文本空间增强,在误导性广告检测任务上,SJR 相比零样本思维链基线非误导类 F1 相对提升 23.6%,并超过端到端 SFT、STaR/RFT 和 RLFT。值得注意的是,仅用合成正类数据、零真实违规样本训练的变体,在违规类 F1 上与全量数据模型相对差距仅 0.2%,表明新政策可在无真实违规数据下启动。
注意力感知路由:在 MoE 中耦合路由与注意力
该论文提出 Attention-Aware Routing (AAR),在 MoE 语言模型中用滑动窗口的注意力权重为路由器补充上下文信息,同时冻结基础 Transformer 只训练路由参数。在 OLMoE 上,AAR 相比仅路由 SFT 基线提升了 GSM8K 数学推理表现,并揭示路由与注意力构成耦合回路:路由变化经残差流放大注意力汇。研究还发现 AAR 具有深度敏感性,浅层应用可能损害事实检索,而深层应用可保持数学推理增益,体现检索与推理的深度权衡。
美团统一推荐基座大模型MTFM在外卖多业务落地实践
美团技术团队提出统一推荐基座大模型 MTFM,在外卖多个主要业务场景实现统一精排模型,通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计解决规模可扩展性、场景可延展性与架构高效性挑战。该模型在外卖多业务中实现订单量提升 2.06%~6.68%,推理成本降低 24%,相关工作已被 KDD 2026 收录。
模型发布
MODEL RELEASE5 篇poolside 发布 Laguna XS.2:33B MoE 本地智能体编程模型
poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Verified 上得分 69.9%,可在 36GB 内存的 Mac 上运行,并获 vLLM、Transformers 和 TRT-LLM 首日支持。
阿里PAI发布MiniMax-H3视频ControlNet-Union模型
阿里 PAI 团队在 Hugging Face 发布 MiniMax-H3-Fun-Controlnet-Union,这是一个基于 VideoX-Fun 流程训练的 ControlNet-Union 模型,可为 MiniMax-H3 视频生成器提供 Canny、Depth、HED、MLSD、Pose 五种控制条件以及视频修复能力。该模型仅包含约 6.8GB 的控制分支权重,需叠加在基础 MiniMax-H3 transformer 上使用,并采用 guidance 蒸馏,推理时 guidance_scale=1.0、单次前向即可。页面同时标注该版本为 legacy,推荐使用效果更好的 2.0 版本。
Synthyra 发布 ESM++ Large 蛋白质语言模型
Synthyra 在 Hugging Face 上发布了 ESMplusplus_large 模型,将 biohub/ESMC-600M 检查点与 FastPLMs 运行时打包,用于蛋白质语言建模。该模型支持氨基酸序列输入,提供序列/残基嵌入、下游分类预测、PEFT LoRA 微调以及测试时训练(TTT)等功能,并兼容多种注意力后端。
Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%
Anthropic 发布 Claude Opus 5.5,这是全新 Claude 5.5 系列的首个模型。该模型在多数任务上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。
小米 MiMo-V2.6-Pro 开源:1T-A42B 新晋最强开源权重模型,训练成本 300 万美元
小米发布 MiMo-V2.6 系列开源全模态模型,其中 MiMo-V2.6-Pro 以 1.02T 总参数、42B 激活参数登顶开源权重模型智能指数(46),训练成本约 300 万美元。小米同时开源 RL 环境、训练配方与代码,并披露 RL 训练细节(130 小时、75B tokens、约 260 万美元)。此举被视为中国前沿实验室开源发布潮的一部分,也凸显 RL 环境正成为新的战略资产。
产品发布
PRODUCT RELEASE2 篇NVIDIA TensorRT 多设备推理集成 Dynamo-Triton,跨多 GPU 服务模型
NVIDIA 发布 TensorRT 多设备推理能力,使单个 TensorRT 网络可借助 NCCL 分布式集合通信跨多 GPU 执行,并从 TensorRT 11.0 起全面支持。Dynamo-Triton 26.07 版本的 TensorRT 后端启用该能力,一个 KIND_MODEL 实例可拥有多块 GPU 并统一暴露单个 gRPC 模型端点。文章以 Cosmos 3 Nano 视频生成模型为例,端到端延迟从单 GPU 的 156.595 秒降至 8 GPU 的 34.183 秒,加速 4.58 倍,transformer RPC 加速达 6.09 倍。
NVIDIA 发布 DLSS 5 与 ACE、RTX Kit 更新
NVIDIA 发布 DLSS 5,引入 3D-Guided Neural Rendering,以游戏引擎渲染帧为基础,在保留场景结构与艺术意图的前提下增强光照与材质细节,并已在 NBA 2K27 中上线。同时更新 NVIDIA ACE,推出 Nemotron Speech 3.5 Streaming 与 Qwen3 TTS 等模型,并升级 NVIGI SDK。RTX Kit 与 RTX Mega Geometry 2.0 也获得更新,扩展高密度几何、神经纹理与渲染工作流能力。
开源项目
OPEN SOURCE1 篇vLLM 发布 v0.30.0:新增多模型支持与性能优化
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K3 性能,扩展大规模服务与量化能力,并包含多项破坏性变更。