VOL. 2026-09-11 · 11 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-11 · PUBLISHED · 约 9 分钟
今日最值得关注的是语言模型建模范式的探索:上海AI Lab与上海交大…
今日最值得关注的是语言模型建模范式的探索:上海AI Lab与上海交大提出在下一词预测之外增加下一概念预测的潜在空间语言模型,同时南壁发布采用Looped Transformer架构的3B紧凑智能体模型,TAARDIS-27B则将27B权重全量压至1.75bit。推理与部署侧的优化同样密集,NVIDIA NIM全栈优化让Nemotron 3 Ultra并发用户提升2.5倍,AWS SageMaker推出前缀感知路由以复用KV缓存降低延迟,llama.cpp则重构Metal后端融合表。此外,研究揭示合成数据微调会导致智能体技能检索的灾难性遗忘,ORCH框架尝试用组织原则协调大规模异构具身智能体,FastGPT与Mastra也发布了涉及AI Proxy强制与worker配置的产品更新。
今日看点
4 个章节 · 11 条情报- 01研究进展NCP-ArchPreview:通过下一概念预测迈向潜在空间语言模型3
- 02模型发布南壁发布 Nanbeige4.2-3B 紧凑智能体模型3
- 03产品发布FastGPT 发布 v4.17.0:强制 AI Proxy 并新增自动升级与 CSRF 防御4
- 04开源项目llama.cpp b10909:Metal 后端融合表重构与性能修复1
研究进展
RESEARCH3 篇NCP-ArchPreview:通过下一概念预测迈向潜在空间语言模型
上海AI Lab与上海交大LUMIA Lab联合发布NCP-ArchPreview技术报告,提出一种在标准下一词预测(NTP)之外增加下一概念预测(NCP)的潜在空间语言模型。该模型通过从隐藏状态构建乘积量化概念词表,并用专门的Concept Module预测跨多token的离散概念,再反馈到token层指导生成,NTP与NCP端到端联合训练。模型规模达8.9B参数,在Dolma-3的5.73T token上训练,仅用51.3%训练token即达到OLMo-3-7B的最终预训练损失,下游宏平均超出2.45分,GSM8K提升5.99分,并开源了Stage-1检查点、drafter模型及最终检查点。
合成数据之殇:LLM智能体技能检索中的灾难性遗忘
该研究针对LLM智能体在34,396个技能库中的技能检索问题,发现使用合成数据微调虽能提升分布内检索,却会导致在真实和分布外(OOD)数据上的灾难性遗忘。作者评估了嵌入锚点正则化、LwF、EWC和L2初始化等持续学习方法,结果显示这些方法不仅保留了OOD检索性能,还将0.6B Qwen检索器和重排器的合成分布内检索提升了13.98%。研究提供了实用基准和针对稀缺多正例监督的稳健微调方案。
ORCH:组织原则赋能具身AI集体智能
研究提出 ORCH(Organizing Roles and Coordination Hierarchies)框架,将人类组织理论中的池化与顺序依赖原则操作化,用于组织大规模异构具身智能体。在 25 个野火响应任务中,使用 8 个大语言模型评估最多 50 个异构智能体,ORCH 组织在任务结果、执行效率、探索和计算资源使用上均优于四种代表性具身多智能体方法,人工设计的 ORCH 平均提升最终得分 63.97%、执行效率 74.29%,语言模型自动生成的组织也分别提升 43.63% 和 52.53%。结果表明集体性能并非单调取决于模型规模,组织设计是人工集体智能的基本维度。
模型发布
MODEL RELEASE3 篇南壁发布 Nanbeige4.2-3B 紧凑智能体模型
南壁(Nanbeige)发布紧凑型智能体模型 Nanbeige4.2-3B,基于 Nanbeige4.2-3B-Base 构建,采用 Looped Transformer 架构在不增加参数的情况下复用层以提升容量,仅 3B 非嵌入参数。该模型在通用智能体、代码智能体和推理基准上超过 Qwen3.5-9B、Gemma4-12B 等更大模型,并登上 Artificial Analysis 小模型排行榜首位。其架构改进(LoopSplit、mHC with depth attention、拼接 n-gram 嵌入)已纳入正在训练的 Nanbeige4.5。
CrowdGPT 发布首个社区分布式模型架构 Crowd-v1
CrowdGPT 发布了其首个社区分布式语言模型架构 Crowd-v1,该模型约 10 亿参数,采用 SotaGPT 架构,但权重随机初始化,未经过预训练。该发布旨在为社区驱动的分布式训练提供统一的模型定义和权重格式,供 CrowdGPT 客户端下载并共同训练。模型使用 Qwen3 兼容词表,支持 BF16 和 FP32 权重格式,并强调可复现性。
TAARDIS-27B 全三值量化模型发布:1.75bit 仅 5.9GB
开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降至 11.83。该模型需使用作者自建的 llama.cpp 分支运行,原版会输出乱码;作者称其单人 51 天完成,转换配方开源,体积小于 PrismML 的 Ternary-Bonsai-27B,但质量仍略低。
产品发布
PRODUCT RELEASE4 篇FastGPT 发布 v4.17.0:强制 AI Proxy 并新增自动升级与 CSRF 防御
FastGPT 发布 v4.17.0 版本,要求升级前先升级到 V4.16.2 并执行旧升级脚本。该版本强制要求部署或接入 AI Proxy,弃用并移除 OPENAI_BASE_URL 和 CHAT_API_KEY 配置,同时新增 CSRF 防御、自动系统升级任务管理、Agent V2 语音播报、SSO 的 LDAP 与钉钉同步等功能,并修复多项工作流、模型映射和工具调用问题。
Mastra 发布 1.66.0:worker 配置、trace 查询与流式超时更新
Mastra 发布 @mastra/core@1.66.0 等更新,为 Mastra Cloud 引入部署范围的 worker 配置清单与运行时拓扑对比端点,并增强 trace 查询能力,支持按 span 字段、metadata、feedback 和 scores 过滤,覆盖 Postgres、ClickHouse、DuckDB 等存储后端。同时新增可观测性信号(feedback/scores)的幂等批量删除接口、记忆模块的观测转换钩子,以及流式首块超时设置和降低追踪开销的优化。
NVIDIA NIM 全栈优化让 Nemotron 3 Ultra 并发用户提升 2.5 倍
NVIDIA 技术博客介绍其 NIM 2.0.12 全栈优化如何在 Nemotron 3 Ultra 上实现 2.5 倍并发用户提升。在 4xB200 硬件、64K 上下文、76% KV 复用、50 TPS/用户(20ms ITL)的 agentic 负载基准下,优化后吞吐从 718 tok/s 提升至 1,997 tok/s。优化来自精度与自动调优内核、张量并行、前缀与 Mamba 状态复用、调度批处理内存调优以及 MTP 推测解码等配置组合,而非独立开关叠加。文章还给出使用 AIPerf 回放流量、选择满足 SLO 的 Pareto 点及部署 NIM 2.0.12 的具体步骤。
AWS SageMaker Inference 推出前缀感知路由降低 LLM 延迟
AWS 在 Amazon SageMaker Inference 上推出 prefix-aware routing 路由策略,通过将具有相同提示前缀的请求持续发送到同一实例,使 KV 缓存得以复用。在 Llama 3.1 70B 的基准测试中,该策略将 P50 TTFT 降低最多 77%,吞吐量提升最多 16%,KV 缓存命中率从约 25% 提升至 80% 以上。该功能无需手动标记请求,并内置过载保护和扩缩容时的稳定性保障。
开源项目
OPEN SOURCE1 篇llama.cpp b10909:Metal 后端融合表重构与性能修复
llama.cpp 发布 b10909 版本,主要重构 Metal 后端的算子融合机制,将所有可融合模式统一到单张融合表(ggml-metal-fuse.cpp),供图优化器和算子编码器共用。修复了融合模式中输出索引使用相对索引导致 norm/MUL 融合被静默禁用、token 生成性能回退约 5% 的问题。新增 gated_delta_net 与 KV cache 拷贝的融合,并加入融合统计接口与回归测试。