NCP-ArchPreview:通过下一概念预测迈向潜在空间语言模型
该论文提出 NCP-ArchPreview,一种在自回归预训练中同时进行下一 token 预测(NTP)和下一概念预测(NCP)的潜在空间语言模型。模型通过从隐藏状态构建乘积量化概念词表,并用专门的 Concept Module 预测跨多个 token 的离散概念,再反馈到 token 层指导生成。模型规模达 8.9B 参数,在 Dolma-3 的 5.73T token 上训练,仅用 51.3%
2026-09-11 · 2 篇报道 · 2 家独立信源 · 研究
主来源摘要
该论文提出 NCP-ArchPreview,一种在自回归预训练中同时进行下一 token 预测(NTP)和下一概念预测(NCP)的潜在空间语言模型。模型通过从隐藏状态构建乘积量化概念词表,并用专门的 Concept Module 预测跨多个 token 的离散概念,再反馈到 token 层指导生成。模型规模达 8.9B 参数,在 Dolma-3 的 5.73T token 上训练,仅用 51.3% 训练 token 即达到 OLMo-3-7B 的最终预训练损失,下游宏平均高出 2.45 分,GSM8K 提升 5.99 分。
参与来源arXiv cs.CL · Hugging Face Daily Papers
该论文提出 NCP-ArchPreview,一种在自回归预训练中同时进行下一 token 预测(NTP)和下一概念预测(NCP)的潜在空间语言模型。模型通过从隐藏状态构建乘积量化概念词表,并用专门的 Concept Module 预测跨多个 token 的离散概念,再反馈到 token 层指导生成。模型规模达 8.9B 参数,在 Dolma-3 的 5.73T token 上训练,仅用 51.3%
上海AI Lab与上海交大LUMIA Lab联合发布NCP-ArchPreview技术报告,提出一种在标准下一词预测(NTP)之外增加下一概念预测(NCP)的潜在空间语言模型。该模型通过从隐藏状态构建乘积量化概念词表,并用专门的Concept Module预测跨多token的离散概念,再反馈到token层指导生成,NTP与NCP端到端联合训练。模型规模达8.9B参数,在Dolma-3的5.73T