数据高效语言建模:从前沿推进到原理引导的模型改进
原标题:Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement
AI 摘要
Qiushi Engine(浙江大学团队)在 BabyLM 2026 Strict-Small 赛道(1000 万词语料、1 亿累计词呈现预算)上开展端到端自主研究,分三阶段推进:先构建前沿模型,再研究经验组织、监督与能力保持等原理,最后用原理指导模型改进。两代模型在九项指标评测上从 42.02 提升至 42.25,第二代在 2026 年 9 月 8 日公开 Strict-Small 快照中取得最高分。研究提出可检验的数据高效学习原则,并称其为 Research RSI(研究过程的递归自我改进)的一个实例,模型、代码与实验记录已开源。
正文节选
[BoldFont=lmroman10-bold.otf,ItalicFont=lmroman10-italic.otf,BoldItalicFont=lmroman10-bolditalic.otf] [BoldFont=texgyreheros-bold.otf,ItalicFont=texgyreheros-italic.otf,BoldItalicFont=texgyreheros-bolditalic.otf] [ItalicFont=lmmono10-italic.otf,Scale=MatchLowercase] Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement Abstract Learning from limited text requires more than repeated exposure: models must learn to use relevant information, apply what the