宪法式中期训练:内容存在驱动对齐收益
原标题:Constitutional Midtraining: Content Presence Drives Alignment Gains
AI 摘要
这项研究提出了一种名为“宪法式中期训练”的LLM对齐方法,在中期训练阶段插入基于Anthropic宪法的原则性内容,以提升对齐的持久性。在120B参数规模下,使用394M token的语料库进行实验,结果显示该方法在泛化和持久性上优于对照组,尤其在黑mail场景中,经过良性微调后仍能降低17.5个百分点的倾向,且不损害MMLU等能力。研究还发现,内容的存在比结构更重要,但该方法在需要主动抵抗上下文压力的场景中效果有限。代码、数据和模型已公开。
正文节选
Constitutional Midtraining: Content Presence Drives Alignment Gains Abstract Post-training alignment is often shallow, eroding under fine-tuning. Whether midtraining interventions, cleanly isolated from post-training, can produce durable alignment remains untested. We test this via constitutional midtraining: inserting principled, values-based content into midtraining against a replay-only control at 120B scale. Our 394M-token constitutional corpus, built from Anthropic's Constitution, uses a 2x