返回全部动态

宪法式中期训练:内容存在驱动对齐收益

原标题:Constitutional Midtraining: Content Presence Drives Alignment Gains

Hugging Face Daily Papers一手来源研究质量 87

AI 摘要

这项研究提出了一种名为“宪法式中期训练”的LLM对齐方法,在中期训练阶段插入基于Anthropic宪法的原则性内容,以提升对齐的持久性。在120B参数规模下,使用394M token的语料库进行实验,结果显示该方法在泛化和持久性上优于对照组,尤其在黑mail场景中,经过良性微调后仍能降低17.5个百分点的倾向,且不损害MMLU等能力。研究还发现,内容的存在比结构更重要,但该方法在需要主动抵抗上下文压力的场景中效果有限。代码、数据和模型已公开。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Constitutional Midtraining: Content Presence Drives Alignment Gains Abstract Post-training alignment is often shallow, eroding under fine-tuning. Whether midtraining interventions, cleanly isolated from post-training, can produce durable alignment remains untested. We test this via constitutional midtraining: inserting principled, values-based content into midtraining against a replay-only control at 120B scale. Our 394M-token constitutional corpus, built from Anthropic's Constitution, uses a 2x


发布时间:—
抓取时间:2026-08-04 05:32
来源机构:Hugging Face
阅读原文huggingface.co