仅用奖励训练语言模型:达到99.9%语法正确率但缺乏泛化
原标题:🎲 Apprendre à un réseau à écrire avec seulement une récompense — il a atteint 99,9 % grammatical sans apprendre une seule règle 🇫🇷
AI 摘要
作者在 Hugging Face 博客上分享了一项实验:仅使用奖励信号(REINFORCE 算法)从头训练一个 15M 参数的法国语言模型,使其学会生成特定句子,无需预训练或语言规则。实验发现,逐步奖励(如按位置匹配)能有效引导学习,而全有或全无奖励则完全失败。模型最终达到 99.9% 的语法正确率,但学习到的只是位置到字符的查表,缺乏抽象结构,迁移测试也证实了这一点。
正文节选
🎲 Apprendre à un réseau à écrire avec seulement une récompense — il a atteint 99,9 % grammatical sans apprendre une seule règle 🇫🇷 Si vous avez suivi la série, tout jusqu'ici était du préentraînement : un crawler, un dataset, un BPE personnalisé, un LLM français de 15M entraîné from scratch sur une 1080 Ti. Prédiction du token suivant, du début à la fin. J'ai donc posé la question évidente : est-ce que ça doit forcément être comme ça ? Les humains n'apprennent pas à écrire en prédisant le caract