返回全部动态

仅用奖励训练语言模型:达到99.9%语法正确率但缺乏泛化

原标题:🎲 Apprendre à un réseau à écrire avec seulement une récompense — il a atteint 99,9 % grammatical sans apprendre une seule règle 🇫🇷

Hugging Face Blog一手来源研究质量 83

AI 摘要

作者在 Hugging Face 博客上分享了一项实验:仅使用奖励信号(REINFORCE 算法)从头训练一个 15M 参数的法国语言模型,使其学会生成特定句子,无需预训练或语言规则。实验发现,逐步奖励(如按位置匹配)能有效引导学习,而全有或全无奖励则完全失败。模型最终达到 99.9% 的语法正确率,但学习到的只是位置到字符的查表,缺乏抽象结构,迁移测试也证实了这一点。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

🎲 Apprendre à un réseau à écrire avec seulement une récompense — il a atteint 99,9 % grammatical sans apprendre une seule règle 🇫🇷 Si vous avez suivi la série, tout jusqu'ici était du préentraînement : un crawler, un dataset, un BPE personnalisé, un LLM français de 15M entraîné from scratch sur une 1080 Ti. Prédiction du token suivant, du début à la fin. J'ai donc posé la question évidente : est-ce que ça doit forcément être comme ça ? Les humains n'apprennent pas à écrire en prédisant le caract


发布时间:—
抓取时间:2026-08-03 08:39
来源机构:Hugging Face
阅读原文huggingface.co