返回全部动态

Meta新研究:字节级蒸馏突破Token天花板

原标题:Meta新研究:字节模型蒸馏后,天花板破了

量子位研究质量 77

AI 摘要

Meta FAIR与华盛顿大学发表论文,提出将知识蒸馏的学习单位从Token换成Byte,让字节级学生模型直接学习教师的字节级概率分布。团队提出Marginalize-It和End-Of-Token两种转换方法,以Llama 3-8B为教师进行实验。按缩放定律预测,End-Of-Token蒸馏的下游平均准确率上限达52.4%,比传统Token蒸馏的48.4%高出4个百分点,同时显著降低数据与教师分布的存储压力,但训练计算量更高。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Meta新研究:字节模型蒸馏后,天花板破了 henry 发自 凹非寺 量子位 | 公众号 QbitAI Token词元替代了Byte字节,但不意味着大模型都得是Token。 字节模型,特别是蒸馏后,有点儿新说法。 最近,来自Meta FAIR和华盛顿大学的论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出了一个很有趣的想法—— 蒸馏的时候,能不能把学习单位从词元(Token)换成字节,让学生模型直接从字节(byte)级别的概率分布学起? 结果还真可以~ 团队给每个Token加上结束标记,把教师的Token概率分布完整转换到字节级别。在以Llama 3-8B为教师的蒸馏实验中,团队根据缩放定律预测: 随着训练计算量增加,字节级蒸馏将反超Token级蒸馏,下游平均准确率上限高出4个百分点。 传统蒸馏让学生学习教师在庞大Token词表上的概率分布。相比之下,字节只有256种基础取值,单个位置的预测空间更小,基础取值也不随分词器改变。 换句话说,学习的基本单位反而更小了,模型最终能学到的能力上限却更高了。 这是怎么做到的? 字节级蒸馏 其实到今天,蒸馏已经不是什么陌生技术了。我们都


发布时间:2026-09-15 14:37
抓取时间:2026-09-15 15:54
来源机构:量子位
阅读原文qbitai.com