苏剑林复盘Kimi K3:896专家与混合注意力的技术取舍
原标题:苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍?
AI 摘要
Kimi研究员苏剑林发文复盘K3模型在MoE和注意力机制上的关键设计取舍。K3拥有2.8万亿参数和896个路由专家,通过LatentMoE降低计算和通信成本,并采用RMSNorm、SiTU-GLU和Quantile Balancing确保训练稳定性。注意力方面,K3交替使用KDA和Gated MLA,并移除RoPE,以平衡长上下文处理效率与信息保留。这些设计旨在实现模型容量扩展的同时控制计算成本,为万亿参数模型提供工程参考。
正文节选
0 作者丨郑佳美 编辑丨岑 峰 这几天,Kimi 研究员、RoPE 提出者苏剑林发布了一篇名为《简单谈谈 K3 的 MoE 和 Attention》的文章,集中讨论了 Kimi K3 在专家架构、训练稳定性、负载均衡和注意力设计上的几项关键取舍。 苏神在文章中提到 K3 拥有 2.8 万亿总参数,并配置了 896 个路由专家。但模型不会让每个 Token 调用全部专家,而是只从中激活 16 个。在注意力结构上,K3 也没有沿用单一方案,而是将 KDA 与 Gated MLA 交替排列。 这些配置共同指向了 K3 的基本设计思路:模型可以继续扩大容量,但不能让计算成本随着总参数量和上下文长度同步增长。更多专家意味着模型拥有更细致的能力分工,混合注意力则让模型能够以更低成本处理长上下文。 然而,规模扩张也会带来新的问题。 当专家数量增加时,Router 不仅要准确选择专家,还要避免少数专家持续过载;当 Token 被发送到不同 GPU 上的专家时,跨设备通信也会迅速增加。 与此同时,更长的上下文会推高 KV Cache 和注意力计算成本,而 BF16、FP8 等低精度训练虽然能够节省资源,