inclusionAI 发布 Ling-3.0-flash:124B 参数混合推理模型,激活仅 5.5B
原标题:inclusionAI/Ling-3.0-flash-fp4
AI 摘要
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.5B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE,在多个基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 SGLang HiCache 和 Mooncake 分层缓存,可将长输入场景的首 token 延迟降低 60% 至 80% 以上。模型已在 Hugging Face 和 ModelScope 上开源,支持 Claude Code、Kilo Code 等框架。
正文节选
--- license: mit pipeline_tag: text-generation --- <p align="center"> <img src="https://mdn.alipayobjects.com/huamei_qa8qxu/afts/img/A*4QxcQrBlTiAAAAAAQXAAAAgAemJ7AQ/original" width="100"/> </p> <p align="center">🤗 <a href="https://huggingface.co/inclusionAI">Hugging Face</a> | 🤖 <a href="https://modelscope.cn/organization/inclusionAI">ModelScope </a> | 🐙 <a href="https://openrouter.ai/inclusionai/ling-3.0-flash:free">OpenRouter </a>