返回全部动态
把记忆交给CPU,大模型会变快
AI 摘要
量子位报道,随着Coding Agent等长任务普及,KV Cache占用显存导致并发下降、TTFT升高。英特尔提出以CPU侧管理、分层存储和QAT硬件压缩为核心的KV Cache优化方案,包括KV Shrink、KV Fuse、KV Cascade和KV Infinity四个方向。测试显示KV Shrink在80%缓存命中率下TTFT最高约5倍加速,QAT压缩性能约为CPU软件压缩的两倍。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
把记忆交给CPU,大模型会变快 让GPU去忙生成Token 金磊 发自 凹非寺 量子位 | 公众号 QbitAI 拿Agent做Coding,想必大家都已经很熟悉了。 不过,如果我们把目光从聊天窗口移到背后的数据中心,事情就没那么简单了。 一个Coding Agent改跨十几个文件的bug,需要反复读代码、查资料、跑测试。前几轮交互可能还很顺畅,但任务继续跑下去,系统要处理的历史信息也会越积越多。 当成千上万个Agent同时这样干活,运营方就可能遇到一个头疼的问题:服务器还在跑,能接住的并发却越来越吃紧,有些请求连吐出第一个Token都要等上好一会儿。 难道只能继续加GPU? 非也非也。 模型还是那个模型,服务器也还是那个服务器,问题的根儿啊,其实是出在了记忆。 因为大模型每生成一个新的Token,都还要继续用到前文的信息。为了不用每次从头计算,系统会把前面已经算好的中间结果保存起来;会话越聊越长,这份记忆自然也就越堆越厚。 一旦显存装不下,部分缓存被清走,等Agent下一轮又需要这些历史信息时,就可能重新做一遍Prefill。前面明明已经算过的东西,又得花GPU时间再算一次。 尤其是
发布时间:2026-09-16 11:07
抓取时间:2026-09-16 11:48
来源机构:量子位