返回全部动态
Jalapeño 跑分炸场,GPU 推理路线开始分裂?
AI 摘要
OpenAI 公布自研推理芯片 Jalapeño 的跑分数据,显示其在 Token 吞吐、延迟和能效上较现有方案有显著提升,引发与 NVIDIA Rubin 的对比讨论。同时,NVIDIA 将 Groq 3 LPU 引入推理系统,Google 推出训练和推理分离的 TPU 8t/8i,三家公司在推理硬件路线上出现分化。文章分析指出,推理负载中 Decode 阶段受内存带宽限制,芯片设计正从单纯堆算力转向优化数据路径和资源配比。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
0 作者丨郑佳美 编辑丨岑 峰 今天,OpenAI 的自研推理芯片 Jalapeño,终于从规格表走到了跑分台。 这次公开的数据很接地气:Token 吞吐、生成延迟、单位功耗下能跑多少推理。因为大模型上线以后,芯片面对的早就不只是一次训练任务。ChatGPT 要一直回消息,Reasoning 模型要持续生成长链路内容,Agent 还会一轮接一轮调用模型。算力再高,Token 吐得慢、延迟压不下来、功耗又高,数据中心照样难受。 成绩一出来,Reddit 很快就把 Jalapeño 和 NVIDIA Rubin 摆到了一起。有人认为它已经进入 Rubin 的效率区间,也有人认为测试条件、软件优化和整个平台形态没有对齐,现在还没法直接分高下。争论暂时停在这里,没有统一答案。 更巧的是,Jalapeño 并不是孤例。NVIDIA 正在把 Groq 3 LPU 拉进推理系统,专门处理 Token 生成;Google 也把 TPU 8 拆成偏训练和偏推理的两条路线。几家公司几乎在同一时间开始重新拆芯片的工作,背后那套硬件逻辑难道真的已经变了吗? 01 OpenAI 公布的数据里,Jal
发布时间:2026-08-28 15:27
抓取时间:2026-08-28 18:26
来源机构:雷峰网