d-Matrix详解3D-DRAM AI芯片:带宽超100TB/s,能效比HBM高10倍
原标题:d-Matrix详解3D-DRAM AI芯片:单卡带宽超100TB/s,能效比HBM高10倍
AI 摘要
在Hot Chips 2026大会上,AI推理芯片初创公司d-Matrix详细介绍了其Raptor 3D-DRAM加速器,该芯片采用台积电N4逻辑裸片与3D DRAM面对面堆叠,单卡带宽超100TB/s,能效比HBM高10倍。Raptor通过Stream Blocking、Stream Flipping和Bank Chaining等创新技术解决了带宽浪费、I/O功耗和高温可靠性问题,可支持3万亿参数模型和百万token上下文。该方案旨在突破AI推理中的内存墙瓶颈,但大规模商用仍需验证。
正文节选
芯东西(公众号:aichip001) 编译 | 崔嫄伟 编辑 | 陈骏达 芯东西9月4日消息,据ServeTheHome报道,8月23日,在全球顶级半导体架构研讨会Hot Chips 2026上,美国AI推理芯片初创d-Matrix系统性详解了Raptor 3D-DRAM生成式AI推理加速器的创新架构、堆叠方案与测试结果。Raptor 3D-DRAM采用台积电N4逻辑裸片与3D DRAM裸片面对面堆叠的架构,来解决AI推理中的内存容量与带宽双重瓶颈。 在硅面积基准对比中,Raptor的单位面积带宽达32.6GB/s/mm²,约为HBM4和NVIDIA Rubin R200的20倍;每GB/s功耗仅2.96mW,较HBM方案的40mW改善13.5倍。Raptor测试结果显示,Raptor 3D-DRAM可对3万亿参数量级模型提供百万token上下文的推理服务,多用户批处理情况下,平均每位用户的token吞吐量可达1000。 d-Matrix提出该方案的核心背景在于AI推理中内存墙的持续加剧。模型权重不断增长的同时,KV cache随上下文长度与批量大小的乘积扩张,在1百万token上下文