返回主题地图

芯片与算力

产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月2日周日 · 2 条
正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出 Blackwell GPU 集群,训练速度提升90%

Together AI 宣布推出基于 NVIDIA Blackwell 平台的 GPU 集群,并配套优化的 AI 加速软件栈 Together Kernel Collection。该集群在训练 70B 参数模型时速度比 H100 快 90%,达到每节点每秒 15,200 tokens。Together AI 利用 ThunderKittens 框架开发了自定

正文结构化主题已通过公开置信门槛
Groq Blog一手来源产品发布

Groq 揭秘 LPU 架构:如何无损加速万亿参数模型推理

Groq 在 GroqCloud 上预览了 Moonshot 的 Kimi K2 模型,并解释了其 LPU 架构如何通过 TruePoint 数值格式、SRAM 存储和静态调度等技术,在不损失精度的情况下实现万亿参数模型的快速推理。该架构通过选择性降低精度和优化内存层次,实现了比传统 GPU 更高的推理速度和更低的延迟。

5月15日周五 · 1 条
正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.21.0 发布:弃用 transformers v4,新增多项性能优化

vLLM 发布 v0.21.0 版本,包含 367 个提交,来自 202 位贡献者。该版本正式弃用 transformers v4,要求 C++20 编译器,并引入 KV 卸载与混合内存分配器集成、推理预算感知的投机解码、Blackwell 上的 TOKENSPEED MLA 后端等新特性。同时新增多种模型架构支持,并在性能、硬件支持(如 AMD ROCm、