返回主题地图

芯片与算力

产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月21日周一 · 5 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11069:为 SM70 (Volta) 调整 MMVQ 到 MMQ 切换

llama.cpp 发布 b11069 版本,主要变更是针对 SM70(Volta)架构调整了 MMVQ 到 MMQ 的切换阈值(crossover),由 Yangyu Chen 提交并经 Johannes Gaessler 审阅。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11068:修复 macOS 27 SDK Metal 弃用警告

llama.cpp 发布 b11068 版本,主要修复了 macOS 27 SDK 下 Metal 后端的弃用警告(PR #29136)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
量子位商业

沙利文报告:商汤大装置居中国Neocloud市场第一

弗若斯特沙利文联合头豹研究院发布《中国全栈AI云服务市场报告 2026H1》,报告显示商汤大装置以近50%的市场份额位居中国Neocloud市场第一。报告将全栈AI云厂商分为综合云计算厂商与Neocloud两类,并指出2026年是Agentic AI元年,Agentic AI对算力要求较传统大模型提升10倍以上。商汤大装置强调端到端系统化能力、算电协同、国产

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11065:为 Gemma 4 调优 CUDA Flash Attention

llama.cpp 发布 b11065 版本,主要变更为针对 Gemma 4 在 Ampere 及更新架构 GPU 上调整 Flash Attention(FA)的 CUDA 实现(PR #29152)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulk

正文结构化主题已通过公开置信门槛
智东西商业

中国最大独立Token工厂硅基流动再融资,年内累计近29亿

AI基础设施企业硅基流动(SiliconFlow)宣布完成B+轮二期和C轮融资,投资方包括中国互联网投资基金、国新基金、中国移动链长基金等,2026年度累计融资金额近29亿元。融资将用于推理引擎、异构算力调度、模型与芯片适配等核心技术研发,强化Token供应平台能力并加快全球市场拓展。该公司成立于2023年,按2025年Token年吞吐量计是中国最大的独立生

9月20日周日 · 7 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11064:Metal 支持 dsv4 hc pre 任意 hc

llama.cpp 发布 b11064 版本,主要修复 Metal 后端 dsv4 hc pre 算子的问题:此前该算子通过 constexpr 将 hc 硬编码为 4,导致其他 hc 值被 supports op 拒绝并回退到 CPU。本次改动将 n hc 作为函数常量(FC DSV4 HC)传入,并为不同 n hc 生成流水线变体,同时新增 hc = 1

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11062:CUDA 为 qwen4 启用稀疏 flash attention

llama.cpp 发布 b11062 版本,主要变更是为 qwen4 在 CUDA 后端启用稀疏 flash attention(sparse fa),对应 PR #28770。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,包含 CUDA 12/13、Vulkan、ROCm

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 与 OpenAI 推出 GPT-5.6 Sol Ultrafast 模式

Cerebras 与 OpenAI 联合发布 Ultrafast Mode 服务层级,首先在 OpenAI API 中上线并由 Cerebras 提供算力支持,目前面向少数客户限量预览。该模式驱动 GPT-5.6 Sol,输出速度最高达每秒 750 tokens,且不牺牲质量。Cerebras 称在 Humanity's Last Exam 基准上,Ultr

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 在 Hot Chips 详解 CS-4 架构并预览 CS-5、CS-6 路线图

Cerebras 在 Hot Chips 2026 大会上深入介绍了 CS-4 加速器的系统架构,包括 Nexus 机架级平台、晶圆级引擎的供电与冷却设计,并预览了 CS-5 和 CS-6 路线图。CS-5 计划于 2027 年推出,目标在开源模型上实现每用户每秒 1 万输出 token,在万亿参数级前沿模型上实现每秒 5000 token 和每兆瓦每秒 3

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 以最高 750 token/秒服务 GPT-5.6 Sol

Cerebras 宣布为 OpenAI 的 GPT-5.6 Sol 提供 Ultrafast 模式,输出速度最高达每秒 750 个 token。该服务运行在 Cerebras WSE-3 晶圆级芯片上,模型架构、权重、精度、上下文配置和推理设置与标准 OpenAI 端点完全一致,未做蒸馏或量化。Cerebras 称在 GDP-Val 任务上完成速度比标准端点

正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源产品发布

Cerebras 发布 CS-4:号称业界最快 AI 加速器

Cerebras 发布第四代 AI 加速系统 CS-4,由三个 Wafer Scale Engine 3 Turbo 处理器构成,采用全新 Nexus 机架级平台架构。官方称其推理速度最高可达 GPU 系统的 30 倍,在超过 10 万亿参数模型上实现每秒 1000+ token,并原生支持分离式推理,可与 AMD Helios、AWS Trainium 等

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11055:hexagon 后端新增 GEGLU QUICK 支持

llama.cpp 发布 b11055 版本,主要变更为在 hexagon 后端新增对 GEGLU QUICK 的支持(PR #29114)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

9月19日周六 · 5 条
正文结构化主题已通过公开置信门槛
智东西商业

曝长鑫存储进军NAND闪存市场,市值逼近6万亿元

据路透社报道,三位知情人士透露中国DRAM头部厂商长鑫存储正准备进入NAND闪存市场,计划在北京新工厂建立NAND研发生产线并设立研究院,将与三星、SK海力士、美光等全球存储龙头竞争。此举背景是全球内存芯片持续短缺,AI服务器需求爆发推动行业进入紧缺周期,主要厂商资本支出优先投向DRAM和HBM,限制了NAND产能扩张。长鑫已与客户讨论NAND计划,包括一家

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11050:修复 Metal FA 支持检查

llama.cpp 发布 b11050 版本,主要修复了 Metal 后端 Flash Attention 支持检查的问题(#29122)。该版本同步提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11048:Metal 支持 qwen4exp HC 算子

llama.cpp 发布 b11048 版本,在 Metal 后端新增对 qwen4exp 所用 DSV4 HC 算子变体的支持,包括带逐元素 sigmoid 门控的 hc pre 以及使用恒等混合(comb 为 nullptr)的 hc post。该更新随版本一同提供 macOS、Linux、Windows、Android 等多平台预编译包。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11047 修复 CUDA CUB argsort 原地键损坏问题

llama.cpp 发布 b11047 版本,修复了 CUDA 后端中 CUB argsort 因原地键缓冲区导致的排序损坏问题。原实现将 d keys in 与 d keys out 指向同一缓冲区,违反 CUB 双缓冲要求,导致排序结果错乱并引发下游 get rows 越界读取。修复方案是在全部六个调用点使用独立的 keys-out 缓冲区,并同步提供各

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon SageMaker Inference 2026 年迄今新功能回顾

AWS 回顾了 Amazon SageMaker Inference 在 2026 年迄今发布的 13 项新能力,覆盖托管端点与 HyperPod Inference 两条部署路径。托管端点新增推理推荐与基准测试、容量感知实例池、OpenAI 兼容 API、容器缓存、可观测性、异步推理内联负载和前缀感知路由等七项功能。这些能力旨在降低生成式 AI 推理的部署

9月18日周五 · 3 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出 SageMaker HyperPod 推理网关

AWS 发布 Amazon SageMaker HyperPod Inference Gateway,这是一个以 EKS 托管插件形式部署的 Kubernetes 原生、GPU 感知推理路由系统。它通过 Envoy Gateway、Body-Based Router 和 Endpoint Picker 三层组件,利用 KV 缓存利用率、队列深度、LoRA 适

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

极壳发布四电机Halo外骨骼,与亦方创新争夺行业首创

消费级外骨骼公司极壳(Hypershell)在柏林IFA发布髋膝一体、四电机的Halo,创始版预售价15999元,预计2026年11月发货,并称其为行业首创髋膝一体化架构。文章指出,大疆背景的亦方创新早在4月已众筹同类四关节产品Vastnaut One,两家公司在产品、资本、人才与话语权上正面交锋。极壳正以10亿美元估值推进新一轮融资,但早期产品良品率约46

正文结构化主题已通过公开置信门槛