返回主题地图

芯片与算力

产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月18日周五 · 1 条
正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Crusoe 融资 39 亿美元,估值达 309 亿,建模块化 AI 工厂

数据中心开发商 Crusoe 完成 39 亿美元 F 轮融资,估值升至 309 亿美元,由 Atreides Management、Mubadala Capital 和 Valor Equity Partners 联合领投,英伟达、Founders Fund、GIC、QIA、TPG 等参投。资金将用于现有数据中心项目(包括得州 Abilene 为 OpenA

9月17日周四 · 3 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

安芯724北京基地正式投产,聚焦GPU全生命周期服务

安芯724(柒贰肆安芯技术服务有限公司)于2026年9月16日在北京昌平未来星科能源谷智造产业园举行北京基地投产活动暨品牌发布会,宣布北京基地正式投产。该基地总面积约6000平方米,其中实验室及产线约3000平方米,配备BGA芯片级维修、X-Ray检测、老化测试等设备,可提供GPU及AI算力服务器的检测、维修、测试、维保与性能优化服务。公司定位为高端AI算力

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

在 Amazon EKS 上使用 NVRx 实现容错分布式训练

AWS Machine Learning Blog 发布技术文章,介绍如何在 Amazon EKS 上结合 NVIDIA Resiliency Extension (NVRx) 实现容错的 PyTorch FSDP 分布式训练。方案通过异步检查点、进程内重启和 ft launcher 作业内重启三层机制,分别应对软故障、硬故障和节点丢失,并在 H100 GP

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源开源

NVIDIA 用 AI Agent 将 CUDA Tile 内核从 Python 翻译为 Rust

NVIDIA 团队开发了一个 AI agent 技能,将 TileGym 中的 CUDA Tile Python 和 Triton-TileIR 内核翻译为 cuTile Rust。他们用该技能移植了全部 24 个公开 TileGym 算子(约 40 个 GPU 内核),平均达到 cuTile Python 性能的 99.5%。该多智能体流水线包含分析、设备

9月16日周三 · 9 条
正文结构化主题已通过公开置信门槛
MIT Technology Review AI商业

Syensqo:AI推动材料创新,材料反哺AI基础设施

Syensqo首席技术与创新官Mike Finelli在MIT Technology Review的Business Lab节目中表示,AI发展正把半导体和数据中心推向物理极限,对先进材料在耐高温、纯度、电气性能、散热等方面提出更高要求。Syensqo正为高压数据中心架构、半导体制造密封材料及浸没式冷却液等开发材料,并利用AI智能体数字化合成数百万种分子组合

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10995:Vulkan MUL MAT ID BN/2 尾部分支改为无条件

llama.cpp 发布 b10995 版本,主要变更是让 Vulkan 后端的 MUL MAT ID BN/2 尾部分支变为无条件启用,将 BN/2 设为默认并作为 BNover4 的禁用回退,同时移除该分支的启用门控;BN/4 分支仍由 enable smaller matrices 控制。该版本同时提供 macOS、Linux、Windows、Andr

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 修复 Metal mul mm id 激活超 f16 范围导致的 NaN

llama.cpp 修复了 Metal 后端 mul mm id 算子在激活值超出 f16 范围(65504)时产生 NaN 的问题。原因是 simdgroup MMA 将 src1 窄化为 half 导致 inf 并污染整个 8x8 累加器,修复方式是按 2 的幂对 src1 重新缩放并在存储时还原,保证结果精确且对现有模型比特级一致。该缺陷曾导致 Mis

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10993 发布:为 hf-jobs 添加自托管 WebGPU 与 Vulkan

llama.cpp 发布 b10993 版本,主要变更是为 hf-jobs 添加自托管的 WebGPU 和 Vulkan 后端,并调整 CPU 后端线程数。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制,支持 CUDA、ROCm、Vulkan、SYCL、OpenVINO 等多种加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10989:为 ROCm 启用 HIP AllReduce

llama.cpp 发布 b10989 版本,主要变更为在 HIP 后端为 ROCm 启用 AllReduce(PR #27825)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。此次更新提升了

正文结构化主题已通过公开置信门槛
智东西研究

国产MCV模式5公里10天预报1小时算完,曙光8000支撑

中国气象局地球系统数值预报中心与中科曙光联合宣布,我国自主研发的下一代天气-气候一体化模式MCV实现全球5公里分辨率、未来10天预报在1小时内完成计算,超越欧洲中心IFS约9公里的业务运行最高水平。该成果依托首个全国产十万卡AI超集群曙光8000,完成动力、物理、插值等全模式异构移植与系统级优化,标志国产异构计算平台从科研验证走向国家级业务系统支撑,并有望服

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA Groq 3 LPX 确定性执行如何驱动高能效推理

NVIDIA 在技术博客中介绍其 Vera Rubin 平台如何通过功耗管理实现高能效 AI 推理,核心是 NVIDIA Groq 3 LPX 的确定性执行模型。该模型让 LPU 编译器在运行前生成精确到时钟周期的执行调度,从而预测每个周期的电流需求,并借助 Preemptive Power(PEP)和 Clock Period Synthesis(CPS)

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 为 SageMaker AI 训练作业推出实例偏好列表

AWS 为 Amazon SageMaker AI 训练和 Processing 作业推出实例偏好列表功能,用户可在创建作业时按优先级指定最多五种可接受的实例类型。SageMaker 会按顺序自动评估并选择首个有可用容量的实例类型启动作业,无需手动重试脚本或轮询。该功能还支持与 Flexible Training Plans 预留容量集成,优先使用预留容量,

9月15日周二 · 7 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA FLARE 跨 Docker、Kubernetes 和 Slurm 扩展联邦学习

NVIDIA 发布技术博客,介绍 NVIDIA FLARE 如何通过两层架构将联邦学习中的持久化联邦服务与作业执行分离,使同一联邦中的不同站点可分别使用 Docker、Kubernetes 或 Slurm 作为执行后端。FLARE 2.8 已支持 Docker 和 Kubernetes 部署,2.9 新增 Slurm 支持。该设计让各站点保留对计算资源、数据

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10984:CUDA 支持行连续 SUM ROWS

llama.cpp 发布 b10984 版本,主要更新为 CUDA 后端支持行连续的 SUM ROWS 操作,并整理代码、新增 GGML OP MEAN 以复用同一共享内核处理行连续张量,同时为 MEAN 的 permute/slice 添加测试。该版本同步提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

联发科发布天玑9600 Pro:2nm制程首创AI原生架构

联发科正式发布新一代旗舰移动平台天玑9600 Pro,这是天玑首款Pro旗舰,率先采用台积电2nm制程,并首创AI原生架构,将CPU、GPU、NPU、ISP等异构计算核心整合为系统级融合计算架构。该平台搭载2+3+3全大核CPU、双NPU架构、天玑神经网络渲染架构及智能影像架构,支持端侧运行最高30B MoE大模型,并与vivo、OPPO、阶跃星辰合作落地主

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10981:优化 OpenVINO 有状态解码与 GPU MoE 推理

llama.cpp 发布 b10981 版本,主要针对 OpenVINO 后端进行优化,涵盖有状态解码、GPU MoE 推理、KV 状态重排、RoPE 与归一化翻译等。修复了 Gemma-4 等模型因逐层 KV 头数/头尺寸差异导致解码乱码的问题,并拒绝无法从 KV 状态恢复的有状态解码。性能上,GPU 上 gemma-4-12B 在深度 8192 时从 6

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10980 发布:OpenCL 新增通用 ssm scan

llama.cpp 发布 b10980 版本,主要变更是为 OpenCL 后端新增通用的 ssm scan 算子(PR #28881),并修复了空白字符问题。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows、openEuler 等多平台的预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10978:Metal 新增支持 MiniCPM3 的 FA 内核

llama.cpp 发布 b10978 版本,为 Metal 后端新增了 HSK=96、HSV=64 的 Flash Attention 内核,以支持 MiniCPM3 模型。此前 MiniCPM3 将 attention.key length 设为 96 且 value length 默认为 64,Metal 缺少 (96,64) 实例化导致 -fa au

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

Arm发布Neoverse CSS N4与AI Portal,布局智能体算力平台

Arm在Arm Everywhere China年度大会上发布Neoverse CSS N4平台,并展示Arm AGI CPU在中国生态的进展。Arm称AGI CPU在同等性能下TDP为300瓦,而x86方案通常为500瓦,可缓解数据中心电力与机架空间压力。同时Arm上线Arm AI Portal开发者平台,首批预优化模型包括通义千问、Google Gemm