返回主题地图

芯片与算力

产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 7 条
正文结构化主题已通过公开置信门槛
量子位研究6

谷歌TPU跑Kimi比英伟达GPU快57%,用的还是DeepSeek推理框架

vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源9

llama.cpp b11189:OpenCL 新增 Q5 K A8 二进制 GEMM 内核

llama.cpp 发布 b11189 版本,主要变更是为 OpenCL 后端新增两个二进制 GEMM 内核(kernel gemm noshuffle q5 k f32 32b trans ila a8 bin 和 kernel gemm noshuffle q5 k q8 1 dp4a ila a8 bin),分别覆盖非 dp4a 与 dp4a 的 A8

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp b11188 修复旧版 GLSLC 的 Vulkan 构建问题

llama.cpp 发布 b11188 版本,主要修复了旧版 GLSLC 编译器因不支持 cooperativeMatrix API 而导致的 Vulkan 构建问题。改动通过新增 GGML VULKAN COOPMAT GLSLC SUPPORT 宏检查、在创建前过滤不支持的 FA 两阶段内核,并将 Intel FA 着色器指针创建的锁保护移入 CM1 编

正文结构化主题已通过公开置信门槛
TechCrunch AI观点2

Meta 的 Muse 抢走 OpenAI 和 Anthropic 的 AI 风头

TechCrunch 的 Equity 播客讨论了 Meta 的个人 AI 代理 Muse 如何抢走 OpenAI 和 Anthropic 的风头。Anthropic 发布 Opus 5.5,OpenAI 在 90 分钟后更新 GPT-6,但据报道 Muse 的早期数据超过 ChatGPT,并将登陆智能眼镜和 Tamagotchi 风格设备。节目还讨论了 a

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp b11183:Metal FA kernel 按数据类型拆分

llama.cpp 发布 b11183 版本,主要变更是将 Metal 后端的 flash attention(fa)kernel 按数据类型拆分为独立库,并附带一处注释小修正。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
智东西产品发布6

千问办公发布软硬全家桶,副总裁称AI办公赛点未到

在2026杭州云栖大会期间,阿里巴巴千问办公集中发布软硬件全家桶:面向企业推出企业上下文、协作、应用和安全中心等更新,面向个人与线下场景发布AI Agent硬件QwenNote A2(售价1199元)和桌面机器人Eva(首发优惠价899元)。益海嘉里金龙鱼、一汽丰田等多家企业宣布接入千问办公。副总裁束骏亮受访表示,上下文将成为AI办公核心竞争点,AI办公真正

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp b11182:新增精度策略与 W4A4 推理路径

llama.cpp 发布 b11182 版本,核心变更是新增 llama prec policy 精度策略并引入模型驱动的 W4A4(4位权重/4位激活)推理路径(PR #24364),由 NVIDIA 工程师 ynankani 提交,Georgi Gerganov 等人参与评审。该改动涉及 ggml CUDA 后端 mmq.cu 的 MXFP4 调度调整,

9月25日周五 · 6 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布12

SageMaker HyperPod 与 Qumulo 实现多区域训练

AWS 博客介绍将 Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native Qumulo(CNQ)及 Cloud Data Fabric(CDF)结合的多区域训练方案,让训练计算与数据集分处不同 AWS Region 而无需复制数据。验证中,位于 us-west-2 的 spoke 集群通过 CDF 远程读取 us

正文结构化主题已通过公开置信门槛
TechCrunch AI商业2

Ricursive Intelligence 谈 AI 何时开始设计自己的硬件

TechCrunch 报道,由前 Google AlphaChip 负责人 Anna Goldie 和 Azalia Mirhoseini 创立的 Ricursive Intelligence 正在开发能自动设计芯片并从设计中学习的 AI 系统,目标是将芯片设计周期从两三年缩短到数周。两人此前在 Google 共同领导 AlphaChip,其成果曾用于多代

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源7

llama.cpp b11178:修复 MUSA/MTT S5000 算子失败与构建问题

llama.cpp 发布 b11178 版本,集中修复 MUSA 后端(摩尔线程 MTT S5000 / PH1)的多个问题。改动包括:让 MUSA 使用 16 字节拷贝、启用 CUB 路径、采用上游代码路径、移除多余编译期守卫、在 PH1 上禁用 MMQ 路径,并修复 fused TOPK MOE 内核在 MUSA 上的死锁。修复后 27B 模型困惑度从

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp b11173 发布:修复 Metal 图捕获

llama.cpp 发布 b11173 版本,主要修复 Metal 后端的图捕获(graph capture)逻辑:当图没有节点时提前返回,移除 capture compute 的冗余重置,在捕获错误信息中提示 METAL CAPTURE ENABLED=1,并向 ggml metal op init 传入 capture compute == 0 以仅在捕

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp b11172:优化 Metal 稀疏 Flash Attention

llama.cpp 发布 b11172 版本,主要针对 Metal 后端优化稀疏 Flash Attention(sparse FA)并做代码清理,包括将稀疏 FA 索引缓存到共享内存、简化共享内存大小计算以及展开稀疏索引加载。该版本同时提供 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源4

llama.cpp b11166:CUDA 新增 CONV 2D DW 的 F16 内核支持

llama.cpp 发布 b11166 版本,主要变更是为 CUDA 后端新增 CONV 2D DW 算子的 F16 内核支持(PR #29064)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,包含 CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO

9月24日周四 · 7 条
正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程2

NVIDIA 博客:用 Transformer Engine 高效训练生物基础模型 MoE

NVIDIA 发布技术博客,介绍如何利用 Transformer Engine(TE)和 BioNeMo MoE recipe 高效训练生物基础模型。文章指出 MoE 架构虽能更高效扩展模型容量,但面临专家计算碎片化、路由通信开销和内存压力等瓶颈。TE 通过 GroupedLinear、MXFP8 低精度训练和融合 GroupedMLP 内核(整合量化、Sw

正文结构化主题已通过公开置信门槛
量子位产品发布2

PCIe显卡被低估:Meta-Infer软件优化让DeepSeek推理吞吐提升近7倍

是石科技(METASTONE)推出自研的Meta-Infer高效部署引擎,通过内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四类纯软件优化手段,在不改动模型结构和权重的前提下挖掘PCIe-Only GPU的推理潜力。在DeepSeek-V4.1-Flash上,8张PCIe显卡的输入吞吐从社区基线1932 tok/s提升至13274 tok/s,实现6

正文结构化主题已通过公开置信门槛
The Verge AI商业1

谷歌下周将发射搭载AI芯片的卫星

谷歌计划于10月1日通过SpaceX猎鹰9号火箭发射一颗搭载其Tensor Processing Unit(TPU)的卫星,作为Project Suncatcher实验计划的第一步,测试AI芯片在太空飞行、辐射和极端温度下的表现。谷歌的目标是最终将AI数据中心送入轨道,并计划明年再发射两颗卫星。项目高管Travis Beals表示,芯片在轨道上只能运行约15

正文结构化主题已通过公开置信门槛
The Verge AI产品发布2

Meta 的 Muse AI Charm 设备可相互互动

据彭博社报道,Meta 计划于今年晚些时候推出的手持 AI 设备 Muse Charm 将能识别并与其他附近的 Charm 互动。该设备内置 5G 调制解调器,无需 Wi-Fi 即可连接 Muse AI,配备两英寸 OLED 触控屏、新操作系统、指纹传感器、摄像头、扬声器和麦克风,并可通过 iOS 或 Android 上的 Muse 应用设置。扎克伯格表示计

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp b11159:修复 Vulkan 卷积对齐问题

llama.cpp 发布 b11159 版本,主要修复了 Vulkan 后端在 conv 2d 和 conv 3d 卷积操作中的内存对齐(misalignment)问题,并修正了 test-backend-ops 的打印输出。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan、RO

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp b11158:为 Adreno GPU 调优 Vulkan 协作矩阵支持

llama.cpp 发布 b11158 版本,主要变更为在 Vulkan 后端为 Adreno GPU 调优 KHR cooperative matrix 支持(PR #29328),包括启用 coopmat 支持并修复 mul mat s。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布2

Telesin发布iPhone 18大师影像套装Classic与Neo

Telesin泰迅于2026年9月21日在深圳发布面向iPhone 18 Pro系列的大师影像套装,包含Classic经典版与Neo版两条产品线,以2X和3.5X双镜头覆盖约105mm人像与约400mm远摄,并配套手柄、供电、实体操控、彩焦App和镜头配件生态。上一代iPhone 17套装全球销量超10万套并进入全国3000多家Apple授权零售门店。新品计