谷歌TPU跑Kimi比英伟达GPU快57%,用的还是DeepSeek推理框架
vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消
产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消
llama.cpp 发布 b11189 版本,主要变更是为 OpenCL 后端新增两个二进制 GEMM 内核(kernel gemm noshuffle q5 k f32 32b trans ila a8 bin 和 kernel gemm noshuffle q5 k q8 1 dp4a ila a8 bin),分别覆盖非 dp4a 与 dp4a 的 A8
llama.cpp 发布 b11188 版本,主要修复了旧版 GLSLC 编译器因不支持 cooperativeMatrix API 而导致的 Vulkan 构建问题。改动通过新增 GGML VULKAN COOPMAT GLSLC SUPPORT 宏检查、在创建前过滤不支持的 FA 两阶段内核,并将 Intel FA 着色器指针创建的锁保护移入 CM1 编
TechCrunch 的 Equity 播客讨论了 Meta 的个人 AI 代理 Muse 如何抢走 OpenAI 和 Anthropic 的风头。Anthropic 发布 Opus 5.5,OpenAI 在 90 分钟后更新 GPT-6,但据报道 Muse 的早期数据超过 ChatGPT,并将登陆智能眼镜和 Tamagotchi 风格设备。节目还讨论了 a
llama.cpp 发布 b11183 版本,主要变更是将 Metal 后端的 flash attention(fa)kernel 按数据类型拆分为独立库,并附带一处注释小修正。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
在2026杭州云栖大会期间,阿里巴巴千问办公集中发布软硬件全家桶:面向企业推出企业上下文、协作、应用和安全中心等更新,面向个人与线下场景发布AI Agent硬件QwenNote A2(售价1199元)和桌面机器人Eva(首发优惠价899元)。益海嘉里金龙鱼、一汽丰田等多家企业宣布接入千问办公。副总裁束骏亮受访表示,上下文将成为AI办公核心竞争点,AI办公真正
llama.cpp 发布 b11182 版本,核心变更是新增 llama prec policy 精度策略并引入模型驱动的 W4A4(4位权重/4位激活)推理路径(PR #24364),由 NVIDIA 工程师 ynankani 提交,Georgi Gerganov 等人参与评审。该改动涉及 ggml CUDA 后端 mmq.cu 的 MXFP4 调度调整,
AWS 博客介绍将 Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native Qumulo(CNQ)及 Cloud Data Fabric(CDF)结合的多区域训练方案,让训练计算与数据集分处不同 AWS Region 而无需复制数据。验证中,位于 us-west-2 的 spoke 集群通过 CDF 远程读取 us
TechCrunch 报道,由前 Google AlphaChip 负责人 Anna Goldie 和 Azalia Mirhoseini 创立的 Ricursive Intelligence 正在开发能自动设计芯片并从设计中学习的 AI 系统,目标是将芯片设计周期从两三年缩短到数周。两人此前在 Google 共同领导 AlphaChip,其成果曾用于多代
llama.cpp 发布 b11178 版本,集中修复 MUSA 后端(摩尔线程 MTT S5000 / PH1)的多个问题。改动包括:让 MUSA 使用 16 字节拷贝、启用 CUB 路径、采用上游代码路径、移除多余编译期守卫、在 PH1 上禁用 MMQ 路径,并修复 fused TOPK MOE 内核在 MUSA 上的死锁。修复后 27B 模型困惑度从
llama.cpp 发布 b11173 版本,主要修复 Metal 后端的图捕获(graph capture)逻辑:当图没有节点时提前返回,移除 capture compute 的冗余重置,在捕获错误信息中提示 METAL CAPTURE ENABLED=1,并向 ggml metal op init 传入 capture compute == 0 以仅在捕
llama.cpp 发布 b11172 版本,主要针对 Metal 后端优化稀疏 Flash Attention(sparse FA)并做代码清理,包括将稀疏 FA 索引缓存到共享内存、简化共享内存大小计算以及展开稀疏索引加载。该版本同时提供 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11166 版本,主要变更是为 CUDA 后端新增 CONV 2D DW 算子的 F16 内核支持(PR #29064)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,包含 CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO
NVIDIA 发布技术博客,介绍如何利用 Transformer Engine(TE)和 BioNeMo MoE recipe 高效训练生物基础模型。文章指出 MoE 架构虽能更高效扩展模型容量,但面临专家计算碎片化、路由通信开销和内存压力等瓶颈。TE 通过 GroupedLinear、MXFP8 低精度训练和融合 GroupedMLP 内核(整合量化、Sw
是石科技(METASTONE)推出自研的Meta-Infer高效部署引擎,通过内核补齐、算子优化与通信重构、并行与容量调优、缓存复用四类纯软件优化手段,在不改动模型结构和权重的前提下挖掘PCIe-Only GPU的推理潜力。在DeepSeek-V4.1-Flash上,8张PCIe显卡的输入吞吐从社区基线1932 tok/s提升至13274 tok/s,实现6
谷歌计划于10月1日通过SpaceX猎鹰9号火箭发射一颗搭载其Tensor Processing Unit(TPU)的卫星,作为Project Suncatcher实验计划的第一步,测试AI芯片在太空飞行、辐射和极端温度下的表现。谷歌的目标是最终将AI数据中心送入轨道,并计划明年再发射两颗卫星。项目高管Travis Beals表示,芯片在轨道上只能运行约15
据彭博社报道,Meta 计划于今年晚些时候推出的手持 AI 设备 Muse Charm 将能识别并与其他附近的 Charm 互动。该设备内置 5G 调制解调器,无需 Wi-Fi 即可连接 Muse AI,配备两英寸 OLED 触控屏、新操作系统、指纹传感器、摄像头、扬声器和麦克风,并可通过 iOS 或 Android 上的 Muse 应用设置。扎克伯格表示计
llama.cpp 发布 b11159 版本,主要修复了 Vulkan 后端在 conv 2d 和 conv 3d 卷积操作中的内存对齐(misalignment)问题,并修正了 test-backend-ops 的打印输出。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan、RO
llama.cpp 发布 b11158 版本,主要变更为在 Vulkan 后端为 Adreno GPU 调优 KHR cooperative matrix 支持(PR #29328),包括启用 coopmat 支持并修复 mul mat s。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
Telesin泰迅于2026年9月21日在深圳发布面向iPhone 18 Pro系列的大师影像套装,包含Classic经典版与Neo版两条产品线,以2X和3.5X双镜头覆盖约105mm人像与约400mm远摄,并配套手柄、供电、实体操控、彩焦App和镜头配件生态。上一代iPhone 17套装全球销量超10万套并进入全国3000多家Apple授权零售门店。新品计