返回主题地图

芯片与算力

产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月15日周二 · 3 条
正文结构化主题已通过公开置信门槛
TechCrunch AI商业

OpenAI 据报以逾3亿美元收购手机摄像头公司 Glass Imaging

据《华尔街日报》报道,OpenAI 以超过 3 亿美元收购了智能手机摄像头公司 Glass Imaging。Glass Imaging 成立于 2019 年,由两位前苹果工程师 Ziv Attar 和 Tom Bishop 创办,他们曾领导苹果人像模式的开发团队,该公司利用神经网络学习不同手机摄像头系统,在拍摄瞬间即产出更好图像。OpenAI 未立即回应置评

正文结构化主题已通过公开置信门槛
智东西商业

有研硅收购两家半导体材料公司,复牌股价一度大涨16%

科创板上市公司有研半导体硅材料股份公司(有研硅)于9月12日披露重组预案,拟收购山东有研艾斯71.89%股权和山东有研半导体14.98%股权,交易完成后两家公司将成为其全资子公司。9月14日复牌后股价盘中最高涨幅达16.92%,全天振幅33.64%,成交额约36.93亿元。此次整合使有研硅形成6英寸、8英寸、12英寸全尺寸半导体硅片产品矩阵,完成12英寸硅片

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

用 NVIDIA Transformer Engine 在 JAX 中加速无丢弃 MoE 训练

NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform

9月14日周一 · 5 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10956:SYCL 后端新增基数选择 TOP K

llama.cpp 发布 b10956 版本,为 SYCL 后端新增基于基数选择(radix select)的 TOP K 实现,解决了此前 k 32 时被迫回退 CPU 的限制。新实现将直方图而非候选集放入 SLM,使内存占用与 k 无关,并支持在行数不足时把单行拆分到多个工作组以充分利用设备。实测在 ne=[131072,1] k=2048 时相对 CP

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10952 发布:修复 SYCL oneDNN scratchpad 内存池释放顺序

llama.cpp 发布 b10952 版本,主要修复了 SYCL 后端中 oneDNN scratchpad 破坏内存池释放顺序的问题(PR #28704)。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10950:CUDA 后端在无 BF16 硬件加速设备上回退 F32

llama.cpp 发布 b10950 版本,主要变更是 ggml-cuda 后端在不支持 BF16 硬件加速的设备上回退到 F32 计算,覆盖 NVIDIA(Ampere 之前)以及 AMD(RDNA3 之前或 CDNA 之外)的 GPU。该改动由 Johannes Gäßler 贡献,并同时适用于 NVIDIA 平台。发布包涵盖 macOS、Linux、

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10948:WebGPU 测试排除 HY V4

llama.cpp 发布 b10948 版本,主要变更是将 HY V4 从 WebGPU 的 test-llama-archs 测试中排除(PR #28855,由 Stanisław Szymczyk 共同提交)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CUDA、V

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10944:修复 SYCL 内存获取错误

llama.cpp 发布 b10944 版本,主要修复 SYCL 后端获取内存时的错误(#28227),包括对不支持 ZES API 的处理、优化代码、调整日志级别、清理无用头文件,并修复检测 Level Zero SDK/开发包失败时的构建错误。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。

9月13日周日 · 2 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10938:Vulkan 队列提交驱动 bug 临时修复

llama.cpp 发布 b10938 版本,主要修复 Vulkan 后端的一个驱动 bug:当同一 VkDevice 上的两个队列同时提交时,会破坏内部同步。在驱动修复前,项目在 queuesubmit 周围加互斥锁作为临时方案。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10937:OpenCL 行对齐规则扩展至 q4 K/q5 K/q8 0

llama.cpp 发布 b10937 版本,主要变更是将 OpenCL 后端的 noshuffle 行对齐规则从仅适用于 q6 K 扩展到 q4 K、q5 K 和 q8 0 量化类型(PR #28575)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、

9月12日周六 · 5 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10929 发布:为 AMD GCN 添加 HIP 配置表

llama.cpp 发布 b10929 版本,主要变更是为 ggml-cuda 后端添加针对 AMD GCN 架构的 HIP 专用配置表(PR #27841)。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,包含 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。此次更新提升了 AM

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10921:修复 WebGPU 张量绑定对齐

llama.cpp 发布 b10921 版本,主要修复 WebGPU 后端张量绑定对齐问题:将绑定偏移回退到与张量距离为整数个块的位置,使块量化视图在着色器中获得有效的元素偏移。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。

正文结构化主题已通过公开置信门槛
智东西商业

火腿第一股1.74亿增资杭州光通信芯片创企中晟微

A股上市公司金字火腿的全资子公司福建金字半导体以1.74亿元完成对杭州光通信芯片公司中晟微电子的第二轮增资,两轮累计投资约2.74亿元,合计持股19.0002%,本轮投后估值约15.96亿元。中晟微电子聚焦400G/800G/1.6T及以上高速光模块核心电芯片(TIA、Driver、CDR等),已实现单波100G TIA/Driver量产出货。此举反映产业资

正文结构化主题已通过公开置信门槛
智东西开源

RunningHub 开源 H3 Lightning:视频生成提速约12倍

RunningHub 开源了 MiniMax H3 视频生成加速方案 H3 Lightning,通过 RH 后训练加速模型将生成步数从 50 步压缩至 9 步,并叠加 SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行优化,在 4 张 RTX 6000D 上把 5 秒视频生成耗时从 348.8

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
智东西商业

北京离子阱量子芯片创企维刻量光融资超亿元

北京离子阱量子计算公司维刻量光完成超亿元Pre-A轮融资,由九智资本领投,正轩资本、瀚晖资本跟投,资金用于产线扩大及整机建设。公司成立于2026年2月,脱胎于清华大学金奇奂团队,押注玻璃基QCCD路线,已实现531个离子晶格稳定囚禁,并开始小批量交付芯片与整机。其技术路线图从电集成到光电集成再到量子互联,重点探索QPU作为异构算力接入现有算力基础设施。

9月11日周五 · 5 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

NVIDIA 推出 Personal AI Router 测试版,跨本地设备分发 AI 推理任务

NVIDIA 推出 Personal AI Router(PAIR)测试版,可将局域网内多台电脑的推理能力聚合,自动把 AI 请求分发到各节点,主要面向本地多智能体工作负载。PAIR 通过代理接收请求、识别引擎与模型需求并选择合适节点执行,兼容 Ollama 和 LM Studio,无需改动现有架构。NVIDIA 演示显示,结合 RTX Spark、DGX

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10909:Metal 后端融合表重构与性能修复

llama.cpp 发布 b10909 版本,主要重构 Metal 后端的算子融合机制,将所有可融合模式统一到单张融合表(ggml-metal-fuse.cpp),供图优化器和算子编码器共用。修复了融合模式中输出索引使用相对索引导致 norm/MUL 融合被静默禁用、token 生成性能回退约 5% 的问题。新增 gated delta net 与 KV c

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10908:修复 Metal iq mul mv 内核线程闲置

llama.cpp 发布 b10908 版本,主要修复 Metal 后端中 iq mul mv 系列内核在 ne00 < 1024 时的线程闲置问题。改动将 #28086 的行切分方案推广到 iq1 s、iq1 m、iq2 xxs、iq2 xs、iq2 s 和 iq3 s 六个内核,并顺带优化了 src0 行指针偏移与 offset0 的折叠处理。该版本同时

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10903 发布:修复 Vulkan argsort 竞态与越界

llama.cpp 发布 b10903 版本,修复了 Vulkan 后端 argsort 中的竞态条件和越界访问问题(PR #28705),其中越界访问可能解释 CI 中的失败。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

优化跨部署栈的AI推理

戴尔技术团队发表论文,提出跨部署栈的AI推理优化统一分析框架。作者将部署分解为模型层(量化、剪枝、蒸馏)、编译器层(图融合、布局优化、内核自动调优)和系统层(动态批处理、准入控制、内存分层)三层分类法,并将部署形式化为精度、延迟、吞吐、内存和能耗的多目标约束优化问题。论文还提出证据协议以解决现有基准测试条件不可比的问题,并综合了边缘平台与数据中心GPU的实证