llama.cpp b11157:CUDA 新增 implicit GEMM conv3d
llama.cpp 发布 b11157 版本,主要变更是为 CUDA 后端新增基于 implicit GEMM 的 conv3d 支持,并对其进行了细化、处理空 kernel 的情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11157 版本,主要变更是为 CUDA 后端新增基于 implicit GEMM 的 conv3d 支持,并对其进行了细化、处理空 kernel 的情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
Meta在Connect 2026上发布Muse个人智能体,支持语音、实时视频和邮件功能,并推出多款AI眼镜硬件,包括Ray-Ban Meta Gen 3、VR眼镜和Muse Charm钥匙扣设备。Muse已超越ChatGPT登上App Store榜首,但Meta仅预告未发布新前沿模型。此外,Meta收购了语音初创公司WaveForms AI,并发布Muse
Meta 正在为其新 AI 智能体 Muse 打造独立硬件设备 Muse Charm,CEO 马克·扎克伯格在 Meta Connect 发布会结尾短暂展示了该产品。该设备无需手机即可使用,外形类似无表带的智能手表,配有指纹传感器、摄像头和麦克风,计划今年 12 月假日季前发货,但目前仅制造了少量样机。Muse 智能体发布不到一个月,已能代用户执行操作,并新
另有 1 家信源报道
在2026骁龙峰会上,高通发布第六代骁龙8超级至尊版与第六代骁龙8至尊版两款2nm移动旗舰平台,总裁兼CEO安蒙提出从以手机为中心转向以智能体为中心。超级至尊版搭载最高5GHz的Oryon CPU、首次加入Matrix Cores的Adreno GPU,以及可端侧运行300亿参数MoE模型的Hexagon NPU,并与阶跃、无量火、江波龙合作完成StepEd
llama.cpp 发布 b11147 版本,主要变更为在 OpenCL 后端新增 A8 Q6 K 非 MoE 的 dp4a 二值化内核(PR #29057)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SY
NVIDIA 发布开源项目 NodeWright,用于在 Kubernetes 集群中声明式地配置和更新节点主机操作系统,同时不中断正在运行的工作负载。NodeWright 此前以 Skyhook 之名在 NVIDIA 内部生产环境运行,现正式开源并更名。它通过 operator、自定义资源和包三个组件,结合 PodDisruptionBudgets、节点选
Google 宣布 Google Beam 全球扩张,硬件以 HP Dimension with Google Beam 形式交付,覆盖美国、加拿大、英国、法国、德国和日本六国,并拥有 18 家渠道合作伙伴。Google 内部八周研究显示,使用 Beam 的团队连接感提升 50%,反馈被清晰理解容易度提升 33%,后续会议需求下降 21%。此外,Google
9月22日,乐其创新SmallRig联合36氪在深圳举办第三届全球影像场景产业大会,索尼、尼康、影石、荣耀、vivo等产业链品牌到场,主题为“连接·共生·新边界”。大会核心判断是影像定义权正从设备参数转向骑行、直播、短剧、航天等具体场景,并发布《2025-2026全球影像场景TOP12报告》,预计中国影像硬件市场从2025年1165亿元增至2030年1772
llama.cpp 发布 b11126 版本,主要变更为在 Vulkan 后端新增 IQ4 XS 量化格式的 MMQ/MMV 矩阵乘法内核并做性能优化。优化过程中针对 Intel A770 上 MMVQ 出现 27.3% 的 tg 性能回退,选择在 Intel 设备上禁用 IQ4 XS 的 MMVQ。该版本同时提供覆盖 macOS、Linux、Windows
llama.cpp 发布 b11125 版本,主要变更是 ggml-meta 解析多缓冲区视图(multi buffer views),并添加 TODO 以便在图分配器重构后重新审视。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
llama.cpp 发布 b11124 版本,主要修复了 CUDA 后端中 top-k MoE 算子应始终触发的问题(PR #28432)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
Google 为其开源 TPU 性能分析工具 XProf 新增了 Kernel Profiling 套件,使开发者能够查看自定义 Pallas 内核的周期级细节,而此前这些内核在 trace 中只是不透明的块。该套件提供编译器检查、Trace Viewer 的 LLO 数据以及硬件计数器采样三种层级,并支持外部事件触发实现亚微秒级捕获。在 tiled mat
llama.cpp 发布 b11122 版本,主要更新为 SYCL 后端扩展 MMVQ GLU 融合,支持混合量化类型,并新增 rms norm+scale 与 ssm conv+silu 融合。同时提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11121 版本,主要变更为 SYCL 后端新增对 get rows back 算子的支持,目前仅支持 fp32/fp16 精度,并同步更新了 ops.md 文档。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CUDA、Vulkan、ROC
9月22日,乐其创新SmallRig联合36氪在深圳举办第三届全球影像场景产业大会(2026),主题为“连接·共生·新边界”,索尼、尼康、影石、荣耀、vivo、适马、蓝箭航天等品牌参与。会上发布《2025-2026全球影像场景TOP12报告》,提出手机电影、专业机构下沉、创作者全民化、AI影像创作四个年度关键词,并援引数据称中国影像硬件市场规模将从2025年
作者独自用纯 Rust 在租用 GPU 上以 164 美元成本端到端预训练了一个约 0.4B 参数、以孟加拉语为主的语言模型,并记录了 Candle 与 Burn 两个 Rust ML 框架作为训练后端时的缺陷分类:Candle 有 5 个缺陷(包括融合核静默不产生梯度),Burn 有 3 个缺陷(包括反向传播吞吐仅约理论值 3%、核融合路径在数十亿参数规模
新泽西理工学院的研究者提出 LANTERN,一个由规范驱动的 WebGPU 动态一致性测试框架。它从 WebIDL 定义中提取语法 API 规则,并从自然语言规范文本中恢复命令顺序、对象生命周期等语义约束,据此对官方 CTS 测试进行变异,生成合法与故意非法的测试变体。研究者在 AddressSanitizer 插桩的 Chromium 上大规模执行这些测试
llama.cpp 发布 b11117 版本,主要变更是针对 HIP 后端优化 IQ2/IQ3 量化格式,使用 SWAR(寄存器内并行)技术以位操作实现 vsub4 和 vcmpne4 指令。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译
llama.cpp 发布 b11115 版本,主要变更为在 OpenCL 后端新增 A8 Q4 K 非 MoE 的 dp4a 二值化 GEMM 内核 kernel gemm noshuffle q4 k q8 1 dp4a ila a8 bin,并重命名了二值化内核选择辅助函数。该版本同时提供覆盖 macOS、iOS、Linux、Android、Window
高通在年度骁龙峰会上发布两款旗舰手机处理器 Snapdragon 8 Elite Gen 6 和 Snapdragon 8 Elite Extreme Gen 6,重点强化端侧 AI 能力。新芯片配备可运行最高 2 亿参数小模型的传感中枢,支持本地个人记录、说话人区分和语音进出式智能体;Extreme 版可在本地运行 300 亿参数的混合专家(MoE)模型。