llama.cpp b11205:CUDA 支持 Nemotron 3 SSM scan
llama.cpp 发布 b11205 版本,主要变更是 CUDA 后端支持 Nemotron 3 的 Puzzle state size 96,用于 SSM scan。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
llama.cpp 发布 b11205 版本,主要变更是 CUDA 后端支持 Nemotron 3 的 Puzzle state size 96,用于 SSM scan。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11203 版本,主要变更为 CUDA 后端的 FWHT(快速沃尔什-哈达玛变换)内核新增 F16 输入支持。该改动将源数据类型改为模板参数,使内核可直接读取 F16 源而无需先转换为 F32 副本,原有 F32 路径保持不变。同时引入共享谓词 ggml cuda op mul mat use fwht,统一 supports o
英国 AI 云服务商 Nscale 在年内 IPO 前完成 33.6 亿美元可转换债券融资,由对冲基金 Third Point 领投,其中 23.6 亿美元可立即使用,现有投资方英伟达另提供 10 亿美元将于 11 月中旬到账。该公司上周提交 IPO 文件,预计在纽交所上市时估值达 350 亿美元,并计划在发行中募资 30 亿美元。Nscale 自两年前从澳
llama.cpp 发布 b11182 版本,核心变更是新增 llama prec policy 精度策略并引入模型驱动的 W4A4(4位权重/4位激活)推理路径(PR #24364),由 NVIDIA 工程师 ynankani 提交,Georgi Gerganov 等人参与评审。该改动涉及 ggml CUDA 后端 mmq.cu 的 MXFP4 调度调整,
llama.cpp 发布 b11166 版本,主要变更是为 CUDA 后端新增 CONV 2D DW 算子的 F16 内核支持(PR #29064)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,包含 CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO
英伟达CEO黄仁勋在《The Ezra Klein Show》播客中表示,AI可以帮助应对气候变化,但前提是必须先造成'巨大的痛苦和苦难',并将此比作手术前必须先切开病人。他主张未来数年仍需使用化石燃料,因为可持续能源不足。文章批评这种'加速主义'论调,指出黄仁勋个人财富约1926亿美元,不会承担其芯片工厂和数据中心高能耗带来的污染代价,而气候变化已导致珊瑚
llama.cpp 发布 b11157 版本,主要变更是为 CUDA 后端新增基于 implicit GEMM 的 conv3d 支持,并对其进行了细化、处理空 kernel 的情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
llama.cpp 发布 v0.5.0,重点提升后端性能与正确性、扩展模型覆盖并增强服务端/路由稳定性。新增 HRM-Text(DFM Mimir 1B)、MiMo-V2.6 与 HunyuanOCR 转换支持,升级 ggml 0.25.0,并加入多地址 HTTP 绑定、函数调用图像输出及多项聊天解析器/UI 修复。
llama.cpp 发布 b11140 版本,主要针对 CUDA 后端优化 DeepSeek-V4(dsv4)预填充阶段的 sparse-fa(稀疏 FlashAttention)。改动包括将 sparse mask 扫描的查询循环按 ncols1 模板化以在编译期确定循环边界,并把越界检查提升到主机端代码,使 49k 列稀疏解码形状下的扫描耗时从 46us
伦敦AI初创公司Basecamp Research完成1.4亿美元融资,投资方包括英伟达、Anthropic的Anthology Fund、NATO创新基金等,由S32领投。该公司利用来自雨林、海洋和温泉的遗传物质训练名为EDEN的生物AI模型,用于设计抗生素和细胞疗法工具。其CTO Phil Lorenz在采访中表示生物学问题远比语言复杂,公共基因组数据库
llama.cpp 发布 b11124 版本,主要修复了 CUDA 后端中 top-k MoE 算子应始终触发的问题(PR #28432)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
llama.cpp 发布 b11109 版本,主要修复了 Metal 后端中 mul mm id 的 src1 重缩放逻辑,将其置于 ggml prec 门控之下。同时,ggml-webgpu、CUDA 和 Vulkan 后端在 src1 精度为 F32 时拒绝 MUL MAT ID,并修正了 supports op 的返回值。该版本还提供了覆盖 macOS
llama.cpp 发布 b11090 版本,主要修复了 CUDA 后端在 sm 70(Volta 架构)上的 tile 编译错误。此前提交 1884824fd 引入的五参数 load ldmatrix 仅定义了 tile ,导致 Volta 的 tile 无法匹配;本次将 tile 形状泛化为 ,使非 swizzle 分支可转发到三参数加载器。该修复由 D
英伟达在埃及大埃及博物馆举办活动,展示埃及AI生态从赋能走向规模化落地,英伟达高管发表演讲并组织初创企业圆桌。埃及的英伟达深度学习学院学员一年内增长超十倍,Hassan Allam数据中心获牌照并计划投资约4亿美元建设数据中心。非洲AI基础设施快速扩张,多个AI工厂宣布或上线,Cassava、Stratos Lab、Nexus Core Systems等推进
llama.cpp 发布 b11071 版本,主要变更是将 Ubuntu CUDA 发布构建的 CUDA 版本升级到 13.4(PR #29202)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b11069 版本,主要变更是针对 SM70(Volta)架构调整了 MMVQ 到 MMQ 的切换阈值(crossover),由 Yangyu Chen 提交并经 Johannes Gaessler 审阅。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan
llama.cpp 发布 b11065 版本,主要变更为针对 Gemma 4 在 Ampere 及更新架构 GPU 上调整 Flash Attention(FA)的 CUDA 实现(PR #29152)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulk
MinerU 发布 4.0.5 版本,为表格模型新增可选 CUDA ONNX session,在可用时自动启用并加入推理阶段计时;同时统一 ONNX session 线程配置并支持环境变量回退,更新物化素材图片命名规范并改进图片分辨率处理,且将 docvortex 最低版本要求提升至 0.4.20。
llama.cpp 发布 b11062 版本,主要变更是为 qwen4 在 CUDA 后端启用稀疏 flash attention(sparse fa),对应 PR #28770。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,包含 CUDA 12/13、Vulkan、ROCm
Runway 发布视频生成模型 Gen-4.5,官方称其在 Artificial Analysis 文生视频基准上以 1247 Elo 分排名第一,在运动质量、提示词遵循和视觉保真度上达到领先水平。该模型基于 NVIDIA Hopper 和 Blackwell GPU 构建,在预训练数据效率与后训练技术上取得进展,并保持与 Gen-4 相当的速度、效率和订阅