llama.cpp b10826 发布:修复 CUDA 竞态条件
llama.cpp 发布 b10826 版本,主要修复了 CUDA 后端中 mmid 和 mmf 的竞态条件问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO 等。
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
llama.cpp 发布 b10826 版本,主要修复了 CUDA 后端中 mmid 和 mmf 的竞态条件问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO 等。
Hugging Face 上发布了由 ggml-org 转换的 NVIDIA Nemotron 3.5 Lightning 30B A3B 模型的 GGUF 量化版本,该模型基于 NVIDIA 的 BF16 版本,支持通过 llama.cpp 运行。此转换使得模型可以在本地设备上高效运行,扩大了其可用性。
英国AI基础设施公司Nscale成立仅两年,计划最早本月上市,并正洽谈额外35亿美元融资,包括向投资者出售15亿美元可转换债券及向英伟达寻求20亿美元融资。该公司3月完成由Aker领投的11亿美元B轮融资,并称其为欧洲史上最大B轮。近期与Anthropic签署约450亿美元大单,并据称向投资者展示约1030亿美元的未来收入预测。
另有 1 家信源报道
llama.cpp 发布 b10782 版本,主要修复了多 GPU 场景下 CUDA 图优化被跳过的问题,通过显式设置设备允许每个分片并发流。该版本提供了适用于多种平台和硬件的二进制文件,包括 macOS、Linux、Windows、Android 等。
llama.cpp 发布 b10776 版本,新增对 NVIDIA Nemotron-3-Puzzle-75B-A9B 模型的支持。该模型具有每层不同的专家 FFN 大小和 top-k 路由配置,为此引入了每层 n ff exp 和 n expert used 的数组支持,并扩展了 GGUF 键以接受标量或数组。同时更新了转换脚本以兼容官方 BF16 检查点
TechCrunch Disrupt 2026 将新增“Real World AI”舞台,聚焦人工智能与物理世界的融合,涵盖机器人、国防、太空和生物技术等领域。该舞台将邀请 Nvidia、Shield AI、Colossal Biosciences 等公司的负责人发表演讲,讨论机器人数据缺口、AI 安全部署、物种灭绝逆转等话题。活动将于 2026 年 10
llama.cpp 发布 b10751 版本,主要更新是在 CUDA 后端中融合了 MoE 加权专家归约操作,将多个内核合并为一个,以减少全局内存流量并提升性能。该融合支持未缩放和缩放两种图模式,并可通过环境变量禁用。同时发布了适用于多个平台和硬件的二进制文件。
苹果CEO库克卸任,转任执行董事长,约翰·特努斯接任,库克在内部信中表达对继任者的信心。东方甄选前CEO孙东旭宣布新公司美丽明天员工年假30天,引发热议。科大讯飞公关副总裁韩煜尘被解除职务,疑似涉及私德问题。字节上调豆包股价格至17.02元/股,主要面向大模型部门。快手旗下北京可灵获国家人工智能基金14亿元注资。华为上半年营收4678亿元,研发投入1214亿
Fastino Labs 与 NVIDIA 合作发布了 Fastino-Nemotron-3.5-Lightning-Healthcare,这是一个基于 NVIDIA Nemotron 3.5 Lightning 的 30B 参数、3B 激活的混合专家模型,专为医疗和生物医学应用设计。该模型在多个医疗基准上相比基础模型有显著提升,例如 HealthBench
llama.cpp 发布 b10728 版本,主要更新为 CUDA 后端中 Flash Attention 的 XOR swizzle 优化,将 K/V 共享内存改为 fp16 瓦片,并修复了 DGX Spark 上的共享内存竞争问题。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
llama.cpp 发布 b10718 版本,主要更新是将 CUDA 上的 MoE 融合扩展到 specdec 场景,此前 MOE glu 融合和 topk-router 融合仅限于单 token,现在支持多 token,并新增 SWIGLU CLAMP 案例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件
据The Information报道,OpenAI已购买数万台Mac mini和Mac Studio用于强化学习训练,Anthropic也通过AWS租用Mac mini进行类似任务,主要训练计算机使用智能体。Mac凭借统一内存和散热优势在本地AI领域崛起,英伟达将苹果视为最大竞争对手并推出DGX Spark应对。苹果面临供应短缺,但Mac销售额同比增长29%
另有 1 家信源报道
AI云公司Lambda通过摩根大通安排,获得10亿美元私人短期债务融资,用于购买英伟达AI芯片并租赁给微软。这是Lambda近期一系列债务融资的最新一笔,此前已获得10亿美元担保信贷额度和9.26亿美元贷款用于购买英伟达GB300 GPU。该公司还据报道在洽谈30亿美元的IPO前融资轮。
据传英伟达将以130亿美元收购开源AI模型平台Hugging Face,此前英伟达已与Poolside达成60亿美元协议,Stripe也以70多亿美元收购了OpenRouter。这些交易表明,科技巨头正通过收购开源AI公司来对冲对前沿实验室的依赖,并应对推理成本上升和自研芯片趋势。开源模型目前使用率较低,但因其成本效益和可定制性,未来可能被更多企业采用。
EdgeFirst 发布了 Model Zoo,提供在真实硬件上测量并公开验证的 YOLO 模型性能数据,覆盖多种 NPU 和平台。所有测量结果均可复现,并附有详细的验证会话链接。该资源旨在帮助开发者基于可验证的数据选择边缘 AI 加速器,而非依赖厂商宣称的 TOPS 值。
在 Hot Chips 37 大会上,OpenAI 发布了自研推理芯片 Jalapeño,宣称其能效和延迟优于 NVIDIA GB200/GB300,实测每瓦性能提升 1.5-1.9 倍,端到端延迟降低 1.7-3.6 倍,并计划年底部署。此外,多个研究强调 agent 的 harness 质量和记忆系统设计对性能影响重大,而 Perplexity 推出了本
OpenAI自研推理芯片「小辣椒」在SemiAnalysis的实测中,以700W功耗实现每瓦吞吐最高1.9倍于英伟达Blackwell,推理时延低3.6倍,在多个开源模型上击败英伟达、AMD和谷歌芯片。该芯片由博通合作设计,采用台积电N3P工艺和HBM4内存,计划2027年量产。尽管性能领先,OpenAI仍表示不会弃用英伟达,英伟达股价反而上涨2.19%。此
OpenAI在Hot Chips大会上展示了其首款自研推理芯片“Jalapeño”的基准测试结果,声称其在每瓦吞吐量和token延迟上优于Nvidia的Blackwell和Rubin芯片。该芯片由OpenAI与博通合作开发,历时约16个月,其中设计周期仅9个月,并使用了OpenAI自身的模型辅助设计。SemiAnalysis的测试显示,Jalapeño在性能
OpenAI 发布新款 AI 芯片 Jalapeño,宣称其推理性能优于 Nvidia 的 GB200/GB300 超级芯片,能效提升 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍。该芯片由 OpenAI 与 Broadcom 合作设计,专为 AI 推理优化,计划于今年年底小规模部署,2027 年扩大规模。OpenAI 表示不会完全替代现有
另有 2 家信源报道
llama.cpp 发布 b10610 版本,主要更新为缩短 CUDA 和 Metal 后端中虚拟设备的命名,并优化了 Metal 设备描述在初始化时的构建。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。