llama.cpp b11047 修复 CUDA CUB argsort 原地键损坏问题
llama.cpp 发布 b11047 版本,修复了 CUDA 后端中 CUB argsort 因原地键缓冲区导致的排序损坏问题。原实现将 d keys in 与 d keys out 指向同一缓冲区,违反 CUB 双缓冲要求,导致排序结果错乱并引发下游 get rows 越界读取。修复方案是在全部六个调用点使用独立的 keys-out 缓冲区,并同步提供各
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
llama.cpp 发布 b11047 版本,修复了 CUDA 后端中 CUB argsort 因原地键缓冲区导致的排序损坏问题。原实现将 d keys in 与 d keys out 指向同一缓冲区,违反 CUB 双缓冲要求,导致排序结果错乱并引发下游 get rows 越界读取。修复方案是在全部六个调用点使用独立的 keys-out 缓冲区,并同步提供各
Anthropic CEO Dario Amodei 提出“Pace the Frontier”计划,主张依靠独立安全评估机构以及民主国家 AI 实验室之间的协调来推进 AI 发展。该提案已获得部分行业支持,但也遭到 Nvidia CEO Jensen Huang 的尖锐反对。TechCrunch 的 Equity 播客讨论了各公司能否就“放缓”的定义达成一
Anthropic CEO Dario Amodei 提出“pace the frontier”计划,主张依靠独立安全评估机构和民主国家 AI 实验室之间的协调来放缓 AI 发展,该提议已获得部分行业支持,但遭到 Nvidia CEO Jensen Huang 的尖锐反对。TechCrunch Equity 播客讨论了各公司能否就“放缓”的定义达成一致以及由
数据中心开发商 Crusoe 完成 39 亿美元 F 轮融资,估值升至 309 亿美元,由 Atreides Management、Mubadala Capital 和 Valor Equity Partners 联合领投,英伟达、Founders Fund、GIC、QIA、TPG 等参投。资金将用于现有数据中心项目(包括得州 Abilene 为 OpenA
据The Information报道,英伟达和Booz Allen Hamilton等公司因Anthropic在6月更改政策、将Fable使用日志保留30天,而限制该模型用于敏感工作,英伟达转而使用自研Nemotron模型。Palantir也阻止客户通过其软件部署Fable,直到获得不可撤销的零数据保留保证。OpenAI和Anthropic随后推出让客户自行
llama.cpp 发布 b10984 版本,主要更新为 CUDA 后端支持行连续的 SUM ROWS 操作,并整理代码、新增 GGML OP MEAN 以复用同一共享内核处理行连续张量,同时为 MEAN 的 permute/slice 添加测试。该版本同步提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。
Agility Robotics 发布新一代人形机器人 Digit 5,可在仓库和工厂中无需安全围栏与人协同工作,依靠 AI 和传感器识别人员并停止或让开,同时发出视觉和音频警示。Digit 5 是 Nvidia 机器人安全平台 Halos 的首个合作伙伴,载重提升至 22.7 公斤,电池 9 分钟充电可运行 90 分钟,支持每天超 20 小时工作。公司称
llama.cpp 发布 b10977 版本,主要变更是将 Windows x64 平台的 CUDA 构建版本升级到 13.4.1。该版本同时提供 macOS、Linux、Android、Windows 等多平台预编译包,覆盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
英伟达CEO黄仁勋在洛杉矶All-In大会上现场接到特朗普的电话,两人就AI安全话题交谈,特朗普称对AI的担忧是“骗局”,认为真正的赢家是中国和“政治人物”,并称AI“比互联网还大”不应放缓。黄仁勋用来接电话的是苹果尚未发售的新款折叠手机,售价1999美元,距上市还有五周。文章指出,英伟达的商业模式依赖AI实验室购买更多芯片,因此淡化AI风险符合其利益,而苹
英伟达 CEO 黄仁勋在 All-In Summit 舞台上用免提电话连线美国总统特朗普。特朗普在通话中将近期对 AI 发展的担忧称为“骗局”,并宣称“机器人不会接管世界”。此前 Anthropic CEO Dario Amodei 发表长文《We Must Pace the Frontier》呼吁放缓 AI 发展并加强政府协调,特朗普随后在 Truth S
另有 1 家信源报道
llama.cpp 发布 b10950 版本,主要变更是 ggml-cuda 后端在不支持 BF16 硬件加速的设备上回退到 F32 计算,覆盖 NVIDIA(Ampere 之前)以及 AMD(RDNA3 之前或 CDNA 之外)的 GPU。该改动由 Johannes Gäßler 贡献,并同时适用于 NVIDIA 平台。发布包涵盖 macOS、Linux、
llama.cpp 发布 b10905 版本,主要更新为 CUDA/HIP 上的 Flash Attention 调优(针对 gfx1201)。该改动在 RDNA4 上为 head size 256 启用 mma Flash Attention 并调整配置,同时在 AMD WMMA 上优先使用整块 tile 的 FA 网格而非 stream-k,并修订了 s
戴尔技术团队发表论文,提出跨部署栈的AI推理优化统一分析框架。作者将部署分解为模型层(量化、剪枝、蒸馏)、编译器层(图融合、布局优化、内核自动调优)和系统层(动态批处理、准入控制、内存分层)三层分类法,并将部署形式化为精度、延迟、吞吐、内存和能耗的多目标约束优化问题。论文还提出证据协议以解决现有基准测试条件不可比的问题,并综合了边缘平台与数据中心GPU的实证
llama.cpp 发布 b10897 版本,主要更新是将 Windows ARM64 平台的 CUDA 13.4 构建从 Developer Preview 归档迁移到 13.4.1 GA 可再发行组件。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、OpenV
Hugging Face 用户 handy-computer 发布了 NVIDIA parakeet-unified-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的 FastConformer 编码器加 RNN-T 解码器的英文语音识别模型,支持离线与缓冲流式两种模式。量化版本在 Libri
Hugging Face 用户 handy-computer 发布了 NVIDIA nemotron-speech-streaming-en-0.6b 的 GGUF 量化版本,供 transcribe.cpp 推理框架使用。该模型是 0.6B 参数的缓存感知流式 FastConformer-RNNT 英文语音识别模型,支持离线与流式两种模式,并提供 F32
llama.cpp 发布 b10876 版本,主要更新为 CUDA 后端将 GGML FA ALL QUANTS 替换为 GGML FA QUANTS,提供更细粒度的编译控制,并为未编译的组合添加运行时回退与警告。该版本同时提供了面向多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
AWS 在 SageMaker AI 上对 30B MoE 模型(Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B)进行了 G7(Blackwell)与 G5、G6、G6e 实例的推理基准测试。结果显示,G7 凭借原生 FP4 支持和更高内存带宽,在吞吐量、延迟和成本效益上优于前代实例。文章介绍了使用 SageMake
Mistral AI 完成了30亿欧元的D轮融资,估值超过210亿欧元,成为欧洲科技公司史上最大规模的股权融资。三星电子领投,EQT 和 PSG Equity 联合领投,现有投资者如 a16z、英伟达、ASML 等也参与其中。尽管其模型性能落后于竞争对手,但公司专注于企业市场,服务 Airbus、ASML 和 HSBC 等客户,并受益于欧洲客户减少对美国供应
另有 1 家信源报道
llama.cpp 发布 b10840 版本,主要更新包括在 CUDA 后端为 Q4 K/Q5 K 量化模型引入无分支解包以加速 mmvq 操作,并针对 DGX Spark 添加 L2 预取优化。该改动在批量大小大于 1 时提升性能,并调整了切换点以适应更多模型。同时提供了多平台二进制下载。