llama.cpp b10301 发布:修复 CUDA 警告并更新多平台构建
llama.cpp 发布 b10301 版本,主要修复了 CUDA 相关的未使用变量和函数警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO、SYCL 等。
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
llama.cpp 发布 b10301 版本,主要修复了 CUDA 相关的未使用变量和函数警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO、SYCL 等。
Anthropic 与成立仅数月的云初创公司 Volta Infra Holdings 达成一项为期六年的 100 亿美元计算能力协议,该计算能力来自挪威 Tydal 的数据中心,由 Bitdeer Technologies 运营,使用 Nvidia 最新的 Vera Rubin 芯片。Volta 成立于 2026 年初,已获得 3 亿美元风险投资,估值达
另有 1 家信源报道
据《纽约时报》报道,特朗普政府曾考虑对中国开源权重AI模型(如月之暗面的Kimi K3)实施制裁和贸易禁令,指控其窃取美国技术。OpenAI和Anthropic支持限制,而英伟达、Meta、微软和谷歌等科技巨头强烈反对。在行业抵制后,政府暂时放弃强硬措施,转而专注于提升美国模型的竞争力。
llama.cpp 发布 b10242 版本,主要更新为 CUDA 后端新增 penalties sampler 支持,包括频率和存在惩罚的调整,并添加了相应的测试。该版本还提供了多种平台和硬件的二进制文件,如 macOS、Linux、Windows、Android 等。
llama.cpp 发布 b10241 版本,主要修复了 CUDA 后端中 block reduce 复用共享内存时的数据竞争问题,并引入了双缓冲优化以提升 softmax 和 norm 操作的性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
Together AI 发布了 FlashAttention-4,一种针对 Blackwell 架构不对称硬件扩展的注意力内核优化算法。该算法通过软件流水线、多项式近似指数函数和 2-CTA MMA 等技术,在 B200 上达到 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3 倍,比 Triton 快 2.7 倍。
Together AI 在首届 AI Native Conf 上发布了七项研究和产品,涵盖内核、强化学习和算法推理优化。其中 FlashAttention-4 针对 NVIDIA Blackwell GPU 优化,速度比 Triton 快 2.7 倍;Together Megakernel 将实时语音代理的首 token 延迟从 281ms 降至 77ms;
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,包括采用 NVIDIA Dynamo 1.0 优化推理、通过 NVIDIA OpenShell 集成 NemoClaw、支持 NVIDIA Nemotron 3 Super 模型用于多智能体工作流,并在模型库中新增 NVIDIA Parakeet TDT 0.6B V3 语
Together AI 的 kernels 团队在 2022 年通过 FlashAttention 实现了 2-3 倍加速,证明了 GPU 优化仍有巨大潜力。2025 年 3 月,该团队在获得 NVIDIA Blackwell GPU 后的一周内,利用 ThunderKittens 库开发出最快的 FP4/FP8 GEMM 内核,性能比 H100 上的 cu
Together AI 宣布推出基于 NVIDIA Blackwell 平台的 GPU 集群,并配套优化的 AI 加速软件栈 Together Kernel Collection。该集群在训练 70B 参数模型时速度比 H100 快 90%,达到每节点每秒 15,200 tokens。Together AI 利用 ThunderKittens 框架开发了自定
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。
Berkeley AI Research 博客介绍了 K-Search 框架的扩展,该框架利用 AI 进化搜索优化 GPU 内核,并新增了针对 Apple Silicon 的 MLX 后端。通过结构化的 CUDA 到 MLX 翻译层,K-Search 能将 CUDA 内核知识库自动适配为高质量 MLX 内核,在注意力内核上达到 0.97 倍原生性能,在 Ma
作者延续往年习惯,整理了2026年1月至5月期间值得关注的LLM研究论文清单,涵盖架构设计、推理效率、强化学习、智能体系统等多个类别。清单特别关注混合架构、状态空间模型、长上下文效率等趋势,并推荐了Nemotron 3等必读论文。作者强调这是个人精选而非完整列表,旨在帮助读者快速定位相关研究。
SGLang 发布 v0.5.11 版本,默认 CUDA 版本升级至 13.0,PyTorch 升级至 2.11,并默认启用 Speculative Decoding V2 以降低 CPU 开销。该版本新增了对 Gemma 4、GLM-5.1、Qwen3.6、MiMo-V2.5、Kimi-K2.6 等新模型的支持,并增强了 PD 分离场景下的解码端 Radi