返回主题地图

NVIDIA 英伟达

公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49

相关与对比厂商作为比较对象、合作方或受影响主体,当前共 94 条。
8月7日周五 · 1 条
标题相关提及命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp b10301 发布:修复 CUDA 警告并更新多平台构建

llama.cpp 发布 b10301 版本,主要修复了 CUDA 相关的未使用变量和函数警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO、SYCL 等。

8月4日周二 · 3 条
对比或关联对象命中实体:nvidia
THE DECODER商业

Anthropic 锁定 100 亿美元计算能力,来自新创云公司 Volta

Anthropic 与成立仅数月的云初创公司 Volta Infra Holdings 达成一项为期六年的 100 亿美元计算能力协议,该计算能力来自挪威 Tydal 的数据中心,由 Bitdeer Technologies 运营,使用 Nvidia 最新的 Vera Rubin 芯片。Volta 成立于 2026 年初,已获得 3 亿美元风险投资,估值达

另有 1 家信源报道

正文主语命中实体:nvidia
THE DECODER政策

硅谷分歧迫使白宫暂缓对中国AI模型的制裁计划

据《纽约时报》报道,特朗普政府曾考虑对中国开源权重AI模型(如月之暗面的Kimi K3)实施制裁和贸易禁令,指控其窃取美国技术。OpenAI和Anthropic支持限制,而英伟达、Meta、微软和谷歌等科技巨头强烈反对。在行业抵制后,政府暂时放弃强硬措施,转而专注于提升美国模型的竞争力。

对比或关联对象命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp b10242 发布:CUDA 后端新增惩罚采样器

llama.cpp 发布 b10242 版本,主要更新为 CUDA 后端新增 penalties sampler 支持,包括频率和存在惩罚的调整,并添加了相应的测试。该版本还提供了多种平台和硬件的二进制文件,如 macOS、Linux、Windows、Android 等。

8月3日周一 · 5 条
对比或关联对象命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp b10241 发布:修复 CUDA 数据竞争并优化性能

llama.cpp 发布 b10241 版本,主要修复了 CUDA 后端中 block reduce 复用共享内存时的数据竞争问题,并引入了双缓冲优化以提升 softmax 和 norm 操作的性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

对比或关联对象命中实体:blackwell
Together AI Blog一手来源研究

FlashAttention-4:面向不对称硬件扩展的算法与内核流水线协同设计

Together AI 发布了 FlashAttention-4,一种针对 Blackwell 架构不对称硬件扩展的注意力内核优化算法。该算法通过软件流水线、多项式近似指数函数和 2-CTA MMA 等技术,在 B200 上达到 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3 倍,比 Triton 快 2.7 倍。

对比或关联对象命中实体:nvidia
Together AI Blog一手来源产品发布

Together AI 发布 FlashAttention-4 等七项创新,强化 AI 云全栈能力

Together AI 在首届 AI Native Conf 上发布了七项研究和产品,涵盖内核、强化学习和算法推理优化。其中 FlashAttention-4 针对 NVIDIA Blackwell GPU 优化,速度比 Triton 快 2.7 倍;Together Megakernel 将实时语音代理的首 token 延迟从 281ms 降至 77ms;

对比或关联对象命中实体:nvidia
对比或关联对象命中实体:blackwell
Together AI Blog一手来源研究

Together AI 内核团队:从 FlashAttention 到 Blackwell 的突破

Together AI 的 kernels 团队在 2022 年通过 FlashAttention 实现了 2-3 倍加速,证明了 GPU 优化仍有巨大潜力。2025 年 3 月,该团队在获得 NVIDIA Blackwell GPU 后的一周内,利用 ThunderKittens 库开发出最快的 FP4/FP8 GEMM 内核,性能比 H100 上的 cu

8月2日周日 · 2 条
对比或关联对象命中实体:nvidia
Together AI Blog一手来源产品发布

Together AI 推出 Blackwell GPU 集群,训练速度提升90%

Together AI 宣布推出基于 NVIDIA Blackwell 平台的 GPU 集群,并配套优化的 AI 加速软件栈 Together Kernel Collection。该集群在训练 70B 参数模型时速度比 H100 快 90%,达到每节点每秒 15,200 tokens。Together AI 利用 ThunderKittens 框架开发了自定

对比或关联对象命中实体:nvidia
Together AI Blog一手来源商业

Together AI 完成 8 亿美元 C 轮融资,推动开源 AI 普及

Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。

7月29日周三 · 1 条
对比或关联对象命中实体:cuda
Berkeley AI Research Blog一手来源研究

K-Search 将 CUDA 内核专业知识迁移至 Apple Silicon

Berkeley AI Research 博客介绍了 K-Search 框架的扩展,该框架利用 AI 进化搜索优化 GPU 内核,并新增了针对 Apple Silicon 的 MLX 后端。通过结构化的 CUDA 到 MLX 翻译层,K-Search 能将 CUDA 内核知识库自动适配为高质量 MLX 内核,在注意力内核上达到 0.97 倍原生性能,在 Ma

6月6日周六 · 1 条
正文主语命中实体:nvidia
Ahead of AI研究

2026年上半年LLM研究论文精选清单

作者延续往年习惯,整理了2026年1月至5月期间值得关注的LLM研究论文清单,涵盖架构设计、推理效率、强化学习、智能体系统等多个类别。清单特别关注混合架构、状态空间模型、长上下文效率等趋势,并推荐了Nemotron 3等必读论文。作者强调这是个人精选而非完整列表,旨在帮助读者快速定位相关研究。

5月6日周三 · 1 条
对比或关联对象命中实体:cuda