返回主题地图

NVIDIA 英伟达

公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49

核心动态标题或摘要核心在讲该厂商及其模型,当前共 173 条。
8月29日周六 · 1 条
标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA TensorRT Model Connect:两命令部署开放模型

NVIDIA 发布了 TensorRT Model Connect,这是一个开源参考实现集合,旨在简化开放模型在 TensorRT 上的部署。用户可以通过两条命令将 Hugging Face 模型转换为原生 C++ 推理应用,无需深入编译器知识。该项目提供语义级和模块级 API,支持自定义 GPU 内核集成,并利用 AI 原生开发流程和夜间发布保持与开放模型

8月28日周五 · 3 条
摘要核心命中命中实体:nvidia
雷峰网 AI科技评论研究

Jalapeño 跑分炸场,GPU 推理路线开始分裂?

OpenAI 公布自研推理芯片 Jalapeño 的跑分数据,显示其在 Token 吞吐、延迟和能效上较现有方案有显著提升,引发与 NVIDIA Rubin 的对比讨论。同时,NVIDIA 将 Groq 3 LPU 引入推理系统,Google 推出训练和推理分离的 TPU 8t/8i,三家公司在推理硬件路线上出现分化。文章分析指出,推理负载中 Decode

标题直接命中命中实体:nvidia
The Verge AI观点

黄仁勋再称英伟达已实现AGI,但称其‘毫无意义’

英伟达CEO黄仁勋在财报电话会议上再次宣称公司已实现AGI,但随即称这一里程碑‘毫无意义’。他指出AGI定义模糊,强调AI真正重要的是产生实际价值和盈利。业界对AGI定义缺乏共识,各公司如OpenAI、Anthropic等均有不同解读,使得AGI概念难以衡量。

标题直接命中命中实体:nvidia
AWS Machine Learning Blog一手来源教程

AWS 与 NVIDIA 合作:利用 MPS 将 ASR 推理成本降低 75%

AWS、NVIDIA 与 Heidi Health 合作,展示了使用 NVIDIA CUDA MPS 和 Triton 推理服务器在 Amazon EC2 上优化 ASR 推理成本的方法。通过 MPS 并发执行,GPU 利用率从 15-20% 提升,使 GPU 实例需求从 16 个减少到 4 个,成本降低 75%,同时保持亚秒级延迟。该方案结合 ONNX R

8月27日周四 · 4 条
标题直接命中命中实体:nvidia
Latent Space商业

NVIDIA 130 亿美元收购 HuggingFace,GLM-5.3-Flash 发布

NVIDIA 以 130 亿美元收购 HuggingFace,约为其 1.5 亿美元 ARR 的 80 倍,较 2026 年 1 月 70 亿美元的报价近乎翻倍。同时,Z.ai 正式发布 GLM-5.3-Flash(即 Ox Alpha),这是一个 320B 总参数、18B 激活参数的 MIT 许可多模态模型,支持 1M 上下文,完全运行在中国 AI 芯片上

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA 发布 NVLink Fusion 与 NVHBM,提升定制 AI 基础设施性能

NVIDIA 发布了 NVLink Fusion 和 NVHBM 技术,旨在帮助超大规模企业和 AI 原生公司将其定制 XPU 和 CPU 集成到 NVIDIA AI 基础设施中。NVHBM 是定制 HBM 基底芯片技术,相比标准 HBM4e 可提供高达 30% 的带宽提升、25% 的计算芯片面积增加和 15% 的功耗降低。该技术通过减少内存接口面积和优化功

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源教程

NVIDIA 教程:用 AI 智能体训练跨实体机器人导航策略

NVIDIA 技术博客发布教程,介绍如何使用 AI 智能体驱动的 COMPASS 工作流训练跨实体机器人导航策略。该工作流通过编码智能体(如 Codex)自动完成依赖验证、场景准备、训练、诊断和评估,并以 Spot 机器人为参考,支持内置场景和 SAGE-10K 场景。COMPASS 框架利用预训练的 X-Mobility 策略和残差强化学习,减少重复训练成

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源模型发布

Qwen3.8-Flash-Next在NVIDIA GB300 NVL72上支持代理编码

阿里巴巴发布了Qwen3.8-Flash-Next模型权重,作为Qwen4架构的预览,供开发者实验和评估。该模型是一个多模态MoE模型,主模型125B参数,附加51B N-gram嵌入,每token激活6B参数,原生上下文窗口262,144 token,可通过YaRN扩展到1M。NVIDIA提供了Day 0功能支持,包括SGLang、vLLM和TensorR

8月26日周三 · 1 条
标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA Dynamo 影子引擎恢复:秒级恢复 LLM 推理容量

NVIDIA Dynamo 推出影子引擎恢复预览功能,通过 GPU 内存服务(GMS)在活动引擎旁保持一个完全初始化的空闲引擎,并共享权重,避免冷重启。在 GLM-5.2 双工作节点部署中,故障恢复时间从 283 秒降至 7.3 秒,提速约 39 倍。该功能解决了权重与进程绑定及初始化状态不可转移的问题,支持 vLLM、SGLang 和 TensorRT-L

8月25日周二 · 4 条
标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA 发布 CUDA Python 1.0:稳定 API 与统一平台访问

NVIDIA 发布 CUDA Python 1.0,提供从 Python 访问完整 CUDA 平台的官方支持,包括 cuda.core、cuda.compute、cuda.bindings 等组件。该版本引入语义化版本控制,确保 API 稳定性,并统一了 Python GPU 生态的基础层,使不同库(如 Numba、cuda.compute)能在同一 GPU

标题直接命中命中实体:nvidia
THE DECODER产品发布

英伟达称Groq 3 LPX比Cerebras快四倍,但对比有失公允

英伟达宣布其推理加速器Groq 3 LPX进入全面生产,该芯片针对AI代理的快速token生成进行了优化。在Artificial Analysis的基准测试中,该系统达到每秒3400个token,英伟达称其速度是竞争对手Cerebras的四倍。然而,专家指出该对比对英伟达有利,因为其架构需要至少64个芯片才能达到该结果,而Cerebras仅需一到两个加速器。

标题直接命中命中实体:nvidia
Hugging Face New and Trending Models一手来源模型发布

NVIDIA发布Cosmos3全模态世界模型系列

NVIDIA发布了Cosmos3系列全模态世界模型,包括Cosmos3-Edge、Nano、Super等多个版本,支持从文本、图像、视频和动作轨迹生成视频、图像、音频和动作输出,用于机器人、自动驾驶和智能空间等物理AI应用。该系列基于Mixture-of-Transformers架构,参数规模从4B到64B不等,并采用OpenMDW1.1许可证,可商用。

标题直接命中命中实体:nvidia
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布 Nemotron-3-Super 120B 混合架构大模型

NVIDIA 发布了 Nemotron-3-Super-120B-A12B-FP8 大型语言模型,采用 LatentMoE 混合架构,总参数 120B,激活参数 12B,支持最长 1M token 的上下文,并内置多 token 预测(MTP)以加速生成。该模型针对智能体工作流、长上下文推理和高吞吐量场景(如 IT 工单自动化)进行了优化,支持多种语言,并采

8月24日周一 · 7 条
标题直接命中命中实体:nvidia
Groq Blog一手来源产品发布

Groq率先部署NVIDIA Groq 3 LPX与Vera Rubin NVL72

Groq宣布将成为首批采用NVIDIA Groq 3 LPX和Vera Rubin NVL72的公司,以提升其AI推理云性能。该平台在基准测试中实现每秒3400个输出令牌,显著加速代理工作负载。Groq与Dell Technologies合作部署,旨在为全球开发者和企业提供大规模推理服务。

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA Spectrum-X 以太网:重写大规模 AI 网络规则

NVIDIA 发布了 Spectrum-X 以太网架构,专为大规模 AI 工厂设计,通过硬件加速的交换机和网卡协同设计,解决传统以太网在 AI 训练中的瓶颈。该架构采用自适应路由、硬件拥塞控制和平面负载均衡,在多租户场景下将训练步进时间稳定在 668 毫秒,而传统以太网在噪声流量下延迟至 1.18 秒。这显著提升了 AI 训练的性能和隔离性。

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源研究

NVIDIA Vera Rubin 和 Blackwell 树立代理式 AI 每瓦性能新标准

NVIDIA 技术博客介绍了 SemiAnalysis 的 AgentX 基准测试,用于评估 AI 基础设施在代理式编码推理中的性能。该基准通过重放真实编码代理会话,测量每兆瓦吞吐量等指标。NVIDIA 公布的预览结果显示,Vera Rubin NVL72 在 AgentX 工作负载下每兆瓦吞吐量比 GB300 NVL72 高出 30 倍,而 GB300 N

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA DSX MaxLPS:优化 AI 工厂每瓦性能

NVIDIA 发布了 DSX MaxLPS 技术套件,旨在提升 AI 工厂在固定电力预算下的吞吐量。该套件通过动态功率分配、软件优化和 45°C 温热水冷技术,将静态机架供电改为动态调度,可回收闲置功率并提升能效。其核心组件 Dynamic Power Software (DPS) 和 DSX Exchange 目前处于开发者预览阶段,有望显著提高 AI 数

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源研究

NVIDIA Vera CPU 应对代理型 AI 舰队挑战

NVIDIA 技术博客分析了代理型 AI 工作负载的轨迹特征,指出其高度可变且以顺序延迟为主。基于 163,594 个会话的遥测数据,超过 97% 的轨迹是独特的。NVIDIA Vera CPU 采用平衡架构,兼顾单线程性能与并发能力,以优化整个代理轨迹,相比最新竞争产品可提供高达 1.5 倍的代理性能,从而提升 AI 工厂的舰队经济性。

标题直接命中命中实体:nvidia
NVIDIA Technical Blog一手来源产品发布

NVIDIA BlueField-4 驱动 Scale-In 网络,加速代理式 AI 工厂基础设施

NVIDIA 推出第五大 AI 网络支柱 Scale-In,专为代理式 AI 工厂设计,由 BlueField-4 DPU、DOCA 软件和 Spectrum-X 以太网驱动,提供安全、多租户、高性能的数据访问和基础设施操作。该架构将南北向网络整合为统一加速域,减轻主机 CPU 负担,提升安全性和效率。BlueField-4 还支持 NVIDIA BlueF

标题直接命中命中实体:nvidia
THE DECODER商业

英伟达洽谈投资Perplexity,估值超300亿美元

英伟达正洽谈投资AI搜索公司Perplexity,估值超过300亿美元,较一年前上一轮融资高出50%以上。Perplexity的年化收入从2.5亿美元增至7.5亿美元,部分得益于其AI代理产品“Perplexity Computer”。该投资将巩固英伟达作为AI行业主要财务支持者的地位,其投资资金往往通过购买芯片回流。