NVIDIA 发布 AIPerf:大规模 LLM 推理基准测试工具
NVIDIA 发布 AIPerf,作为 GenAI-Perf 的继任者,从零重写以解决 LLM 推理基准测试中客户端成为瓶颈的问题。AIPerf 采用多进程架构,通过 ZMQ 协调工作进程与结果处理服务,支持 15+ 端点类型、多种公开数据集和可调负载模式。文章以 Qwen3-0.6B 配合 vLLM 为例,演示了安装、启动服务及运行 profile 的完整
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
NVIDIA 发布 AIPerf,作为 GenAI-Perf 的继任者,从零重写以解决 LLM 推理基准测试中客户端成为瓶颈的问题。AIPerf 采用多进程架构,通过 ZMQ 协调工作进程与结果处理服务,支持 15+ 端点类型、多种公开数据集和可调负载模式。文章以 Qwen3-0.6B 配合 vLLM 为例,演示了安装、启动服务及运行 profile 的完整
英伟达开发者技术总监 Nader Khalil 与全球风投合作负责人 Sydney Sykes 将在 TechCrunch Disrupt 2026 的 Builders Stage 上就开源与闭源 AI 的取舍展开讨论。文章指出,开源模型进步迅速,英伟达称 ICML 2026 有 145 篇论文引用其 Nemotron 开源模型与数据集,而闭源前沿实验室仍
NVIDIA 技术博客介绍了一种用 AI 智能体为机器人仿真准备 3D 场景的工作流。该流程以 Codex(由 OpenAI GPT-6 Astra 驱动)作为主协调智能体,通过 NVIDIA NemoClaw 部署基于 Hermes 等框架的专用子智能体,调用 NVIDIA Omniverse Libraries(OpenUSD、ovphysx、ovrtx
NVIDIA 在 MLPerf Inference v6.1 Edge Agentic 基准测试中,用 TensorRT Edge-LLM 在单台 Jetson AGX Thor 上运行 Qwen3.6-27B,以 52.33 tokens/秒完成 1,007 轮 agent 工作负载,耗时 24 分 36 秒,比 llama.cpp 参考提交快 6.4 倍
NVIDIA 团队开发了一个 AI agent 技能,将 TileGym 中的 CUDA Tile Python 和 Triton-TileIR 内核翻译为 cuTile Rust。他们用该技能移植了全部 24 个公开 TileGym 算子(约 40 个 GPU 内核),平均达到 cuTile Python 性能的 99.5%。该多智能体流水线包含分析、设备
曼彻斯特大学David Topping团队利用NVIDIA Earth-2系列开放AI模型(CorrDiff、StormCast)在英国国家AI超算Isambard-AI上训练出覆盖全英的空气质量预测模型,训练仅用两天,分辨率达2-3平方公里。该模型可预测未来污染情景,并能在DGX Spark桌面AI系统上运行推理和小规模训练,团队计划开源训练数据与工作流,
英伟达创始人兼CEO黄仁勋在Salesforce Dreamforce大会上表示,AI只是由人类构建的硬件和软件,安全是工程问题而非法律问题,因此不需要新的AI监管法律,市场力量足以促使企业不发布不安全产品。他主张企业应自行把握发布节奏,并称创新、速度与安全并非二选一。文章同时指出,黄仁勋的立场与其在AI热潮中的商业利益相关,且历史上企业即使善意也可能发布有
在Salesforce Dreamforce大会上,NVIDIA创始人兼CEO黄仁勋与Salesforce CEO Marc Benioff同台,宣布Salesforce首个CRM推理模型Koa,该模型基于NVIDIA Nemotron 3 Super后训练而成。Koa完全在Salesforce自有基础设施上运行,训练和推理均未使用客户数据,已在Salesf
NVIDIA 技术博客对比了稠密模型与 MoE(混合专家)架构,解释 MoE 如何让 30B 参数模型每 token 仅激活约 3B 参数,并仍利用大模型容量。文章以 Nemotron 3.5 Lightning 为例,说明 MoE 通过路由网络为每个 token 选择部分专家 FFN,注意力与嵌入权重仍全量参与。核心结论是 MoE 将显存成本(总参数)与计
NVIDIA 在技术博客中介绍其 Vera Rubin 平台如何通过功耗管理实现高能效 AI 推理,核心是 NVIDIA Groq 3 LPX 的确定性执行模型。该模型让 LPU 编译器在运行前生成精确到时钟周期的执行调度,从而预测每个周期的电流需求,并借助 Preemptive Power(PEP)和 Clock Period Synthesis(CPS)
NVIDIA 在技术博客中介绍 NVLink 6 面向大规模 AI 工厂的多层弹性架构,覆盖物理层、链路层、系统冗余和应用软件层。物理层通过轻量级 FEC、物理层重传(PLR)和 UPHY 恢复实现无损传输,链路层采用基于信用的流控(CBFC)消除丢包,系统层消除单点故障,软件层提供 Dynamo Shadow Engine Recovery 和检查点恢复。
NVIDIA 发布技术博客,介绍 NVIDIA FLARE 如何通过两层架构将联邦学习中的持久化联邦服务与作业执行分离,使同一联邦中的不同站点可分别使用 Docker、Kubernetes 或 Slurm 作为执行后端。FLARE 2.8 已支持 Docker 和 Kubernetes 部署,2.9 新增 Slurm 支持。该设计让各站点保留对计算资源、数据
Salesforce 在 Dreamforce 大会上发布首个推理模型 Koa,基于 Nvidia 开源权重模型 Nemotron 后训练而成,专攻销售、营销和客服任务。Koa 以开源权重、不摄入客户数据、token 消耗更少等特性,作为 Agentforce 平台中 Claude、ChatGPT 等前沿模型的替代选项。Salesforce 高管称此前缺乏具
另有 1 家信源报道
NVIDIA 于 9 月 9 日公开了 Nemotron 3 Ultra 在 2026 年 IMO 上取得 30/42 分(超过 29 分金牌线)的完整数学推理系统,包括两个数学专家 checkpoint、SFT 与 RL 训练数据、推理代码、训练配方、提交证明及 200 道 Nemotron-IMO-Bench。该系统通过多 checkpoint 采样、p
费城儿童医院(CHOP)利用基于 MONAI 的开源 AI 工具,将儿童心脏建模从过去需数小时的人工操作缩短至数秒,用于先天性心脏病的术前规划。该服务已推广至美国 20 多家儿童医院,波士顿儿童医院每年约 500 例心脏手术借助建模完成。CHOP 还与 NVIDIA 合作,基于 Warp 和 Newton 物理引擎开发 GPU 加速的生物力学仿真,目标是将心
NVIDIA 发布了 Muse-Glimmer-30B 的 NVFP4 量化版本,该模型基于 Meta Superintelligence Lab 的 Muse-Glimmer-30B 稠密因果 Transformer,带有专用感知编码器,支持文本与图像交错输入,面向本地智能体任务。量化使用 NVIDIA Model Optimizer v0.46.0,采用
英伟达CEO黄仁勋在洛杉矶All-In峰会上演讲时接到美国总统特朗普的电话,并将通话设为免提让现场观众收听。两人在通话中一致反对放缓AI发展,特朗普称AI减速论是'骗局',黄仁勋表示认同。此前Anthropic CEO Dario Amodei曾呼吁放慢AI能力提升速度,马斯克和奥特曼公开表示赞同,而黄仁勋立场不同。
另有 1 家信源报道
NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform
Perplexity 将其本地智能体 Perplexity Computer 的便携版本 Portable Computer 扩展到 Windows 平台,支持配备 24GB 及以上显存的 NVIDIA GeForce RTX 和 RTX PRO 显卡。该版本由 NVIDIA GPU 加速,使用本地模型(如 Qwen 3.8 27B)在设备端分析数据、整合文
据路透社报道,英伟达正洽谈在 Anthropic 计划中的 IPO 中投资最多 100 亿美元,作为锚定投资者提前锁定股份。Anthropic 计划募资最多 1000 亿美元、估值约 2 万亿美元,将成为史上最大 IPO,预计在美国中期选举前完成。两家公司关系紧密:Anthropic 运行在英伟达 GPU 上,并于 2025 年承诺购买 300 亿美元搭载英