内存短缺推高英伟达AI服务器价格约15%
据彭博社报道,由于内存短缺,搭载英伟达AI芯片的服务器价格将上涨超过15%,受影响的产品包括Vera Rubin和Grace Blackwell系统。价格上涨的主要原因是三星、SK海力士和美光生产的DRAM成本上升,涨价将影响明年初的出货。为微软、谷歌和甲骨文制造服务器的合同制造商已通知客户,英伟达未予置评。
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
据彭博社报道,由于内存短缺,搭载英伟达AI芯片的服务器价格将上涨超过15%,受影响的产品包括Vera Rubin和Grace Blackwell系统。价格上涨的主要原因是三星、SK海力士和美光生产的DRAM成本上升,涨价将影响明年初的出货。为微软、谷歌和甲骨文制造服务器的合同制造商已通知客户,英伟达未予置评。
英伟达与数据中心基础设施开发商Cloverleaf Infrastructure建立合作伙伴关系,并对其进行投资,预计投资额达数亿美元,获得少数股权。此举是英伟达利用其巨额利润推动AI基础设施建设的一部分,此前英伟达还宣布向俄亥俄州的SB Energy数据中心项目投资15亿美元。
英伟达发布新研究,表明在长时程任务中,AI 的“支架”(harness)比底层模型更重要。通过定制支架并引入“监督者”组件,英伟达让 Claude Opus 5 在 ARC-AGI-3 基准上达到 100% 得分,而无支架时仅 30%。该研究强调开放支架系统对用户控制和安全性的重要性,并呼应了 OpenAI 和 Databricks 的相关发现。
NVIDIA 技术博客介绍了一种基于 GPU 加速的金融工具聚类工作流,使用 AdaptGrow 算法处理滚动相关性和尾部依赖矩阵,支持硬聚类、软因子载荷和结构突变信号。该工作流通过内存高效的 SymNMF 公式,使约 10 万工具可在单个 GB200 GPU 上处理,并支持跨 16 节点扩展至百万工具。实验显示,在 10 万工具规模下,AdaptGrow
NVIDIA 技术博客发文探讨 AI 代理栈中的安全定位,指出随着代理能力增强,安全控制需从模型层下移至基础设施层。文章基于近期 OpenAI、Anthropic 等前沿代理越界事件,强调运行时(如 OpenShell)作为权威边界的重要性,并介绍了代理栈各层(模型、harness、元 harness、安全运行时、推理基础设施)的功能与安全职责。
NVIDIA 研究项目 AVO 在 ARC-AGI-3 基准测试中取得 100.00 分,完成全部 183 个关卡。AVO 是一种通用智能体架构,通过持久记忆和监督机制支持长时间自主运行,此前已在 GPU 内核优化中展现性能提升。该结果表明,智能体系统的整体架构对模型能力转化为实际进展至关重要。
英伟达将以6亿美元收购AI初创公司Poolside的“Model Factory”软件,并吸纳其109名员工,这些员工曾参与Laguna模型的开发。此外,英伟达还将以120亿美元投前估值向Poolside投资10亿美元,三位创始人将继续留任。该交易并非传统收购或人才收购,而是通过许可技术和招聘员工来规避监管审查,英伟达此前与Groq和Enfabrica也有类
Poolside 创始人宣布,NVIDIA 以 12 亿美元获得其模型工厂授权,并雇佣了 109 名员工,创始人留任并获得 1 亿美元,员工获得 6 亿美元。Poolside 因未能及时融资 2 亿美元而失去 4 万 GB300 集群,转向新方向,其基础设施公司 PIC 计划扩展至 7GW 规模。创始人认为开源模型将商品化人类级智能,而超级智能和科学发现将成
NVIDIA 技术博客介绍了生成式推荐系统(GRs)如何重新定义大规模推荐系统,从传统的嵌入相似度目标转向生成式目标,即预测用户历史序列中的下一个动作或项目。文章讨论了 HSTU 和语义 ID 等架构,以及 NVIDIA 的 recsys-examples 和 nv-embedding-cache 如何解决生产中的挑战,如长尾问题和冷启动问题。
NVIDIA 技术博客介绍了如何使用 AI 编码代理开发 Holoscan 应用,通过 CLI、技能和代理实现实时内窥镜工具分割应用。开发流程采用工程师指导的迭代方式,代理使用 Codex 和 GPT-5.6 完成代码实现,并复用 MONAI 模型。该方法提高了开发效率,并强调了将复杂目标分解为可验证迭代的重要性。
NVIDIA 技术博客介绍了如何使用 NVIDIA FLARE 构建联邦多模态 AI 工作流,重点讨论了跨网络传输的模型状态以及高效传输和聚合的方法。文章通过 FedUMM 示例展示了在冻结的多模态骨干上联邦轻量级适配器,并利用外部化、张量流和磁盘支持聚合来处理大型模型更新。该工作流支持参数高效和全模型通信模式,解决了数据分布在不同机构时的训练挑战。
NVIDIA 发布 Cosmos 3 Edge,一个 4B 参数的 omni-model,可在 Jetson Thor 上实现设备端机器人控制。该模型基于 Cosmos 3 系列预训练,通过后训练生成机器人操作策略,在 Jetson AGX Thor T5000 上推理延迟约 1.53 秒,闭环任务成功率 22.9%。教程提供完整后训练流程,使用 DROID
中国允许英伟达H200芯片小批量进入大陆,字节跳动和腾讯各获得约1万颗,以帮助国内AI企业追赶美国。H200比英伟达最先进芯片落后至少两代,因美国出口管制无法购买更先进的。中国还支持华为等本土制造商,但国内AI公司在推理能力上仍落后于美国,且需求激增导致部分公司如Moonshot不得不拒绝客户。
Nvidia 联合 Apollo、BlackRock 等金融机构推出 5000 亿美元融资计划,将 GPU 算力包装为可投资资产类别。CEO 黄仁勋强调芯片是长期收益资产,但此前曾贬低旧款 Hopper 芯片,且该计划仅为谅解备忘录,存在不确定性。分析人士担忧 AI 需求饱和及中国开源模型降低算力需求,可能威胁该模式。
AI新闻汇总报道了内存价格在12个月内上涨500%,128GB DDR5套件价格达到历史最低价的十倍,超大规模买家已锁定2027年全球DRAM产能。OpenAI暂停部分前沿强化学习训练两周以加强安全控制,Qwen3.8-27B成为本地模型焦点,GLM-5.3发布并强调后训练提升,Mojo开源,NVIDIA推出TensorRT Model Connect。
NVIDIA 发布了 ALCHEMI Toolkit 的 agent skills 和参考文件,使 AI 编码代理能够根据自然语言描述生成 GPU 加速的原子模拟工作流。该工具包基于 PyTorch,支持 MLIP,并通过让代理执行生成的代码来减少错误。在 45 个管线的测试中,该设置避免了导入错误,但提示质量对结果影响显著。
NVIDIA cuML 和 cuVS 25.06 版本引入了多 GPU 分布式 UMAP 功能,通过将昂贵的全邻居 kNN 图构建步骤分布到多个 GPU 上,显著提升了大规模数据集的降维性能。该方法基于先前提出的 out-of-core 技术,将数据集划分为平衡簇并重叠向量,每个 GPU 独立计算局部 kNN 图并合并,避免了昂贵的全对全通信。实验表明,该功
NVIDIA 发布了 Nemotron 3.5 Lightning NVFP4 检查点,通过量化感知蒸馏(QAD)将模型从 66 GB 压缩至 22 GB,同时实现高达 4 倍的吞吐量提升。该过程使用 NVIDIA Model Optimizer,先进行 PTQ 量化,再通过蒸馏恢复精度。文章详细介绍了 QAD 的两阶段流程、PTQ 配方选择及评估结果,表明
AWS 宣布 NVIDIA Nemotron 3.5 Lightning 模型现已在 Amazon SageMaker JumpStart 上提供,该模型专为高容量代理工作负载设计,采用混合 MoE 架构,总参数 30B 但仅激活 3B,支持高达 1M 上下文长度,吞吐量提升 4 倍,任务完成速度提升 30%。用户可通过 SageMaker JumpStar
英伟达宣布向软银和OpenAI关联的数据中心开发商SB Energy投资15亿美元,并承诺提供高达1050亿美元的信贷支持,用于建设俄亥俄州辛辛那提附近的OpenAI Ports-Pike数据中心。该设施初期规模4.25吉瓦,可扩展至8吉瓦,英伟达将成为其唯一计算基础设施供应商。项目还包括一座92亿瓦的天然气发电厂,预计耗资330亿美元,但天然气价格可能因竞
另有 1 家信源报道