英伟达 SoL-Pi 通过优化 harness 将编码智能体 token 用量减半
英伟达研究人员提出 SoL-Pi 系统,通过自动优化编码智能体的控制层(harness)来降低 token 消耗。该系统让一个研究智能体观察另一个智能体的执行轨迹、提出修改并在预设环境中测试,在 535 个可执行环境中探索了 152 个方向,生成超 3000 次运行。在 EdgeBench 的 51 个公开任务上,SoL-Pi 性能与原始 Pi harnes
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
英伟达研究人员提出 SoL-Pi 系统,通过自动优化编码智能体的控制层(harness)来降低 token 消耗。该系统让一个研究智能体观察另一个智能体的执行轨迹、提出修改并在预设环境中测试,在 535 个可执行环境中探索了 152 个方向,生成超 3000 次运行。在 EdgeBench 的 51 个公开任务上,SoL-Pi 性能与原始 Pi harnes
llama.cpp 发布 b11177 版本,在 CUDA 后端将 RMS NORM 与 SCALE 融合为单个 kernel(#29393),为 rms norm f32 增加 do scale 标志,仅在 SCALE 无 bias 且 rms norm 输出只有一个消费者时触发融合,数值与未融合版本逐位一致。该改动减少了 GDN 层每 ubatch 的额
NVIDIA 发布技术博客,介绍如何利用 Transformer Engine(TE)和 BioNeMo MoE recipe 高效训练生物基础模型。文章指出 MoE 架构虽能更高效扩展模型容量,但面临专家计算碎片化、路由通信开销和内存压力等瓶颈。TE 通过 GroupedLinear、MXFP8 低精度训练和融合 GroupedMLP 内核(整合量化、Sw
NVIDIA 发布 NV-Reason-CT,一个专为 3D CT 分析构建的视觉语言模型,将思维链推理扩展到全容积 CT,可生成结构化诊断报告、模拟放射科医生思维链并支持多轮追问对话。该模型基于 NV-Reason-CXR 的推理方法,采用 3D ViT 编码器与 Qwen3.5-4B 语言模型组合,处理 192³ 体素 CT 数据。NVIDIA 强调其定
NVIDIA 发布开源 Kubernetes 控制器 NVCRE(Cluster Readiness Engine),用于在 AI 生产负载上线前验证 GPU 集群就绪状态。它通过运行真实的分布式工作负载(如 NCCL 通信测试、DCGM 诊断、NeMo 预训练)并按拓扑感知分组测量结果,将失败精确定位到具体节点和类别。该工具填补了 Kubernetes 缺
NVIDIA 发布开源权重模型 Nemotron 3 Diarization,参数量 1 亿,在 VoiceArena Diarization-Bench 排行榜以 14.72% 的 DER 位列第一。该模型支持最多 8 位说话人、重叠语音、分块处理和可定制流式延迟,并采用到达顺序排序与 AOSC、FIFO 记忆机制保持说话人标签稳定。它可与 ASR 结合生
NVIDIA 发布开源项目 NodeWright,用于在 Kubernetes 集群中声明式地配置和更新节点主机操作系统,同时不中断正在运行的工作负载。NodeWright 此前以 Skyhook 之名在 NVIDIA 内部生产环境运行,现正式开源并更名。它通过 operator、自定义资源和包三个组件,结合 PodDisruptionBudgets、节点选
NVIDIA 技术博客介绍 SWE-Serve,一个与 SGLang 团队合作开发的基准,用 53 个来自 SGLang 已合并 PR 的任务评估 AI 编码代理对推理服务软件的修改。在 19 个含实时服务检查的任务中,同一批补丁排除实时检查时通过率为 69.4%,加入完整验证器后降至 45.9%,约三分之一补丁在真实服务器加载模型后失败。该基准还显示跨多个
NVIDIA 在新加坡举办 AI Day,联合东南亚合作伙伴展示多项 AI 进展。新加坡 HTX 使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI;NCS、ST Engineering 等企业采用 Nemotron 模型和 NeMo 工具开发智能体 AI 方案。马来西亚、越南、泰国、文莱等国的机构也
NVIDIA 技术博客介绍其机密计算(Confidential Computing)方案,通过内存加密的机密虚拟机、机密 GPU 和加密 NVLink,让 LLM 推理在可信硬件环境中运行。文章以 DeepSeek-R1-0528-NVFP4 模型在 TensorRT LLM 上的测试为例,说明 CC 开启后输出吞吐保留 96.1%–98.2%,平均 TPO
NVIDIA 发布开源工具包 Topograph,用于发现集群网络拓扑并将其标准化为 Kubernetes 节点标签、Slurm 配置、Slinky ConfigMap 等调度器可识别的格式。它通过 API Server、Node Observer、Node Data Broker、Provider 和 Engine 五个组件保持拓扑视图实时更新,并与 DR
NVIDIA 发布 DLSS 5,引入 3D-Guided Neural Rendering,以游戏引擎渲染帧为基础,在保留场景结构与艺术意图的前提下增强光照与材质细节,并已在 NBA 2K27 中上线。同时更新 NVIDIA ACE,推出 Nemotron Speech 3.5 Streaming 与 Qwen3 TTS 等模型,并升级 NVIGI SDK
NVIDIA 在 ROS 2 Lyrical 中贡献了 CUDA buffer 后端,配合上游 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时,可通过零拷贝传输交换 GPU 常驻数据,否则自动回退到 CPU 路径。NVIDIA Isaac ROS 5.0 的所有节点
NVIDIA 发布 TensorRT 多设备推理能力,使单个 TensorRT 网络可借助 NCCL 分布式集合通信跨多 GPU 执行,并从 TensorRT 11.0 起全面支持。Dynamo-Triton 26.07 版本的 TensorRT 后端启用该能力,一个 KIND MODEL 实例可拥有多块 GPU 并统一暴露单个 gRPC 模型端点。文章以
NVIDIA 技术博客发文梳理 AI Agent 评估方法的演进:从早期静态任务与单次函数调用评分(如 BFCL),转向需要完整执行环境、跨多步追踪状态的全任务评估。文章提出步骤级(过程评分)与端到端(结果评分)两层评分体系,并给出任务成功率、一致性、工具调用精度、参数准确率、每成功任务步数与成本等指标,强调不同基准在任务复杂度、状态性和验证方法上的差异会导
NVIDIA 发布技术博客,介绍其 Earth-2 平台中的 AI 数据同化工具,可将专有或第三方观测数据融入天气预报流程。教程涵盖两种技术:用点观测约束扩散模型(适用于区域模型)以及将多源数据集同化为一致状态(适用于全球模型)。文中以 CorrDiff 为例,展示如何利用 Score-Based Data Assimilation 在不重新训练模型的情况下
NVIDIA 发布博客文章,主张 AI 安全是一个工程问题,需要明确的安全需求、可执行的管控、指定负责人和可验证的证据。文章提出安全应覆盖 agent 技术栈的每一层,包括模型、编排框架和运行时环境,并介绍了 NVIDIA OpenShell 开源安全运行时及 Open Secure AI Alliance 合作伙伴(Cisco、JFrog、CrowdStr
在纽约气候周上,NVIDIA 介绍了五家利用其 AI 技术推进清洁能源的公司。ThinkLabs AI 用数字孪生和智能体将电网互联评估时间从 30-45 天缩短到两分钟;Atomic Canyon 为核电站运营提供 AI 知识管理与虚拟助手;Redwood Materials 用回收的电动汽车电池为 AI 工厂提供离网电力;TerraPower 用 Omn
TechCrunch 的 Equity 播客讨论了 AI 行业是否真的准备放缓。Anthropic CEO Dario Amodei 发布“pace the frontier”计划,提议由独立第三方评估机构进驻前沿实验室、民主国家主要 AI 公司协调安全标准及国际协作,但细节模糊。Nvidia CEO Jensen Huang 公开附和特朗普关于 AI 反弹
英伟达CEO黄仁勋在CBS《周日晨间》采访中称AI毁灭世界的概率为“0%”,并认为对AI风险的警告是“不必要的、不负责任的”。他还表示Anthropic的Dario Amodei和OpenAI的Sam Altman等人呼吁放缓AI发展的说法“没有科学依据”,并反对制定新规则或法律。文章指出,黄仁勋作为全球市值最高公司的CEO,其个人财富从2023年约210亿