NVIDIA 推出 Personal AI Router 测试版,跨本地设备分发 AI 推理任务
NVIDIA 推出 Personal AI Router(PAIR)测试版,可将局域网内多台电脑的推理能力聚合,自动把 AI 请求分发到各节点,主要面向本地多智能体工作负载。PAIR 通过代理接收请求、识别引擎与模型需求并选择合适节点执行,兼容 Ollama 和 LM Studio,无需改动现有架构。NVIDIA 演示显示,结合 RTX Spark、DGX
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
NVIDIA 推出 Personal AI Router(PAIR)测试版,可将局域网内多台电脑的推理能力聚合,自动把 AI 请求分发到各节点,主要面向本地多智能体工作负载。PAIR 通过代理接收请求、识别引擎与模型需求并选择合适节点执行,兼容 Ollama 和 LM Studio,无需改动现有架构。NVIDIA 演示显示,结合 RTX Spark、DGX
英伟达 CEO 黄仁勋在高盛 Communacopia + Technology 大会上重申,公司明年营收有望同比增长 70%,按当前财年约 4000 亿美元收入计算,明年将达约 6800 亿美元。他表示英伟达已嵌入 AI 生态各环节,能追踪全球每一吉瓦数据中心项目,并回应了外界对其循环交易的质疑,称投资前会确认有真实客户合同。
NVIDIA 技术博客介绍其 NIM 2.0.12 全栈优化如何在 Nemotron 3 Ultra 上实现 2.5 倍并发用户提升。在 4xB200 硬件、64K 上下文、76% KV 复用、50 TPS/用户(20ms ITL)的 agentic 负载基准下,优化后吞吐从 718 tok/s 提升至 1,997 tok/s。优化来自精度与自动调优内核、张
NVIDIA 发布 BioNeMo Inference Runtime(BioIR),在 NVIDIA GPU 上加速生物分子结构预测模型,同时保留 PyTorch 工作流,并支持通过 Ray 在单节点多 GPU 上运行完整模型副本以提升吞吐。该运行时已用于 AlphaFold Database 的扩展,在 4,777 个蛋白质组中加速生成约 3,100 万
英伟达与Palantir宣布合作,用AI运行供应链,首个部署目标是英伟达自身覆盖数百万零件、数千供应商的全球供应链。Palantir将开源Nemotron模型集成到Foundry平台,供企业用自有运营数据微调,英伟达cuOpt负责场景规划与优化,系统可更早发现瓶颈、加速物料分配并评估替代方案,决策结果反哺模型持续改进。制造、制药、能源企业可通过Soverei
NVIDIA 与 Palantir 合作,利用 Palantir Foundry 的 Ontology 构建数字供应链智能指挥中心,将材料、工厂、承诺、产能等数据统一为受治理的数据层。NVIDIA 使用开源 GPU 加速优化库 cuOpt 将关键材料分配问题建模为混合整数线性规划,以最小化所有权时间(TOO)为目标,并反馈约束瓶颈。双方通过回测历史分配决策发
NVIDIA 技术博客介绍了编码-预填充-解码(EPD)分离技术,用于加速多模态模型推理。该技术将视觉编码阶段与 LLM 预填充和解码阶段分离,通过 NVIDIA Dynamo 框架实现独立扩展,在图像密集型提示和短输出场景下,可将首令牌时间(TTFT)提升至 5 倍,端到端响应时间提升至 7 倍。文章还讨论了 EPD 的适用场景和硬件放置选项,并指出在长输
NVIDIA 发布 CUDA Toolkit 13.4,新增对 Windows on Arm 平台的支持,并预览支持下一代 Rubin GPU 架构(计算能力 107)。该版本还引入了 MPS V3 以增强共享 GPU 资源管理,以及 CUDA Compute Fabric Transport (CFT) 用于大规模 NVLink 数据传输。此外,CUDA
NVIDIA 发布了 MagpieTTS Multilingual 357M 模型,这是一个支持 12 种语言的多语言文本转语音(TTS)模型,采用编码器-解码器 Transformer 架构,拥有 364M 参数。该模型通过多码本预测和帧堆叠技术生成高保真语音,并支持批量合成和长文本生成。此次更新新增了阿拉伯语、韩语和葡萄牙语支持,移除了零样本语音克隆功能
NVIDIA 在 IBC 2026 大会上宣布扩展其 AI for Media 产品组合,推出多项用于广播、体育和流媒体的实时 AI 技术,包括合成视频检测器(SVD)、3D 人体姿态估计、视频帧生成(VFG)、视频超分辨率(VSR)和 TrueHDR。这些技术已被 Dalet、TwelveLabs、Wowza、Vizrt 和 Ross Video 等公司集
NVIDIA 于 2026 年 9 月宣布推进 CUDA Rust,支持用 Rust 原生编写 GPU 内核并编译为 PTX,提供 SIMT 和 Tile 两种编程模型。首个工具 cuda-oxide 作为 rustc 代码生成后端,可将 Rust 内核编译到 PTX,并提供了完整的向量加法示例。此举旨在满足 AI 系统层对 Rust 的需求,并计划在 20
mlboydaisuke 在 Hugging Face 上发布了 Nemotron-3-Nano-4B-CoreAI,这是 NVIDIA 的混合 Mamba-2/Transformer 模型在 Apple Core AI 运行时上的量化版本。该模型在 iPhone 17 Pro 上达到 16.0 tok/s 的解码速度,在 M4 Max 上达到 85.2 t
NVIDIA 技术博客介绍了使用 NVIDIA NemoClaw 构建的基于记忆的智能体(Chief of Staff),该智能体通过自模型维护结构化知识层,以提升企业工作流效率。文章展示了该智能体在多个任务上的性能提升,如整体准确率从 82.8% 提升至 90.9%,并分享了五个设计经验,包括上下文维护、证据与知识分离、用户意图优先、用户纠正机制以及安全边
NVIDIA 技术博客介绍了如何在 Jetson 边缘设备上部署和优化推理模型,以 Nemotron 3.5 Lightning 和 Qwen3.8-27B 为例。文章指出,新一代紧凑型开放模型使边缘 AI 具备推理和智能体能力,并详细说明了 NVFP4 量化和投机解码如何提升推理性能。这些优化使模型能够在 Jetson 上本地运行,减少对数据中心的依赖,适
AWS 博客介绍了如何利用 NVIDIA Cosmos 3 在 SageMaker HyperPod 上构建物理 AI 模型工厂。Cosmos 3 采用混合 Transformer 架构,统一处理视频、图像、动作和声音,支持前向动力学、逆动力学和动作策略三种模式。该设计使数据生成、后训练和评估可在同一 GPU 集群上运行,提高资源利用率。文章提供了端到端示例
苹果CEO蒂姆·库克卸任,由硬件主管约翰·特努斯接任,特努斯承诺下周有重大发布。英伟达通过收购Hugging Face、投资联发科等举措,试图掌控整个AI技术栈。本期TechCrunch播客还讨论了特斯拉Cybercab、Waymo扩张、Zoox付费服务等机器人出租车竞争,以及a16z新基金和GoPro被收购等话题。
Nvidia 发布了开源工具 PAIR(个人 AI 路由器),可自动将本地 AI 请求分发到家庭网络中的多台设备,以缩短并行代理任务的等待时间。该工具兼容多种硬件,并在演示中将任务完成时间从单台笔记本的 18 分钟缩短至三设备集群的不到 9 分钟。PAIR 的发布是 Nvidia 将开放 AI 与其硬件更紧密结合的战略的一部分,该公司还以 129 亿美元收购
NVIDIA 技术博客介绍了一种在联邦式 Kubernetes 和 AI 平台中跨数据平面传播用户身份的中央身份网关模式。该模式通过集中式会话管理、标准 OIDC 和共享会话存储,解决了分布式会话所有权带来的重复登录、注销不一致和令牌刷新不协调等问题。NVIDIA 内部实施后,跨 AWS 和 OCI 的 Kubernetes 集群的重复登录事件减少了 55%
在IFA 2026上,NVIDIA联合微软及合作伙伴宣布加速本地AI推理,推出RTX Spark迷你PC,并简化Hermes Agent、OpenClaw和Perplexity Portable Computer等应用的本地模型设置。同时发布了多项模型更新,包括Nemotron 3.5 Lightning、GLM-5.3-Flash、Qwen3.8系列等,并
NVIDIA 发布了 Personal AI Router (PAIR) 的测试版,这是一个虚拟推理路由器,可将本地网络中的多台设备(如 RTX AI PC、DGX Spark 等)组合成动态计算集群,以缓解多智能体工作负载下的 GPU 瓶颈。PAIR 通过代理兼容 Ollama 和 LM Studio 接口,无需修改智能体代码即可将请求路由到可用节点。实测