NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给 · 共 40 条
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
由xAI联合创始人Igor Babuschkin创立的AI初创公司River AI,在成立仅两个月后获得了由General Catalyst和AMP PBC领投的11亿美元融资,Nvidia、AMD Ventures、Y Combinator和Temasek参投。River AI旨在从头重建AI技术栈,包括训练、模型、产品层和硬件,以开发个人可训练的AI助手
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
Nvidia发布了开源权重模型Nemotron 3.5 Lightning,该模型拥有316亿总参数但仅激活36亿参数,在智能指数上达到24分,与OpenAI的gpt-oss-120b持平,但推理速度接近每秒670个token,远超同类模型。该模型在代理基准测试中表现显著提升,采用宽松的OpenMDW-1.1许可证,并提供BF16和NVFP4权重,多家云服务
Ollama 发布 v0.32.9 版本,新增对 NVIDIA Nemotron 3.5 Lightning 模型的支持。该模型是一个开放 30B 参数的混合专家(MoE)模型,仅有 3B 活跃参数,专为常驻 AI 代理的执行层设计,并支持 OpenClaw 和 Hermes Agent 等框架。此外,该版本还修复了 Muse Glimmer 函数调用解析器
另有 1 家信源报道
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr
另有 1 家信源报道
NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 300 亿参数的混合专家模型,专为长时间运行的代理式 AI 工作负载设计,提供高达 4 倍的输出速度和 30% 更快的任务完成速度。同时,NVIDIA 推出了 NeMo Switchyard,一个开源模型路由库,可智能地将请求路由到最合适的模型,降低成本并保持质量。这些发布旨在为企业提
NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单
英伟达CEO黄仁勋宣布与Apollo、BlackRock、Blackstone、Brookfield、Goldman Sachs和KKR等华尔街机构合作,建立独立融资平台,计划撬动超过5000亿美元第三方资本用于AI基础设施建设。黄仁勋提出AI工厂概念,将GPU算力包装为可投资的基础设施资产,并回应了循环融资的质疑。文章同时提及算力价格近期上涨,但也警示了类
audio.cpp 项目发布了多个语音模型的 GGUF 量化版本,涵盖 TTS、ASR、语音转换、源分离和说话人分离等任务。这些模型基于 ACE-Step、Qwen、NVIDIA 等多家机构的基础模型转换而来,支持 16-bit 和 Q8 量化格式,并提供了详细的测试状态和兼容性说明。该发布旨在通过 GGUF 格式提升语音模型在本地部署的效率和可移植性。
llama.cpp 发布 b10353 版本,修复了 CUDA 和 Metal 后端中 ggml_roll 操作对非连续输入产生错误结果的问题。该修复要求 src 张量连续,并添加了相应的测试用例。同时提供了多个平台的预编译二进制文件。
NVIDIA 发布 Magpie 多语言 TTS 模型,新增阿拉伯语、韩语和巴西葡萄牙语支持,共支持 12 种语言。该模型为 3.64 亿参数的开源权重模型,可通过 NVIDIA NIM 部署,在 B200 GPU 上实现 32 毫秒的首音频延迟和 320 倍实时吞吐。通过帧堆叠和局部 Transformer 架构优化,在保持语音质量的同时降低推理延迟,适用
llama.cpp 发布 b10344 版本,主要新增了对 Nemotron 模型的多 token 预测(MTP)支持,并引入了 mtp_flags 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,方便用户部署。
Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090
Hugging Face 团队发表论文,提出两种系统优化方法:离线缓存教师模型的 Top-K logits,以及融合分块 KL 损失,以大幅降低大语言模型知识蒸馏的显存占用和训练成本。该方法使长上下文蒸馏可在单 GPU 上运行,并支持大规模实验。
Om AI联汇完成数亿元融资,并开源全球首款端侧原生模型VLX-Seek 1.5。该模型有3B和10B两个版本,采用流式多模态架构,在无人机视角、指代表达理解等任务上超越英伟达LocateAnything等更大模型。公司旨在通过端侧原生路线,推动物理AI在机器人、无人机等场景的规模化落地。
Nvidia 和 Amazon 因 AI 能源需求大幅投资电力基础设施。Nvidia 拟向 Lancium 投资高达 30 亿美元,该公司为 OpenAI 和 Oracle 在得克萨斯州的数据中心开发电力设施,已签约 4 吉瓦电力并计划扩展至 15 吉瓦。Amazon 则在得克萨斯州佩科斯县支持一座大型燃气发电厂,装机容量 7.65 吉瓦,但年排放二氧化碳可
国产GPU公司摩尔线程发布2026年半年度报告,上半年营收17.36亿元,同比增长147.42%,已超2025年全年,亏损大幅收窄。公司研发投入持续增加,旗舰产品MTT S5000实现规模化量产,夸娥智算集群在多城市部署,并完成多个大模型训练项目。公司构建了云边端全场景算力布局,MUSA生态兼容CUDA,开发者超80万。
llama.cpp 发布 b10330 版本,主要更新是在 CUDA 后端中融合了 rms_norm、mul 和 rope 操作,并添加了相关测试和内存范围检查。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
Firebird 在亚美尼亚启动了独联体地区最大的 AI 工厂,由 NVIDIA 加速计算和 Dell 基础设施提供支持,计划到 2027 年底部署超过 7 万块 NVIDIA Rubin 和 Blackwell GPU,总容量达 300 兆瓦。该工厂基于 NVIDIA DSX 平台,能效提升 40%,并已吸引 Perplexity 等客户。NVIDIA 和
llama.cpp 发布 b10327 版本,主要修复了 CUDA 下量化 cpy 内核启动时线程/块数量计算错误的问题,并增加了不均匀块数量的测试用例。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。
SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。
llama.cpp 发布 b10301 版本,主要修复了 CUDA 相关的未使用变量和函数警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO、SYCL 等。
NVIDIA 的研究团队针对现代希腊语对 Nemotron 检索栈进行了端到端适配,包括语料挖掘、合成监督、检索模型训练、重排序器适配和阅读器微调,并发布了名为 HERA 的基准。研究发现 BM25 基线在专业希腊语语料上优于多个现成的多语言稠密检索模型,而微调后的 Nemotron 1B 嵌入器将 nDCG@10 从 0.362 提升至 0.835。此外,
苹果因AI生成的漏洞报告泛滥,对bug赏金计划设置提交上限和30天冷静期。AI工具降低了漏洞发现门槛,导致大量虚假报告,审核团队不堪重负。同时,苹果在macOS安全更新中首次致谢AI工具,并加速发布节奏以应对漏洞披露周期的变化。
本文探讨了AI基础设施中存储角色的转变,指出大模型推理正从堆叠计算资源转向协同计算、网络、内存与存储的数据路径。月之暗面的Mooncake和NVIDIA的CMX分别从软件架构和硬件平台层面将KV Cache等推理状态作为一级资源管理,推动SSD进入Token生成的实时主链路。文章还分析了群联、江波龙和寅谱-联芸三条推理参与型AI SSD技术路线,强调AI S
NVIDIA 发布了 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础模型系列,包含 Super、Nano 和 Edge 三个版本,支持视觉推理、世界生成和动作预测。该模型在多个基准测试中排名第一,并采用 Linux 基金会的 OpenMDW 1.1 许可证,允许开发者进行后训练和定制。NVIDIA 还通过 Omnivers
llama.cpp 发布 b10293 版本,主要更新包括为 AMD ROCm CI 添加 gfx1151 支持,并修复了集成 GPU 上的调试断言问题。针对 RDNA3.5 架构的 HIP 后端,通过启用 HIP_LAUNCH_BLOCKING 解决异步执行导致的推理错误,并暂时跳过 jamba 和 top-k 等不支持的测试。该版本提供了多平台预编译二进
NVIDIA 正参与美国国家科学基金会的州与区域人工智能基础设施中心计划,以扩大 AI 研究所需的计算、数据和软件资源。同时,纬创在德克萨斯州沃斯堡开设了首家美国制造工厂,生产 GB300 超级芯片,并计划生产 Vera Rubin 芯片,总投资 7 亿美元,创造超 500 个就业岗位。NVIDIA 及其合作伙伴计划在美国生产高达 5000 亿美元的 AI
Latent Space 的 AINews 报道了关于 Megakernels 的讨论,认为其因复杂性和硬件变化而失去优势,但 Cursor 开源了 Megakernel 并宣称提升 41% 吞吐量。同时,Qwen 发布 Qwen3.8-Max,NVIDIA 和 Mistral 推出 Alpamayo 2 Super 和 Shieldstral,Pokee-
Anthropic 与 AI 云初创公司 Volta 签署了价值 100 亿美元的协议,Volta 将在六年内为 Anthropic 提供云计算服务。该数据中心位于挪威,由 Bitdeer 协助开发,容量为 133 兆瓦,将使用 Nvidia 的 Vera Rubin 系统。此举是 Anthropic 扩大计算能力、与竞争对手抗衡的一部分。
另有 1 家信源报道
由英伟达牵头成立的开放安全AI联盟(OSAA)在成立一周内已吸引超过120家公司加入,并成立了名为SAFE的工作组,已提出多项提案供公开评议,由Linux基金会管理。提案涵盖AI网络安全事件的保密报告、受影响方通知及无指责分析等。联盟成员包括Adobe、微软、英特尔等,但Anthropic、OpenAI和Google尚未加入,尽管后两者签署了支持开源AI的公
谷歌与博通、摩根士丹利及多家投资机构合作,设立特殊目的载体(SPV)为AI初创公司Anthropic提供价值350亿美元的TPU芯片租赁融资,以避免硬件出现在各方资产负债表上。该结构涉及约100万颗TPU,博通提供300亿美元担保,并利用加密矿企的电力设施建设数据中心。若Anthropic违约,谷歌潜在负债达440亿美元,但仅账面记录8.15亿美元。
NVIDIA 宣布参与美国国家科学基金会(NSF)的州和区域人工智能基础设施中心计划,该计划旨在扩大全美高校和研究机构对先进计算、数据、软件和专业知识的使用。该计划基于 Genesis Mission 的目标,支持州级和多州高校联盟,通过公私合作共享 AI 资源,加速科学发现,并培养 AI 劳动力。NVIDIA 将提供培训资源、技术指导等支持,并借鉴与佛罗里
NVIDIA 技术博客探讨了从视觉-语言-动作模型(VLA)向世界动作模型(WAM)的转变,指出 WAM 基于视频世界模型构建,能更好地泛化物理交互。NVIDIA 发布了 Cosmos 3 世界基础模型,并基于其训练了 DROID 机器人策略,实验显示 omni 检查点将成功率从 28.1% 提升至 36.8%。
Anthropic 与成立仅数月的云初创公司 Volta Infra Holdings 达成一项为期六年的 100 亿美元计算能力协议,该计算能力来自挪威 Tydal 的数据中心,由 Bitdeer Technologies 运营,使用 Nvidia 最新的 Vera Rubin 芯片。Volta 成立于 2026 年初,已获得 3 亿美元风险投资,估值达
另有 1 家信源报道
NVIDIA发布开源34B参数视觉-语言-动作模型Alpamayo 2 Super,用于加速自动驾驶开发。该模型结合Cosmos 3 Super Reasoner与扩散Action Expert,支持轨迹生成、推理、元动作预测及自动标注。在LingoQA基准上排名第一,超越多个更大模型。模型权重已开源,采用Linux基金会许可。
NVIDIA发布了Alpamayo 1.5,这是一个基于Cosmos-Reason2 VLM骨干的100亿参数链式思维推理VLA模型,专为自动驾驶社区设计。该模型支持导航引导、灵活摄像头数量和用户问答,采用扩散轨迹解码器,并已通过RL后训练。模型权重在OpenMDW-1.1许可下发布,源代码采用Apache 2.0,主要用于处理自动驾驶中的罕见长尾事件。
Mistral AI 发布了 Shieldstral,一个 3B 参数的开源多模态安全分类器,通过将内容审核构建为策略自适应问答任务,在文本安全方面匹配甚至超越高达其 7 倍规模的模型,并在多模态审核上达到新高度。该模型支持在推理时以自然语言提供政策,无需重新训练即可统一处理文本和图像,并输出校准的安全分数。Shieldstral 以 Apache 2.0