返回主题地图

NVIDIA 英伟达

公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 229 条。
8月12日周三 · 1 条
正文顺带提及命中实体:nvidia
Latent Space研究

研究揭示可窃取并移植加密推理痕迹,引发隐私担忧

一篇研究论文展示了如何通过重放加密的推理块,从Claude、GPT和Gemini等前沿模型中提取隐藏的推理痕迹,并成功移植到其他模型或会话中,从而显著提升开源模型性能。初步扫描约7000个公共痕迹发现62个API密钥、33个邮箱和33个密码等敏感数据泄露。该漏洞已负责任披露,部分已修复,但类似攻击仍可能发生。

8月10日周一 · 1 条
正文顺带提及命中实体:nvidia
Hugging Face Blog一手来源研究

Hugging Face 提出高效知识蒸馏方法,显存占用大幅降低

Hugging Face 团队发表论文,提出两种系统优化方法:离线缓存教师模型的 Top-K logits,以及融合分块 KL 损失,以大幅降低大语言模型知识蒸馏的显存占用和训练成本。该方法使长上下文蒸馏可在单 GPU 上运行,并支持大规模实验。

8月8日周六 · 1 条
正文顺带提及命中实体:cuda
SGLang Releases一手来源产品发布

SGLang v0.5.17 发布:支持 Kimi K3 与 MiniMax-H3,多项性能优化

SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。

8月7日周五 · 1 条
正文顺带提及命中实体:nvidia
量子位安全

AI漏洞报告泛滥,苹果赏金计划设冷静期并加速修复

苹果因AI生成的漏洞报告泛滥,对bug赏金计划设置提交上限和30天冷静期。AI工具降低了漏洞发现门槛,导致大量虚假报告,审核团队不堪重负。同时,苹果在macOS安全更新中首次致谢AI工具,并加速发布节奏以应对漏洞披露周期的变化。

8月6日周四 · 1 条
正文顺带提及命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp b10293 发布:新增 AMD ROCm CI 支持并修复 RDNA3.5 推理问题

llama.cpp 发布 b10293 版本,主要更新包括为 AMD ROCm CI 添加 gfx1151 支持,并修复了集成 GPU 上的调试断言问题。针对 RDNA3.5 架构的 HIP 后端,通过启用 HIP LAUNCH BLOCKING 解决异步执行导致的推理错误,并暂时跳过 jamba 和 top-k 等不支持的测试。该版本提供了多平台预编译二进

8月5日周三 · 2 条
正文顺带提及命中实体:nvidia
TechCrunch AI商业

Anthropic 与 AI 云初创 Volta 签署 100 亿美元协议

Anthropic 与 AI 云初创公司 Volta 签署了价值 100 亿美元的协议,Volta 将在六年内为 Anthropic 提供云计算服务。该数据中心位于挪威,由 Bitdeer 协助开发,容量为 133 兆瓦,将使用 Nvidia 的 Vera Rubin 系统。此举是 Anthropic 扩大计算能力、与竞争对手抗衡的一部分。

正文顺带提及命中实体:nvidia
THE DECODER商业

谷歌联手博通摩根士丹利为Anthropic提供350亿美元TPU融资

谷歌与博通、摩根士丹利及多家投资机构合作,设立特殊目的载体(SPV)为AI初创公司Anthropic提供价值350亿美元的TPU芯片租赁融资,以避免硬件出现在各方资产负债表上。该结构涉及约100万颗TPU,博通提供300亿美元担保,并利用加密矿企的电力设施建设数据中心。若Anthropic违约,谷歌潜在负债达440亿美元,但仅账面记录8.15亿美元。

8月4日周二 · 3 条
正文顺带提及命中实体:nvidia
Mistral AI News一手来源模型发布

Mistral AI 发布开源多模态安全分类器 Shieldstral

Mistral AI 发布了 Shieldstral,一个 3B 参数的开源多模态安全分类器,通过将内容审核构建为策略自适应问答任务,在文本安全方面匹配甚至超越高达其 7 倍规模的模型,并在多模态审核上达到新高度。该模型支持在推理时以自然语言提供政策,无需重新训练即可统一处理文本和图像,并输出校准的安全分数。Shieldstral 以 Apache 2.0

正文顺带提及命中实体:nvidia
Latent Space研究

推理工程大师课:Baseten解析AI推理优化前沿

Baseten在完成130亿美元融资后成为AI基础设施领域的独角兽,其团队成员Philip Kiely和Ali Taha在播客中深入探讨了推理工程这一新兴学科。他们讨论了缓存感知路由、预填充与解码分离、量化、投机解码等技术,以及如何通过优化将模型推理速度提升10倍。对话还涉及NVIDIA Dynamo、GPU并行、视频生成的计算瓶颈,以及训练与推理的融合趋势

正文顺带提及命中实体:nvidia
Together AI Blog一手来源研究

Minions:端侧小模型与云端大模型协作降低 LLM 成本

Together AI 的研究团队提出了一种名为 Minions 的方法,通过让小型端侧模型与云端前沿模型协作,将大量 LLM 工作负载转移到消费设备上,仅本地读取长上下文,从而降低云成本且几乎不损失质量。实验表明,Minions 在保持 97.9% 准确率的同时,成本仅为云端方案的 17.5%。该方法通过分解-执行-聚合循环,解决了小模型长上下文和多步指令

8月3日周一 · 3 条
正文顺带提及命中实体:nvidia
Together AI Blog一手来源观点

Together AI 强调推理效率是 AI 生产系统的关键

Together AI 在 NVIDIA GTC 2026 上强调推理效率对 AI 生产系统的重要性,指出推理成本占系统总成本的 80-90%。该公司通过 FlashAttention、ThunderKittens 和 Aurora 等开源技术优化推理性能,并利用 Blackwell 硬件实现全栈优化,帮助客户降低单位经济成本。文章还引用斯坦福 AI 指数,

正文顺带提及命中实体:cuda
Together AI Blog一手来源研究

ParallelKernelBench:前沿 LLM 尚无法编写快速多 GPU 内核

Together AI 发布了 ParallelKernelBench(PKB),一个用于评估多 GPU 内核生成的基准测试框架,包含 87 个来自真实代码库的问题,要求模型将 PyTorch + NCCL 实现替换为直接通过 NVLink 通信的 CUDA 内核。测试前沿模型如 GPT-5.5、Gemini 3 Pro 和 Opus 4.7 后发现,正确率

正文顺带提及命中实体:nvidia
Together AI Blog一手来源研究

Together AI 在 ICML 2026 展示全栈前沿研究

Together AI 在 ICML 2026 上发表了九篇论文,覆盖从智能体到 GPU 内核的全栈研究。其中,Aurora 论文提出的自适应投机解码已作为 ATLAS 投机器在生产环境中部署。研究还包括 DSGym 数据科学智能体评估框架、ThunderAgent 智能体工作负载优化、TTT-Discover 开放模型科学发现,以及 RARO 无验证器强化

8月2日周日 · 7 条
正文顺带提及命中实体:nemotron
Interconnects AI研究

开放模型新动态:Inkling、Hy3、Kimi K3 等展示帕累托前沿价值

Interconnects AI 发布第23期开放模型盘点,指出开放模型生态持续繁荣,而非此前预测的行业整合。文章重点介绍了 Thinking Machines 的 Inkling、腾讯的 Hy3、Poolside 的 Laguna S2.1、DeepSeek-V4-Flash 和 Moonshot 的 Kimi K3 等模型,并讨论了开放模型的商业价值、许

正文顺带提及命中实体:nvidia
Simon Willison's Weblog观点

AI发展公开信之争:开放权重与前沿管控

微软牵头于7月24日发布公开信《开放权重与美国AI领导力》,获235家AI相关公司签署,包括NVIDIA、亚马逊、Y Combinator、Linux基金会及OpenAI,主张开放权重模型并支持蒸馏技术。Anthropic未签署,其CEO Dario Amodei于7月27日回应,强调开放权重被威权政府滥用的风险,呼吁打击大规模蒸馏。7月28日,1324名前

正文顺带提及命中实体:nvidia
xAI News一手来源商业

SpaceXAI 与 Anthropic 达成算力合作,提供 Colossus 1 超级计算机

SpaceXAI 与 Anthropic 签署协议,提供其超级计算机 Colossus 1 的访问权限。Colossus 1 拥有超过 22 万块 NVIDIA GPU,用于 AI 训练和推理。Anthropic 将利用该算力提升 Claude Pro 和 Max 订阅服务,并有意合作开发轨道 AI 计算能力。

正文顺带提及命中实体:nvidia
Mistral AI News一手来源产品发布

Mistral AI 发布 Mistral Compute 基础设施服务

Mistral AI 宣布推出新的 AI 基础设施产品 Mistral Compute,提供从裸机服务器到完全托管 PaaS 的私有集成堆栈,包括 GPU、编排、API 等。该产品旨在让各国、企业和研究实验室自主构建 AI 环境,减少对少数云提供商的依赖,并已获得多家欧洲公司支持。

正文顺带提及命中实体:nvidia
Together AI Blog一手来源研究

FlashAttention-3 发布:利用 Hopper GPU 新特性实现 1.5-2 倍加速

Together AI 发布了 FlashAttention-3,通过利用 Hopper GPU 的异步特性(如 WGMMA、TMA 和 FP8 低精度)来加速注意力计算,相比 FlashAttention-2 在 FP16 下速度提升 1.5-2 倍,达到 740 TFLOPS(H100 理论峰值的 75%),FP8 下接近 1.2 PFLOPS。该技术提

正文顺带提及命中实体:nvidia
Together AI Blog一手来源商业

Together AI 与 YC 合作推出首个专用 GPU 集群

Together AI 与 Y Combinator 宣布合作,为 YC 投资组合中的 AI 初创公司提供首个专用 GPU 集群,以解决计算资源获取难和成本高的问题。该集群支持短期灵活使用和长期优惠价格,初创公司可通过自助门户直接管理 GPU。目前集群已满负荷运行,双方计划未来扩展集群规模。

正文顺带提及命中实体:nvidia
Mistral AI News一手来源模型发布

Mistral Small 4 发布:统一推理、多模态与编码的开源模型

Mistral AI 发布了 Mistral Small 4,这是其 Small 系列的新旗舰模型,首次统一了推理、多模态和智能体编码能力,支持文本和图像输入,并采用 Apache 2.0 开源许可。该模型基于 MoE 架构,总参数 119B,激活参数 6B,上下文窗口 256k,性能相比 Small 3 提升显著,推理延迟降低 40%,吞吐量提升 3 倍。