返回主题地图

NVIDIA 英伟达

公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 229 条。
8月23日周日 · 1 条
正文顺带提及命中实体:nvidia
Hugging Face New and Trending Models一手来源模型发布

Mistral-Nemo-Instruct-heretic:去审查版12B模型发布

Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但

8月22日周六 · 4 条
正文顺带提及命中实体:nvidia
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 推出 16GB 显存适配的 GGUF 量化版

cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik llama.cpp 项目的 IQ4 KS 和 IQ4 KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4 0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化

正文顺带提及命中实体:nvidia
Latent Space观点

模拟接管AI:10%更差,100倍便宜,10000倍更快

Latent Space 的 AINews 文章提出,自 2022 年以来,AI 流水线中越来越多的组件从人类制造转向模型制造,形成“模拟”趋势:性能略差(10%),但成本更低(100 倍)且速度更快(10000 倍)。文章按阶段梳理了从奖励信号、训练数据、教师模型、课程设计到研究者、环境乃至人类主体的合成化进程,并引用 InstructGPT、Phi、Al

正文顺带提及命中实体:cuda
SGLang Releases一手来源产品发布

SGLang v0.5.18 发布:新增多模型支持与性能优化

SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp v0.2.0 发布:多后端优化与模型支持更新

llama.cpp 项目发布了 v0.2.0 版本,包含大量底层优化和修复,涉及 CUDA、SYCL、OpenCL、Vulkan、Metal 等多个后端。新增功能包括对 LFM2 模型的支持、GraniteSWA 模型、Mamba-2 的 OpenCL 移植,以及服务器端多项改进。该版本还提升了量化内存使用效率,并增强了 CI 和发布流程。

8月21日周五 · 1 条
正文顺带提及命中实体:nvidia
TechCrunch AI产品发布

Ramp 推出 AI 模型路由服务 Router

企业支出管理平台 Ramp 推出了自己的 AI 模型路由服务 Router,允许用户和公司通过 API 使用和切换多种大语言模型。该服务目前仅在美国可用,2026 年剩余时间内免费,并提供 26 美元信用额度。Router 提供来自 OpenAI、Anthropic、DeepSeek 等多家公司的模型,并支持多种路由策略和仪表盘监控。此举旨在进入 AI 推理

8月20日周四 · 2 条
正文顺带提及命中实体:nvidia
THE DECODER商业

中国出现AI循环融资模式,宇树科技IPO估值500亿美元

中国机器人制造商宇树科技在上海IPO后估值约500亿美元,股价大涨。据英国《金融时报》报道,其需求依赖循环模式:制造商向国有培训中心出售机器人,再购回训练数据。分析师质疑高估值和数据实用性,宇树近四分之三的人形机器人收入来自教育和研究领域。

正文顺带提及命中实体:cuda
8月19日周三 · 3 条
正文顺带提及命中实体:nvidia
arXiv cs.LG一手来源研究

DumpsterCluster:用 60 美元 GPU 服务 LLaMA-70B 的二手硬件集群研究

本文介绍了一个名为 DumpsterCluster 的 128-GPU 集群,完全由二手组件构建,用于服务 LLaMA-70B 等现代 LLM 推理。该集群成本仅为 2.2 万美元,远低于 8-GPU B200 系统的 60 万美元,并通过流水线并行优化实现了有竞争力的吞吐量。然而,研究发现二手 GPU 的能效较低,总拥有成本仅在电价低廉的地区有利,且碳排放

正文顺带提及命中实体:nvidia
TechCrunch AI商业

Etched 估值一个月翻倍至 210 亿美元

AI 芯片初创公司 Etched 宣布获得 7 亿美元新融资,估值达 210 亿美元,由量化基金 Jane Street 领投。该公司设计了两款新组件以加速推理过程,包括低电压预填充芯片和集群规模内存互连,承诺提高速度并降低成本。尽管早期曾被认为芯片为特定模型定制,Etched 表示其系统现在可运行任何前沿模型。

正文顺带提及命中实体:nvidia
InfoQ AI ML and Data Engineering研究

从晶圆到Token:AI芯片市场瓶颈分析

SemiAnalysis 的 Jordan Nanos 在演讲中分析了 AI 芯片市场现状,指出超大规模云厂商大幅上调资本支出,但台积电的晶圆产能扩张缓慢,成为关键瓶颈。他介绍了 SemiAnalysis 的 ClusterMAX 和 InferenceX 项目,用于测试云提供商和芯片性能,并强调硬件理解对软件开发的重要性。

8月18日周二 · 2 条
正文顺带提及命中实体:nvidia
Latent Space商业

Stripe 70 亿美元收购 OpenRouter,AI 路由层价值重估

支付公司 Stripe 以 70 亿美元收购 AI 模型路由平台 OpenRouter,交易在 90 天前其 13 亿美元 B 轮融资后完成。OpenRouter 年化收入 1.4 亿美元,毛利率约 70%,月处理 250 万亿 token,拥有 800 万开发者。该交易凸显模型聚合层的价值,但也引发对中间层利润压缩的担忧。

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp b10472 发布:修复 HIP 内存报告问题

llama.cpp 发布 b10472 版本,主要修复了 HIP 构建中错误使用 UMA 覆盖的问题,AMD APU 现在通过 hipMemGetInfo 报告准确内存,避免小内存系统上的过度承诺。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

8月15日周六 · 1 条
正文顺带提及命中实体:nvidia
llama.cpp Releases一手来源产品发布

llama.cpp b10431 发布:ggml ssm scan 支持循环状态回滚

llama.cpp 发布 b10431 版本,主要更新为 ggml ssm scan 支持循环状态回滚(recurrent state rollback),并支持 K 1 的情况,覆盖 CPU 和 CUDA 后端。该功能有助于提升状态空间模型(如 Nemotron)在推理时的效率。

8月14日周五 · 2 条
正文顺带提及命中实体:cuda
TechCrunch AI产品发布

法国初创Kog通过软件优化提升GPU推理速度

法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现更快的AI推理速度,其技术预览在Hacker News上引起关注,并获得了200个商业线索。Kog计划在9月前将首个大型模型推理速度提升10倍,以吸引投资并推动业务发展。

正文顺带提及命中实体:cuda
量子位产品发布

算力需求两年涨10倍,机器人研发转向云端工作站

逐际动力与阿里云无影灵构合作,将机器人研发环境迁移至云端,以应对算力需求两年增长5-10倍的挑战。无影灵构通过云上工作站提供标准化环境、弹性算力和低延迟3D交互,显著降低研发成本并提升效率。该合作旨在将具身智能研发基础设施标准化,使机器人公司聚焦于模型与算法创新。

8月13日周四 · 3 条
正文顺带提及命中实体:nvidia
量子位商业

Acrab获4.8亿美元融资,端侧AI芯片GΞLIX 1量产在即

新加坡AI芯片公司Acrab完成1.3亿美元B轮融资,累计融资超4.8亿美元,用于扩大产能和研发下一代平台。该公司成立不到三年,首颗端侧AI芯片GΞLIX 1已进入量产准备,并推出个人AI中心Agent Box,瞄准端侧Agent计算需求。Acrab强调CPU与NPU协同、统一内存和Prefill性能,其自测显示在特定条件下Prefill速度达1416 To

正文顺带提及命中实体:nvidia
Hugging Face Blog一手来源模型发布

Hugging Face 发布 Luth-2 法语小模型,采用 MOPD 技术刷新多项基准

Hugging Face 发布了 Luth-2-0.8B 和 Luth-2-2B 两个法语小语言模型,基于 Qwen3.5 后训练,采用多域策略蒸馏(MOPD)技术,在数学、代码、指令跟随、通用知识和工具调用等基准上刷新了同尺寸模型的最优成绩,性能可与两到三倍大小的模型竞争。模型、数据、代码和评估方法均已开源。

正文顺带提及命中实体:nvidia
THE DECODER研究

AI乳腺癌检测工具未达放射科医生预期

一项针对215名乳腺影像学会成员的调查显示,约半数已使用FDA批准的AI工具,但AI在降低召回率、减少不必要活检和减轻倦怠方面的实际效果远低于放射科医生的预期。多数医生仅将AI视为第二意见,成本和缺乏机构支持是主要障碍。AI行业早前关于放射科医生失业的预测被指过于夸大。

8月12日周三 · 1 条
正文顺带提及命中实体:nvidia
THE DECODER产品发布

Mistral 推出欧盟数据处理和优先访问服务,但存在重要限制

Mistral 推出欧盟区域数据处理选项和优先队列访问服务,均需额外付费。区域推理仅覆盖部分功能,且账户设置等数据仍可能在区域外处理。优先层级提供 99.5% 可用性 SLA,但价格上浮 75%。此外,Mistral 平台开始托管第三方模型,如 Z.ai 的 GLM-5.2,并寻求长期算力承诺以支持欧洲数据中心建设。