返回主题地图

NVIDIA 英伟达

公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 229 条。
9月23日周三 · 8 条
正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源1

llama.cpp b11117:HIP 后端用 SWAR 优化 IQ2/IQ3

llama.cpp 发布 b11117 版本,主要变更是针对 HIP 后端优化 IQ2/IQ3 量化格式,使用 SWAR(寄存器内并行)技术以位操作实现 vsub4 和 vcmpne4 指令。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源1

llama.cpp b11115 发布:OpenCL 新增 A8 Q4 K dp4a 二值化内核

llama.cpp 发布 b11115 版本,主要变更为在 OpenCL 后端新增 A8 Q4 K 非 MoE 的 dp4a 二值化 GEMM 内核 kernel gemm noshuffle q4 k q8 1 dp4a ila a8 bin,并重命名了二值化内核选择辅助函数。该版本同时提供覆盖 macOS、iOS、Linux、Android、Window

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源1

llama.cpp 发布 b11113:server 不再向子进程传递日志文件

llama.cpp 发布 b11113 版本,主要变更是 server 不再将日志文件传递给子进程(#29212)。该版本同时提供 macOS/iOS、Linux、Android、Windows、openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源1

llama.cpp b11112:server 支持 function call output 传入图像

llama.cpp 发布 b11112 版本,主要更新是 server 端在 function call output 中支持 input image,即函数调用输出可以携带图像输入。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。这一

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b11110:mtmd 新增多项健全性检查

llama.cpp 发布 b11110 版本,主要变更为 mtmd 模块新增多项 sanity checks(#29276)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO、OpenCL 等

正文顺带提及命中实体:cuda
智东西产品发布

海光发布1000系列CPU,C86架构进军嵌入式与端侧市场

海光信息正式发布海光1000系列CPU,基于C86架构,面向低功耗、嵌入式和端侧算力需求,具备4核8线程、10W典型TDP、-40°C至105°C宽温能力及10年产品生命周期承诺。该产品将海光在数据中心CPU、DCU领域的技术与生态积累延伸至机器人、工业控制、边缘计算等场景,并同步推进嵌入式生态合作。此举标志着国产芯片从数据中心向边缘端侧全场景扩展,增强与国

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b11108:优化 IQ1 M 前缀和计算

llama.cpp 发布 b11108 版本,主要变更是 ggml 中 IQ1 M 量化格式的构建前缀和(prefix sums)改为每块只计算一次,以优化性能。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO

正文顺带提及命中实体:nvidia
The Verge AI商业

a16z 推出无作业“学院”,联合 Palantir、Google、Meta 等

风投公司 Andreessen Horowitz(a16z)宣布成立“Horowitz Andreessen Academy”,定位为年轻人进入或创办硅谷初创公司的通道。该学院有 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit、Stripe 等 10 家合作方,并获得由

9月22日周二 · 12 条
正文顺带提及命中实体:nvidia
AWS Machine Learning Blog一手来源教程

用并发扫描为 SageMaker AI 生成式端点做容量规划

AWS 博客介绍在 Amazon SageMaker AI 上通过并发扫描(concurrency sweep)为生成式 AI 端点做容量规划的方法。文章以部署 NVIDIA Nemotron-3 Nano 30B(MoE,仅 3B 激活参数)到 ml.g7e.2xlarge 为例,使用原生 vLLM 容器和 CreateAIBenchmarkJob API

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b11104:llama-server 支持绑定多个地址

llama.cpp 发布 b11104 版本,主要更新为 llama-server 新增绑定多个地址的能力(PR #28690),并处理了地址重叠、多 TCP 地址下拒绝 --port 0 等边界情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vu

正文顺带提及命中实体:nvidia
TechCrunch AI商业

TechCrunch Disrupt 2026 五场 AI 安全会议前瞻

TechCrunch 预告了 Disrupt 2026 大会上的五场 AI 安全相关会议,覆盖企业部署 Claude、Agent 安全、企业云安全、物理世界 AI 安全以及机器人数据瓶颈等议题。Anthropic、Okta、AWS、Shield AI、通用汽车、Waabi、NVIDIA 等公司的高管将分别分享企业 AI 落地、Agent 权限架构、安全治理、

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b11101:支持重复 find package 调用

llama.cpp 发布 b11101 版本,主要变更是允许对 llama 进行重复的 find package 调用(#29228)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文顺带提及命中实体:nvidia
TechCrunch AI商业

Nscale启动IPO,客户高度集中考验华尔街AI投资胃口

英国云计算公司Nscale计划在纽约证券交易所上市,估值预计达350亿美元,拟募资30亿美元。其IPO文件显示,公司累计合同价值超1030亿美元,但约85%来自微软(438亿美元算力供应)和Anthropic(446亿美元)两大客户,且Anthropic协议以融资到位和达成严格里程碑为前提。此举将再次检验华尔街对客户高度集中的AI基础设施类股票的投资意愿。

正文顺带提及命中实体:nvidia
Hugging Face New and Trending Models一手来源模型发布1

poolside 发布 Laguna XS.2:33B MoE 本地智能体编程模型

poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Ver

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b11100:修复 Muse Glimmer 工具调用解析错误

llama.cpp 发布 b11100 版本,主要修复了 chat 模块中 Muse Glimmer 工具调用(tool-call)首次解析错误的问题,并新增测试验证、精简匹配模式。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYC

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b11097:OpenCL 新增 A8 Q4 0 非 MoE dp4a 内核

llama.cpp 发布 b11097 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 非 MoE 的 dp4a 二值化内核(PR #29055)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO

正文顺带提及命中实体:cuda
vLLM Releases一手来源开源

vLLM 发布 v0.30.0:新增多模型支持与性能优化

vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b11095:Hexagon HMX 优化 GATED DELTA NET

llama.cpp 发布 b11095 版本,主要新增针对高通 Hexagon 平台的 HMX 优化版 GATED DELTA NET(GDN)内核。该 PR 逐步实现了 HMX 支持、流水线化 HMX 与 DMA、HVX 多线程、向量化 expf 及尾部处理优化,并改进了 flash attention 内联 softmax 与 DMA 流水线,使 tok

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b11093:修复 Metal flash attention mask 边界

llama.cpp 发布 b11093 版本,主要修复了 Metal 后端 flash attention 块预处理阶段的 mask 边界问题(PR #29220)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVI

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b11081:测试工具支持可配置张量标准差

llama.cpp 发布 b11081 版本,主要更新了测试工具 test-llama-archs,使其张量数据标准差(stdev)可配置,并改进了帮助信息、用法示例和未知参数报错。同时调整了 test-recurrent-state-rollback 使用 NMSE 检查 logits 回滚,并禁用了部分无效测试。该版本继续提供覆盖 macOS、Linux