返回主题地图

NVIDIA 英伟达

公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给

关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49

顺带提及正文出现过,但不是文章的主要讨论对象,当前共 229 条。
9月11日周五 · 6 条
正文顺带提及命中实体:nvidia
InfoQ AI ML and Data Engineering研究

LinkedIn 用多教师蒸馏将 AI 职位搜索训练提速 8 倍

LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b10903 发布:修复 Vulkan argsort 竞态与越界

llama.cpp 发布 b10903 版本,修复了 Vulkan 后端 argsort 中的竞态条件和越界访问问题(PR #28705),其中越界访问可能解释 CI 中的失败。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b10902 发布:OpenCL 新增 A8 Q4 0 矩阵乘法内核

llama.cpp 发布 b10902 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 矩阵乘法的二进制内核支持(PR #28268)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b10901:Vulkan 空闲时改用 CPU 写入

llama.cpp 发布 b10901 版本,主要变更是 Vulkan 后端在上下文空闲时,ggml backend vk cpy tensor async 改用 CPU 写入方式。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b10900:Vulkan 启用 topk moe 融合

llama.cpp 发布 b10900 版本,主要变更是 Vulkan 后端使用 add alloc dep 以在 prefill 阶段启用 topk moe 融合(PR #28422)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、C

正文顺带提及命中实体:nvidia
InfoQ AI ML and Data Engineering模型发布

OpenAI 发布 GPT-6 Astra,聚焦编程与计算机操作

OpenAI 发布 GPT-6 Astra,面向计算机操作、编程、专业工作流、科学和网络安全场景,初期向有限机构开放,并逐步上线 ChatGPT Plus、Pro、Business、Enterprise 及 OpenAI API、Microsoft Azure 和 AWS Bedrock。Astra 可操作图形界面完成填表、更新 CRM、建站、数据分析等任务

9月10日周四 · 9 条
正文顺带提及命中实体:nvidia
The Verge AI产品发布

环球音乐携手ElevenLabs推出AI音乐创作平台

环球音乐集团(UMG)宣布与AI语音与音乐生成公司ElevenLabs达成多年授权协议,将推出一个AI音乐平台,允许用户基于其授权曲库创作混音、串烧和改编作品。艺人可自行选择是否参与。UMG此前已与Udio开发AI音乐平台,并与Spotify、Nvidia、Klay达成AI授权合作;本周Suno也发布了基于华纳音乐等授权歌曲训练的首个AI音乐模型。

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b10894:清理旧模型死代码并更新多平台构建

llama.cpp 发布 b10894 版本,主要改动是清理旧模型代码中已失效的 switch 分支(#28669),移除早期重构时复制粘贴、现已不可能触发的条件判断,仅保留 llama model bert::graph::graph 的共享逻辑。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b10893:提高 Add fusion 测试容差

llama.cpp 发布 b10893 版本,主要变更是提高 Add fusion 测试的容差(#28691)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp 发布 b10892:移除测试中 SYCL 特殊处理

llama.cpp 发布 b10892 版本,主要变更是从 test-backend-ops.cpp 中移除 SYCL 的特殊处理逻辑(PR #28688)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CU

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b10889 发布:索引器不再分配未使用的 V cache

llama.cpp 发布 b10889 版本,主要改动是内存优化:在索引器场景下不再分配 V cache,因为该缓存实际未被使用(PR #28330,由 Stanisław Szymczyk 参与)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope

正文顺带提及命中实体:nvidia
雷峰网 AI科技评论研究

ECCV 2026 世界模型爆发:中国学者如何卡位

ECCV 2026 将于 2026 年 9 月在瑞典马尔默开幕,共接收 2883 篇论文(接收率 27.5%),86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,密度为 ECCV 历史之最,Yann LeCun、Jürgen Schmidhuber 等将作 keynote。文章认为这标志 AI 竞

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源开源

llama.cpp b10887:s390x 增加 q4 0 repack 支持

llama.cpp 发布 b10887 版本,主要变更为在 ggml-cpu 的 s390x 架构上为 q4 0 量化格式增加 repack 支持,并清理了相关注释。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、Op

正文顺带提及命中实体:nvidia
Hugging Face New and Trending Models一手来源模型发布

RTX5090 优化版 Qwen3.8-27B NVFP4 量化模型发布

Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144

正文顺带提及命中实体:cuda
Hugging Face New and Trending Models一手来源开源

GAP-models 仓库发布:备份与量化评估模型存档

Hugging Face 上发布了 GAP-models 仓库,用于备份 GAP 参考生成和量化评估所用的本地模型,包含多个模型族和检查点。仓库通过清单和 SHA256 校验确保文件来源和完整性,并记录了候选模型的资格评估结果,评估基于特定 CUDA 构建和硬件环境。文件保留原始模型的许可和归属,不统一替换许可。

9月9日周三 · 5 条
正文顺带提及命中实体:nvidia
AWS Machine Learning Blog一手来源产品发布

AWS 推出 Ray Serve 深度学习容器,简化 TorchServe 推理工作负载

AWS 发布了 Ray Serve 深度学习容器(DLC),用于替代不再维护的 TorchServe,提供预构建、优化的推理镜像。该容器集成了 PyTorch、Ray Serve、CUDA 等组件,并支持在 Amazon EKS 上部署视觉语言模型(如 Qwen3-VL-2B)。文章详细介绍了部署步骤和架构,旨在简化模型推理的依赖管理和安全补丁更新。

正文顺带提及命中实体:nvidia
Transformers Releases一手来源产品发布

Transformers v5.17.0 发布:新增 HYV4、VibeVoice 等模型支持

Hugging Face Transformers 库发布 v5.17.0 版本,新增多个模型支持,包括 HYV4、VibeVoice、NeoMME、Fun-ASR-Nano、KimiLinear 和 Canary。这些模型涵盖语言、语音、多模态等不同领域,并引入了多种创新架构。该版本扩展了 Transformers 的模型生态,为开发者提供了更多选择。

正文顺带提及命中实体:cuda
llama.cpp Releases一手来源产品发布

llama.cpp b10877 发布:优化 RDNA3 上 MoE 推理性能

llama.cpp 发布 b10877 版本,主要更新为 CUDA 后端针对 RDNA3 架构的 MoE 模型推理优化,通过根据典型专家宽度调整 MMQ 的 N-tiles 大小来提升性能。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。

正文顺带提及命中实体:nvidia
THE DECODER产品发布

Hugging Face 推出 ML Intern,通过聊天即可运行机器学习实验

Hugging Face 推出了内置在其聊天机器人中的 AI 助手“ML Intern”,允许用户通过对话描述想法来运行机器学习实验,无需专业知识。该助手能搜索模型和数据集、估算成本并自动执行训练、监控和报告等任务。Hugging Face 表示,示例实验运行约六小时,成本不到 0.50 美元。此举降低了机器学习项目的门槛,而 Hugging Face 正被

正文顺带提及命中实体:nvidia
量子位商业

具身智能进超市:汉朔与X-Era Lab联手全球7万门店落地

汉朔科技与X-Era Lab合作,将具身智能机器人引入全球近7万家零售门店,用于巡检、盘点和补货。汉朔提供电子价签网络和数字孪生场景底座,X-Era Lab提供原生世界动作模型VWA,双方旨在将具身智能从演示Demo转化为可持续运行的生产级系统。