llama.cpp b11117:HIP 后端用 SWAR 优化 IQ2/IQ3
llama.cpp 发布 b11117 版本,主要变更是针对 HIP 后端优化 IQ2/IQ3 量化格式,使用 SWAR(寄存器内并行)技术以位操作实现 vsub4 和 vcmpne4 指令。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
llama.cpp 发布 b11117 版本,主要变更是针对 HIP 后端优化 IQ2/IQ3 量化格式,使用 SWAR(寄存器内并行)技术以位操作实现 vsub4 和 vcmpne4 指令。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译
llama.cpp 发布 b11115 版本,主要变更为在 OpenCL 后端新增 A8 Q4 K 非 MoE 的 dp4a 二值化 GEMM 内核 kernel gemm noshuffle q4 k q8 1 dp4a ila a8 bin,并重命名了二值化内核选择辅助函数。该版本同时提供覆盖 macOS、iOS、Linux、Android、Window
llama.cpp 发布 b11113 版本,主要变更是 server 不再将日志文件传递给子进程(#29212)。该版本同时提供 macOS/iOS、Linux、Android、Windows、openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11112 版本,主要更新是 server 端在 function call output 中支持 input image,即函数调用输出可以携带图像输入。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。这一
llama.cpp 发布 b11110 版本,主要变更为 mtmd 模块新增多项 sanity checks(#29276)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO、OpenCL 等
海光信息正式发布海光1000系列CPU,基于C86架构,面向低功耗、嵌入式和端侧算力需求,具备4核8线程、10W典型TDP、-40°C至105°C宽温能力及10年产品生命周期承诺。该产品将海光在数据中心CPU、DCU领域的技术与生态积累延伸至机器人、工业控制、边缘计算等场景,并同步推进嵌入式生态合作。此举标志着国产芯片从数据中心向边缘端侧全场景扩展,增强与国
llama.cpp 发布 b11108 版本,主要变更是 ggml 中 IQ1 M 量化格式的构建前缀和(prefix sums)改为每块只计算一次,以优化性能。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO
风投公司 Andreessen Horowitz(a16z)宣布成立“Horowitz Andreessen Academy”,定位为年轻人进入或创办硅谷初创公司的通道。该学院有 Anduril、Anthropic、Coinbase、Google、Meta、NVIDIA、OpenAI、Palantir、Replit、Stripe 等 10 家合作方,并获得由
AWS 博客介绍在 Amazon SageMaker AI 上通过并发扫描(concurrency sweep)为生成式 AI 端点做容量规划的方法。文章以部署 NVIDIA Nemotron-3 Nano 30B(MoE,仅 3B 激活参数)到 ml.g7e.2xlarge 为例,使用原生 vLLM 容器和 CreateAIBenchmarkJob API
llama.cpp 发布 b11104 版本,主要更新为 llama-server 新增绑定多个地址的能力(PR #28690),并处理了地址重叠、多 TCP 地址下拒绝 --port 0 等边界情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vu
TechCrunch 预告了 Disrupt 2026 大会上的五场 AI 安全相关会议,覆盖企业部署 Claude、Agent 安全、企业云安全、物理世界 AI 安全以及机器人数据瓶颈等议题。Anthropic、Okta、AWS、Shield AI、通用汽车、Waabi、NVIDIA 等公司的高管将分别分享企业 AI 落地、Agent 权限架构、安全治理、
llama.cpp 发布 b11101 版本,主要变更是允许对 llama 进行重复的 find package 调用(#29228)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
英国云计算公司Nscale计划在纽约证券交易所上市,估值预计达350亿美元,拟募资30亿美元。其IPO文件显示,公司累计合同价值超1030亿美元,但约85%来自微软(438亿美元算力供应)和Anthropic(446亿美元)两大客户,且Anthropic协议以融资到位和达成严格里程碑为前提。此举将再次检验华尔街对客户高度集中的AI基础设施类股票的投资意愿。
poolside 发布 Laguna XS.2,一个 33B 总参数、每 token 激活 3B 的混合专家(MoE)模型,面向本地运行的智能体编程与长周期任务。模型采用滑动窗口注意力与全局注意力 3:1 混合布局、FP8 KV 缓存和原生交错推理,支持 262,144 token 上下文,并以 Apache 2.0 许可开源。在 SWE-bench Ver
llama.cpp 发布 b11100 版本,主要修复了 chat 模块中 Muse Glimmer 工具调用(tool-call)首次解析错误的问题,并新增测试验证、精简匹配模式。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYC
llama.cpp 发布 b11097 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 非 MoE 的 dp4a 二值化内核(PR #29055)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K
llama.cpp 发布 b11095 版本,主要新增针对高通 Hexagon 平台的 HMX 优化版 GATED DELTA NET(GDN)内核。该 PR 逐步实现了 HMX 支持、流水线化 HMX 与 DMA、HVX 多线程、向量化 expf 及尾部处理优化,并改进了 flash attention 内联 softmax 与 DMA 流水线,使 tok
llama.cpp 发布 b11093 版本,主要修复了 Metal 后端 flash attention 块预处理阶段的 mask 边界问题(PR #29220)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVI
llama.cpp 发布 b11081 版本,主要更新了测试工具 test-llama-archs,使其张量数据标准差(stdev)可配置,并改进了帮助信息、用法示例和未知参数报错。同时调整了 test-recurrent-state-rollback 使用 NMSE 检查 logits 回滚,并禁用了部分无效测试。该版本继续提供覆盖 macOS、Linux