UkisAI 发布 Swift-Qwen3.8-27B-NVFP4 混合精度量化模型
UkisAI 在 Hugging Face 发布 Swift-Qwen3.8-27B-NVFP4,这是其推理高效模型 Swift-Qwen3.8-27B 的 NVFP4/FP8 混合精度量化版本,基于 NVIDIA Model Optimizer 从原始 BF16 权重直接生成。该版本将 192 个 MLP 投影和 lm head 量化为 NVFP4(blo
公司与模型 · 英伟达的 AI 芯片与生态动态:GPU 新品、CUDA 生态、机器人平台与 AI 算力供给
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 05:49
UkisAI 在 Hugging Face 发布 Swift-Qwen3.8-27B-NVFP4,这是其推理高效模型 Swift-Qwen3.8-27B 的 NVFP4/FP8 混合精度量化版本,基于 NVIDIA Model Optimizer 从原始 BF16 权重直接生成。该版本将 192 个 MLP 投影和 lm head 量化为 NVFP4(blo
Lovable 联合创始人 Fabian Hedin 在阿姆斯特丹 HumanX 峰会上表示,公司年度经常性收入已突破 6 亿美元,高于 6 月时约 5 亿美元的水平。公司重点发展企业业务,声称财富 500 强中三分之二的企业已在使用其产品,客户包括微软、英伟达和德国电信。Hedin 还称用户在该平台创建的应用每月合计获得近 10 亿次浏览,并强调 Lova
Google DeepMind 新任负责人 Koray Kavukcuoglu 首次以负责人身份公开露面,表示希望 Gemini 4 远早于年底发布,目前处于后训练早期阶段,内部已用于编码工具 Antigravity。他称 AGI 是否实现“不是正确的对话”,应关注能否构建可信的智能体,这标志着 DeepMind 从 AGI 研究实验室向 Gemini 产品
llama.cpp 发布 b11159 版本,主要修复了 Vulkan 后端在 conv 2d 和 conv 3d 卷积操作中的内存对齐(misalignment)问题,并修正了 test-backend-ops 的打印输出。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan、RO
llama.cpp 发布 b11158 版本,主要变更为在 Vulkan 后端为 Adreno GPU 调优 KHR cooperative matrix 支持(PR #29328),包括启用 coopmat 支持并修复 mul mat s。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
用户 xidisdg 在 Hugging Face 发布了 Qwen3.8-27B 的 NInfer 原生 .ninfer 量化模型文件,包含 NVFP4、NVFP4Full 及 DFlash2 变体,并区分原始版本与适配最新版 NInfer 的 V3 版本。文件仅兼容 NInfer 运行时,非 GGUF 或 Safetensors,发布者提示 uncens
llama.cpp 发布 b11155 版本,主要修复了 server 和 common 模块中 GCC 12 的 stringop-overread 误报问题(由 Adrien Gallouët 提交,PR #29325)。该版本同时提供了覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,
llama.cpp 发布 b11154 版本,主要更新了 test-save-load-state 测试工具:在 --models 模式下改为输出每个模型的逐项测试结果表格,用彩色 PASS/FAIL/SKIP 单元格替代原先冗长的日志输出,并在 -h 帮助中增加示例用法。该改动仅影响测试工具的输出格式,单模型模式输出与退出码保持不变,同时提供覆盖 macO
llama.cpp 发布 b11149 版本,主要变更是为 test-llama-archs 测试工具新增 -b/--backend 选项,用于针对特定后端进行测试。该改动由社区贡献者提交并合并。同时该版本照例提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11147 版本,主要变更为在 OpenCL 后端新增 A8 Q6 K 非 MoE 的 dp4a 二值化内核(PR #29057)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SY
llama.cpp 发布 b11146 版本,将版本号提升至 0.5.0(PR #29333)。该版本为 macOS/iOS、Linux、Android、Windows 及 openEuler 等多个平台提供预编译二进制包,覆盖 CPU、CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL 等多种后端,并附带 UI 包。
llama.cpp 发布 b11139 版本,主要修复了 server 端在 sleep 状态下 token counting API 崩溃的问题,并改进了休眠服务器的唤醒逻辑。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译二进制
llama.cpp 发布 b11135 版本,主要修复了 server 端通过 dedup-cache-models 对草稿 HF 模型进行去重的问题(对应 issue #27846),并避免在 lambda 中捕获结构化绑定。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11130 版本,主要更新为 make-release 流程中的 summary prompt 调整。该版本提供了覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
llama.cpp 发布 b11125 版本,主要变更是 ggml-meta 解析多缓冲区视图(multi buffer views),并添加 TODO 以便在图分配器重构后重新审视。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
llama.cpp 发布 b11123 版本,主要变更为 SYCL 后端新增 mul mat hadamard fp16 的 UT 测试用例(#29218)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制,覆盖 CPU、CUDA 12/13、Vulkan、ROCm 10.0、OpenVINO、SYCL F
llama.cpp 发布 b11122 版本,主要更新为 SYCL 后端扩展 MMVQ GLU 融合,支持混合量化类型,并新增 rms norm+scale 与 ssm conv+silu 融合。同时提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
llama.cpp 发布 b11121 版本,主要变更为 SYCL 后端新增对 get rows back 算子的支持,目前仅支持 fp32/fp16 精度,并同步更新了 ops.md 文档。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CUDA、Vulkan、ROC
llama.cpp 发布 b11119 版本,主要变更是采样器(sampler)中 probe 体积的缩减(PR #29285)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11118 版本,核心变更是引入 hex-dma 直接映射 DMA 缓存,用于更好地处理 HVX 上的 flash attention 掩码(FA mask)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO