llama.cpp b10947 修复 nemotron-h 专家 FFN 除零崩溃
llama.cpp 发布 b10947 版本,修复了 nemotron-h 模型在加载时的专家 FFN 尺寸回退逻辑缺陷。当 NextN/MTP 尾部循环中 expert feed forward length 未提供该层数值时,代码会用 n ff/n expert used 推导专家 FFN 尺寸,而这两个逐层数组在非 MoE 层上合法地为 0,导致同时为
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10947 版本,修复了 nemotron-h 模型在加载时的专家 FFN 尺寸回退逻辑缺陷。当 NextN/MTP 尾部循环中 expert feed forward length 未提供该层数值时,代码会用 n ff/n expert used 推导专家 FFN 尺寸,而这两个逐层数组在非 MoE 层上合法地为 0,导致同时为
llama.cpp 发布 b10946 版本,主要变更是为 ggml-cpu 的 s390x 架构添加对 VXE 专用 repack 辅助函数的保护(PR #28775)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、Ope
Hugging Face 用户 gbuzhf 发布了 Ornith-1.5-35B-A3B 的 abliterated(去审查)GGUF 量化版本,基于 huihui-ai 的 abliterated 权重,提供 19G/21G/23G/25G 四档 ICE 量化及 BF16 主模型。该版本使用 27,513 条全语料重要性矩阵校准,并嵌入模型自带的 MTP
一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限
llama.cpp 发布 b10944 版本,主要修复 SYCL 后端获取内存时的错误(#28227),包括对不支持 ZES API 的处理、优化代码、调整日志级别、清理无用头文件,并修复检测 Level Zero SDK/开发包失败时的构建错误。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。
CMSManhattan 在 Hugging Face 发布 JiRack Ultra 7B(CPU)模型,基于 DeepSeek R1-7B 架构并加入 BitNet 风格的三值(1.58bit)支持,提供 GGUF 量化版本,面向 CPU 推理优化。模型附带更新的 JiRack Precision Tokenizer,新增 Routing、Media、V
社区开发者 ngquocvinh 在 Hugging Face 上发布了 IFM/K2-Horizon-7B 的 GGUF 量化版本,共 15 个文件,覆盖 Q8 0 到 Q1 0 等多种量化等级。该模型原生支持 524,288 token 上下文,面向英文、中文、编程、推理、长上下文和智能体任务。发布者提供了与 BF16 参考模型在 WikiText 上的
中国实验室 AllSpark 发布开源搜索智能体 Iris-mini(350 亿参数)和 Iris-pro(3970 亿参数),基于 Qwen 系列模型,支持 256K 上下文,并公开完整训练配方。训练数据从网页链接结构反向构造多步问题,经两阶段过滤和强化学习(SFT-RL climbing)优化。团队称两者在各自规模的开源搜索智能体中表现最强,并指出运行时
AMAImedia 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 FP8 GGUF 量化版本,基于 deepseek-ai/DeepSeek-V4.1-Flash 原始模型转换而来,属于 NOESIS 多语言配音自动化平台的一部分。该模型为 552B 参数的多模态 MoE 架构,支持百万级上下文,通过 CED 架构、CSA
开发者 DavidAU 在 Hugging Face 发布 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF,这是基于 Qwen3.8 27B 的多阶段微调与合并模型,提供常规与 MTP 的 Neo/NEO MAX GGUF 量化版本。模型宣称在 arc
开发者 Dakuwon Moody 在 Hugging Face 发布了 SImi-2B 的公开权重镜像,这是一个约 23.2 亿参数的 Llama 风格因果语言模型,使用 JAX/Flax 在 AMD MI300X 上以 bf16 训练。该仓库仅提供权重,不包含架构源码、训练器或 Transformers 检查点,因此无法通过 AutoModel.from
量子位报道了画图Agent Archify开发者涂少坤的故事。Archify单日最高新增5000 Star,总获5.88万Star、3.8k Fork,项目与开发者双双登顶GitHub热榜。涂少坤16岁辍学打工,后通过专升本考入重庆邮电大学,求职时因'专升本'学历多次在HR背调环节被撤回offer,最终成为小红书AI Native工程师。他将Archify的
开发者 saidutta69 在 Hugging Face 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-heretic,这是对 GnLOLot 的 MiniCPM5-1B 微调版使用 Heretic v1.4.0 进行定向消融(abliteration)得到的去审查变体。该方法通过编辑注意力输出和 MLP 下
开发者 saidutta69 在 Hugging Face 发布了 LFM2.5-2.6B-Fable5-Coding-Agent-heretic,这是对 AyoubChLin/lfm2.5-2.6b-fable5-coding-agent(基于 LiquidAI/LFM2.5-2.6B 全参数 SFT)的「去审查」变体,使用 Heretic v1.4.0
llama.cpp 发布 b10938 版本,主要修复 Vulkan 后端的一个驱动 bug:当同一 VkDevice 上的两个队列同时提交时,会破坏内部同步。在驱动修复前,项目在 queuesubmit 周围加互斥锁作为临时方案。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包。
bartowski 发布了 Qwen3.8-27B 的 GGUF 量化版本,使用 llama.cpp b10896 进行 imatrix 量化,支持文本与图像输入(需 mmproj 文件)以及 MTP 推测解码。该版本于 2026-11-09 更新,采用新的 tensor-layout 重新上传,并提供了各量化档位的文件大小、bpw、PPL 与 KLD 等指
llama.cpp 发布 b10937 版本,主要变更是将 OpenCL 后端的 noshuffle 行对齐规则从仅适用于 q6 K 扩展到 q4 K、q5 K 和 q8 0 量化类型(PR #28575)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、
Hugging Face 用户 rahul7star 发布了一个名为 gemma-gguf 的 GGUF 量化模型合集,基于 google/gemma-4-E2B-it、gemma-4-12B-it 和 ornith-ai/Ornith-1.5-9B 等基础模型,主要以 Q6 K 量化为主,并提供了 Gradio 在线演示空间。该合集包含多个面向编码 Age
llama.cpp 发布 b10936 版本,主要改进 qwen3-coder 聊天解析器对复杂类型的支持,并清理了相关语法。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件。
llama.cpp 发布 b10935 版本,主要变更是为 common 模块新增 LOG JSON 宏,用于记录结构化数据,并在 fit 中加入了演示用法。该版本同时提供了覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO