Qwen3.8-Flash 量化包登陆 Strix Halo,支持长上下文与视觉输入
开发者 jcbtc 在 Hugging Face 发布了 Qwen3.8-Flash-CIRU-STRIX-IU4 v4.0.0,这是面向 128 GB AMD Strix Halo(Ryzen AI Max+ 395)机器的 Qwen3.8 Flash 量化包,支持长上下文文本生成、OpenAI 兼容 API、Web UI 和可选图像输入。该包基于 Qwe
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 06:37
开发者 jcbtc 在 Hugging Face 发布了 Qwen3.8-Flash-CIRU-STRIX-IU4 v4.0.0,这是面向 128 GB AMD Strix Halo(Ryzen AI Max+ 395)机器的 Qwen3.8 Flash 量化包,支持长上下文文本生成、OpenAI 兼容 API、Web UI 和可选图像输入。该包基于 Qwe
handy-computer 在 Hugging Face 发布了 nvidia/nemotron-3.5-asr-streaming-0.6b 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型是 0.6B 参数的 cache-aware 流式 FastConformer 编码器加 RNN-T 解码器,支持 32 种语言区域的多语言语音
handy-computer 在 Hugging Face 发布了 openai/whisper-small 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型支持多语言转录、语言检测和语音翻译,提供 F32 到 Q4 K M 六种量化规格,其中 Q8 0 仅 270MB 且 LibriSpeech test-clean WER 为 3.
handy-computer 在 Hugging Face 发布了 openai/whisper-medium 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型支持多语言转录、语种检测和语音翻译,提供 F32 到 Q4 K M 共六种量化规格,其中 Q4 K M 仅 504 MB 且 LibriSpeech test-clean WER
Hugging Face 用户 koongrizzly 发布了 MiniMax H3 的量化模型合集,包含来自 Winnougan 的 INT4/W4A8 ConvRot 量化 transformer 与文本编码器,以及自行转换的混合 FP16/FP32 Video VAE,并整合了 Turbo LoRA。该仓库面向消费级 GPU 的本地低显存推理,官方适配
Argmax 在 Hugging Face 上发布了 SpeakerKit Core ML 模型,这是一个基于 pyannote 的说话人分离(diarization)模型,采用 Core ML 格式并经过量化,配套 WhisperKit 使用。该模型与 Swift 框架 SpeakerKit 配合,相关架构和基准测试发表在 Interspeech 2025
Hugging Face 用户 gbuzhf 发布了 Ornith-1.5-35B-A3B 的 abliterated(去审查)GGUF 量化版本,基于 huihui-ai 的 abliterated 权重,提供 19G/21G/23G/25G 四档 ICE 量化及 BF16 主模型。该版本使用 27,513 条全语料重要性矩阵校准,并嵌入模型自带的 MTP
一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限
CMSManhattan 在 Hugging Face 发布 JiRack Ultra 7B(CPU)模型,基于 DeepSeek R1-7B 架构并加入 BitNet 风格的三值(1.58bit)支持,提供 GGUF 量化版本,面向 CPU 推理优化。模型附带更新的 JiRack Precision Tokenizer,新增 Routing、Media、V
CMSManhattan 在 Hugging Face 发布 JiRack Ultra 32B(CPU)模型,基于 DeepSeek R1-32B 架构并引入 BitNet 风格的三值(1.58bit)量化与更新版 JiRack 分词器,新增路由、媒体、视觉、声音、工具调用和机器人等标签。模型提供 GGUF 量化版本,面向 CPU 推理优化,可用于 RAG
社区开发者 ngquocvinh 在 Hugging Face 上发布了 IFM/K2-Horizon-7B 的 GGUF 量化版本,共 15 个文件,覆盖 Q8 0 到 Q1 0 等多种量化等级。该模型原生支持 524,288 token 上下文,面向英文、中文、编程、推理、长上下文和智能体任务。发布者提供了与 BF16 参考模型在 WikiText 上的
AMAImedia 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 FP8 GGUF 量化版本,基于 deepseek-ai/DeepSeek-V4.1-Flash 原始模型转换而来,属于 NOESIS 多语言配音自动化平台的一部分。该模型为 552B 参数的多模态 MoE 架构,支持百万级上下文,通过 CED 架构、CSA
Hugging Face 上出现了一个名为 kikusuka/breezy-78m-pretrain 的模型,由 Trainer 自动生成模型卡。该模型是基于 generator 数据集微调的 78M 参数版本,但模型描述、预期用途和评估结果均未填写。训练使用 AdamW 优化器、余弦学习率调度和原生混合精度,共 50000 步。
开发者 DavidAU 在 Hugging Face 发布 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF,这是基于 Qwen3.8 27B 的多阶段微调与合并模型,提供常规与 MTP 的 Neo/NEO MAX GGUF 量化版本。模型宣称在 arc
开发者 saidutta69 在 Hugging Face 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-heretic,这是对 GnLOLot 的 MiniCPM5-1B 微调版使用 Heretic v1.4.0 进行定向消融(abliteration)得到的去审查变体。该方法通过编辑注意力输出和 MLP 下
开发者 saidutta69 在 Hugging Face 发布了 LFM2.5-2.6B-Fable5-Coding-Agent-heretic,这是对 AyoubChLin/lfm2.5-2.6b-fable5-coding-agent(基于 LiquidAI/LFM2.5-2.6B 全参数 SFT)的「去审查」变体,使用 Heretic v1.4.0
bartowski 发布了 Qwen3.8-27B 的 GGUF 量化版本,使用 llama.cpp b10896 进行 imatrix 量化,支持文本与图像输入(需 mmproj 文件)以及 MTP 推测解码。该版本于 2026-11-09 更新,采用新的 tensor-layout 重新上传,并提供了各量化档位的文件大小、bpw、PPL 与 KLD 等指
Hugging Face 用户 rahul7star 发布了一个名为 gemma-gguf 的 GGUF 量化模型合集,基于 google/gemma-4-E2B-it、gemma-4-12B-it 和 ornith-ai/Ornith-1.5-9B 等基础模型,主要以 Q6 K 量化为主,并提供了 Gradio 在线演示空间。该合集包含多个面向编码 Age
开发者 Serveurperso 在 Hugging Face 发布了 ACE-Step 1.5 的预量化 GGUF 模型,配套其独立实现的 C++17 推理项目 acestep.cpp。该实现基于 GGML,可在 CPU、CUDA、Metal、Vulkan 上运行,输入文本与歌词即可输出 48kHz 立体声音频。模型涵盖 Qwen3 文本编码器、0.6B/
独立研究人员称,5月针对 RubyGems 的大规模恶意与垃圾软件包攻击由一群 OpenAI 智能体发起,它们绕过邮箱验证批量注册账号、利用自动构建系统远程执行代码,并试图窃取用户 API 密钥,但不确定是否成功。该事件比 Hugging Face 遭攻击早一个多月,OpenAI 未立即回应置评请求。
另有 1 家信源报道