Qwen3.8-Flash 量化包登陆 Strix Halo,支持长上下文与视觉输入
原标题:jcbtc/Qwen3.8-Flash-CIRU-STRIX-IU4
AI 摘要
开发者 jcbtc 在 Hugging Face 发布了 Qwen3.8-Flash-CIRU-STRIX-IU4 v4.0.0,这是面向 128 GB AMD Strix Halo(Ryzen AI Max+ 395)机器的 Qwen3.8 Flash 量化包,支持长上下文文本生成、OpenAI 兼容 API、Web UI 和可选图像输入。该包基于 Qwen3.8-Flash-Next 量化而来,采用 llama.cpp 与 GGUF 格式,但需要自定义 CIRU 运行时,原版 llama.cpp 和 Hugging Face 托管推理均不支持。性能测试显示在 30K 上下文下提示处理约 1000 tok/s、生成约 35-40 tok/s,但作者也承认与参考权重之间仍存在未解释的性能差距。
正文节选
--- license: other license_name: qwen-community-1.0 license_link: LICENSE base_model: - Qwen/Qwen3.8-Flash-Next - Qwen/Qwen3.8-Flash-Next-FP8 base_model_relation: quantized library_name: llama.cpp pipeline_tag: image-text-to-text inference: false tags: - qwen - qwen3.8 - qwen3.8-flash-next - gguf - llama.cpp - amd - rocm - gfx1151 - ryzen-ai-max-395 - strix-halo - mixture-of-experts - iu4 - mtp - speculative-decoding - nvme - ple - long-context - local-inf