返回全部动态

Qwen3.8-27B GPTQ W4A16 量化版发布:支持 vLLM 与视觉

原标题:pearsonkyle/Qwen3.8-27B-GPTQ-W4A16

Hugging Face New and Trending Models一手来源模型发布质量 73

AI 摘要

pearsonkyle 发布了 Qwen3.8-27B 的 GPTQ W4A16 量化版本,基于 Qwen/Qwen3.8-27B,使用 32K 上下文校准,支持 vLLM 直接服务。该模型将 90.5% 参数量化为 int4,但嵌入和输出头保持 bf16,文件大小 18.1 GiB。模型内置 MTP 草稿头实现 1.71 倍解码加速,并保留视觉塔支持图像输入。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- library_name: transformers base_model: - Qwen/Qwen3.8-27B tags: - vllm - compressed-tensors - gptq - w4a16 - int4 - quantization - quantized - 4-bit - llm-compressor - qwen - qwen3 - 27b - tool-use - function-calling - agentic - long-context - 32k-calibration - mtp - speculative-decoding - multimodal - vision - image-text-to-text license: apache-2.0 language: - en pipeline_tag: image-text-to-text --- <div style="font-family: -apple-system, BlinkMacSystemFont, 'Segoe UI', Roboto, sans-serif;


发布时间:2026-09-04 02:45
抓取时间:2026-09-04 02:49
来源机构:Hugging Face
阅读原文huggingface.co