RTX5090 优化版 Qwen3.8-27B NVFP4 量化模型发布
原标题:gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090
AI 摘要
Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144 token 上下文,配合 DSpark v2 推测解码器在 SparkInfer 上可达 264.8 tok/s(代码场景最高 420 tok/s),在 SGLang 上达 161.7 tok/s。模型以 17.92GB 双分片发布,支持 SparkInfer、SGLang 和 vLLM 三种推理引擎,仅限 Blackwell 架构运行。
正文节选
--- license: apache-2.0 base_model: Qwen/Qwen3.8-27B pretty_name: RTX5090 Blackwell GPU Optimized Qwen-3.8-27B-NVFP4 library_name: transformers pipeline_tag: image-text-to-text tags: - nvfp4 - modelopt - nvidia - rtx-5090 - blackwell - quantization - qwen3.8 - sparkinfer - sglang - vllm --- # RTX5090 Blackwell GPU Optimized Qwen-3.8-27B-NVFP4 <p align="center"> <img src="assets/rtx5090-hero-engines.png" alt="One RTX 5090, three ways to serve it, one NVFP4 build to beat. D