返回全部动态

RTX5090 优化版 Qwen3.8-27B NVFP4 量化模型发布

原标题:gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090

Hugging Face New and Trending Models一手来源模型发布质量 63

AI 摘要

Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144 token 上下文,配合 DSpark v2 推测解码器在 SparkInfer 上可达 264.8 tok/s(代码场景最高 420 tok/s),在 SGLang 上达 161.7 tok/s。模型以 17.92GB 双分片发布,支持 SparkInfer、SGLang 和 vLLM 三种推理引擎,仅限 Blackwell 架构运行。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- license: apache-2.0 base_model: Qwen/Qwen3.8-27B pretty_name: RTX5090 Blackwell GPU Optimized Qwen-3.8-27B-NVFP4 library_name: transformers pipeline_tag: image-text-to-text tags: - nvfp4 - modelopt - nvidia - rtx-5090 - blackwell - quantization - qwen3.8 - sparkinfer - sglang - vllm --- # RTX5090 Blackwell GPU Optimized Qwen-3.8-27B-NVFP4 <p align="center"> <img src="assets/rtx5090-hero-engines.png" alt="One RTX 5090, three ways to serve it, one NVFP4 build to beat. D


发布时间:2026-09-10 09:49
抓取时间:2026-08-19 11:01
来源机构:Hugging Face
阅读原文huggingface.co