返回全部动态
Red Hat 发布 Gemma 4 12B NVFP4 量化模型
原标题:RedHatAI/gemma-4-12B-it-NVFP4
AI 摘要
Red Hat AI 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,该模型权重和激活均量化为 4 位浮点格式,使用 llm-compressor 工具和 GPTQ 方法进行量化,并针对 vLLM 进行了优化。初步评估显示,该量化模型在 GSM8K 和 Wikitext 基准上接近原始 BF16 模型的性能,恢复率超过 89%。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
--- library_name: transformers license: apache-2.0 license_link: https://ai.google.dev/gemma/docs/gemma_4_license pipeline_tag: any-to-any base_model: google/gemma-4-12B-it provider: Google name: RedHatAI/gemma-4-12B-it-NVFP4 description: NVFP4 quantized variant of gemma-4-12B-it. readme: https://huggingface.co/RedHatAI/gemma-4-12B-it-NVFP4/blob/main/README.md tags: - fp4 - vllm - llm-compressor - compressed-tensors tasks: - text-to-text - text-generation - image-text-to-text - audio-text-to-tex
发布时间:2026-08-08 04:17
抓取时间:2026-08-08 04:19
来源机构:Hugging Face