Red Hat 发布 Qwen3.6-35B-A3B-FP8 量化模型
原标题:RedHatAI/Qwen3.6-35B-A3B-FP8
AI 摘要
Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24.0 上验证。该版本旨在提升编码代理和前端工作流的性能,同时保留推理上下文以优化迭代开发。
正文节选
--- library_name: transformers pipeline_tag: image-text-to-text base_model: - Qwen/Qwen3.6-35B-A3B tags: - fp8 - vllm - llm-compressor - compressed-tensors name: RedHatAI/Qwen3.6-35B-A3B-FP8 provider: Alibaba Cloud description: FP8 variant of Qwen 3.6 35B for reasoning and tool calling. readme: https://huggingface.co/RedHatAI/Qwen3.6-35B-A3B-FP8/blob/main/README.md tool_calling_supported: true required_cli_args: ['--reasoning-parser qwen3', '--enable-prefix-caching'] default-chat-template-kwargs