Z-Image NVFP4 高效推理新纪元:Blackwell GPU 上的 4-bit 量化革命

7月 19, 2026

Z-Image NVFP4 高效推理新纪元:Blackwell GPU 上的 4-bit 量化革命

NVFP4 是 NVIDIA 针对 Blackwell 架构推出的 4-bit 浮点格式,专为高效推理设计。结合 Z-Image 模型,NVFP4 量化可以在几乎不损失画质的前提下,将显存占用降低 60–70%,推理速度提升 80–100%。本文将全面介绍 Z-Image NVFP4 量化方案的原理、部署方法和性能数据。

NVFP4 技术背景

什么是 NVFP4?

NVFP4(NVIDIA 4-bit Floating Point)是 NVIDIA 与 Blackwell GPU 一同推出的 4-bit 浮点量化格式。它采用 E2M1 结构(1 个符号位 + 2 个指数位 + 1 个尾数位),在超低精度量化和数值精度之间取得了出色平衡。

格式对比:

格式 位宽 显存节省(相对 BF16) 质量损失
BF16 16-bit 基线
FP8 8-bit 约 50% 极小
GGUF Q8 8-bit 约 50% 极小
NVFP4 4-bit 约 75% 极小(cos ≈ 0.99)

NVFP4 的优势

  • 显存暴降:Z-Image Turbo BF16 峰值约 23 GB → NVFP4 仅约 10 GB
  • 常驻内存:7.5 GB 常驻,可在 DGX Spark (GB10) 等低显存设备上运行
  • 速度翻倍:FP4 内核在 Blackwell GPU 上的吞吐量约为 FP8 的 2 倍
  • 质量保留:余弦相似度对比 BF16 基线达 ~0.99,视觉差异不可感知

Z-Image NVFP4 模型变体

社区已经发布了多种 NVFP4 量化变体,满足不同质量/大小需求:

Z-Image Base NVFP4(由 marcorez8 发布)

变体 NVFP4 层数 保留 BF16 的部分 大小 质量
Ultra 60 Attention + 层 0-4 & 25-29 ~8.0 GB ⭐⭐⭐⭐⭐
Quality 90 所有 Attention (qkv, out) ~6.5 GB ⭐⭐⭐
Mixed 180 Refiners, embedders, 最终层 ~4.5 GB
Full 204 仅关键 embedders ~3.5 GB

原始 BF16 模型大小:12.3 GB

关键洞察:Attention 层(qkv, out)对量化远更敏感,而 Feed-Forward 层(w1, w2, w3)可以安全地量化为 NVFP4 而几乎不损失质量。

Z-Image Turbo NVFP4

Comfy-Org 提供了预量化的 z_image_turbo_nvfp4.safetensors。该版本使用校准后的静态激活缩放,专门针对 Turbo 蒸馏架构优化。

性能基准测试

SECourses 基准数据(2026 年 1 月)

在 RTX 5090 和 RTX 6000 Blackwell 上测试,2048px 分辨率:

模型 精度 速度 显存 质量
Z-Image Turbo BF16 基线 ~23 GB ⭐⭐⭐⭐⭐
Z-Image Turbo GGUF Q8 快 87% ~12 GB ⭐⭐⭐⭐
Z-Image Turbo NVFP4 快 87% ~10 GB ⭐⭐⭐⭐
Z-Image Turbo FP8 Scaled 快 30% ~14 GB ⭐⭐⭐⭐⭐

NVFP4 在 Z-Image Turbo 上实现 87% 的速度提升,同时显存降至 10 GB。

DGX Spark(GB10)实测数据

来自 NVIDIA Developer Forum 的真实部署数据:

指标
峰值 VRAM(NVFP4) ~10 GB
常驻内存 ~7.5 GB
推理时间(1024²,8步) ~19 秒
质量(cos vs BF16) ~0.99
GPU NVIDIA GB10 (SM 12.1)
软件栈 PyTorch 2.11.0 + diffusers git + comfy-kitchen

部署方案

方案一:ComfyUI 直接加载(推荐新手)

  1. 下载对应变体的 NVFP4 safetensors 文件
  2. 放入 ComfyUI models/checkpoints/ 目录
  3. 推荐设置:
    • Z-Image Base:Steps 28–50, CFG 3.0–5.0
    • Z-Image Turbo:Steps 8, CFG ~1.0

方案二:Diffusers + comfy-kitchen(高级用户)

适合需要无 ComfyUI 环境、直接使用 HuggingFace Diffusers 的场景:

# 环境配置
uv venv .venv --python 3.12
source .venv/bin/activate
uv pip install torch==2.11.0 torchvision --index-url https://download.pytorch.org/whl/cu130

# 安装 diffusers git main(Z-Image 原生支持)
uv pip install "diffusers @ git+https://github.com/huggingface/diffusers"
uv pip install transformers accelerate safetensors

# 安装 comfy-kitchen(NVFP4 内核)
sudo apt install -y python3.12-dev
uv pip install "setuptools>=61" wheel "nanobind>=2.0.0" cmake ninja
git clone https://github.com/comfy-org/comfy-kitchen
cd comfy-kitchen
PATH="$VIRTUAL_ENV/bin:$PATH" uv pip install -e ".[cublas]" --no-build-isolation

量化权重代码示例:

from diffusers import ZImagePipeline
from comfy_kitchen.tensor import QuantizedTensor
import torch

# 加载 BF16 基线
pipe = ZImagePipeline.from_pretrained(
    "Tongyi-MAI/Z-Image-Turbo",
    torch_dtype=torch.bfloat16
).to("cuda")

# 对每个 Linear 层执行 NVFP4 量化
for name, module in pipe.transformer.named_modules():
    if isinstance(module, torch.nn.Linear) and hasattr(module, 'weight'):
        qw = QuantizedTensor.from_float(
            module.weight.data,
            "TensorCoreNVFP4Layout"
        )
        module.weight.data = qw

# 推理(动态激活量化)
img = pipe(
    "a grey heron at dusk",
    num_inference_steps=8,
    guidance_scale=1.0,
    height=1024,
    width=1024
).images[0]

方案三:nunchaku 内核(Blackwell 50 系列优化)

对于 RTX 5090/5080 用户,nunchaku 提供了专门优化的 FP4 内核:

pip install nunchaku

该方案可在 50 系列 GPU 上将 Z-Image Turbo 的 1024×1536 图像生成时间从 30 秒降至约 6 秒。

重要注意事项

GGUF 文件的兼容性陷阱

预量化的 GGUF 文件(如 leejet/Z-Image-Turbo-GGUF)无法通过 diffusers 加载。 这些文件使用原始的 Z-Image 布局(dim 2160,fused qkv),而 diffusers 的 ZImageTransformer2DModel 使用 dim 3840 且拆分为 to_q/k/v。名称映射正确但形状不匹配。

解决方案: 直接对原生 diffusers 权重执行 NVFP4 量化,而不是尝试转换 GGUF 文件。

硬件要求

硬件 NVFP4 支持 说明
NVIDIA Blackwell (RTX 5090, RTX 5080, GB10, B200) ✅ 完全支持 原生 FP4 硬件支持
NVIDIA Hopper (H100, H200) ⚠️ 部分支持 通过 cuBLASLt 回退
NVIDIA Ada Lovelace (RTX 4090, RTX 4080) ❌ 不支持 可运行 BF16 或 GGUF
其他 GPU ❌ 不支持 考虑 GGUF 或 AWQ 量化

版本兼容性

截至 2026 年 5 月已验证的版本组合:

  • torch 2.11.0+cu130
  • diffusers 0.39.0.dev0 (git)
  • transformers 5.9.0
  • comfy-kitchen 0.2.10
  • nvcc 13.0.88

结论

NVFP4 量化代表了 Z-Image 模型推理效率的最新前沿。对于 Blackwell 系列 GPU 用户,NVFP4 提供了近乎无损的质量、接近翻倍的速度和仅需原版 40% 的显存占用。这使得在 DGX Spark 等低功率设备上运行 Z-Image 成为现实,同时也让 RTX 5090 用户可以体验到秒级生成。

无论你是想要在有限的 VRAM 环境中运行模型,还是追求最高的生成吞吐量,NVFP4 都是 2026 年 Z-Image 用户不可忽视的技术选择。

Z-Image Team

Z-Image NVFP4 高效推理新纪元:Blackwell GPU 上的 4-bit 量化革命 | Blog