Z-Image Base 模型完全指南:从零开始掌握基础模型

7月 16, 2026

Z-Image Base 模型完全指南:从零开始掌握基础模型

为什么 Z-Image Base 如此重要?

2025 年 11 月,Z-Image Turbo 以 6B 参数的惊人效率和 8 步推理的闪电速度震惊了 AI 图像生成社区。但 Turbo 是一个蒸馏模型——它被优化用于快速照片级写实生成,牺牲了创造力和样式多样性。

社区一直期待的 Z-Image Base 终于在 2026 年 1 月 27 日 正式发布。Base 模型是 Turbo 背后的未蒸馏基础模型,专为需要更高创造力和微调灵活性的用户设计。

本文将带你全面了解 Z-Image Base,从架构差异到实战部署,帮你判断何时应该选择 Base 而非 Turbo。

Base vs Turbo:核心差异速览

特性 Z-Image Base Z-Image Turbo
发布时间 2026-01-27 2025-11-26
参数量 6B 6B
推理步数 28-50 步 8 步
CFG (无分类器引导) 3-7(可调) 1(固定)
负向提示词 ✅ 支持 ❌ 不支持
样式多样性 ✅ 丰富 ⚠️ 偏照片级
LoRA 训练 ✅ 非常适合 ⚠️ 受限
BF16 显存需求 ~16-20GB ~14-16GB
FP8 显存需求 ~10-12GB ~8-10GB
GGUF 最低显存 ~6GB ~4-6GB

Z-Image Base 的核心优势

1. CFG 自由调优

Turbo 的 CFG 被固定在 1,即无分类器引导被蒸馏过程取代。这意味着用户无法通过调整 CFG 来控制"模型理解 vs 创造力"的平衡。

Base 模型支持 CFG 3-7 的灵活调整。较低的 CFG(3-4)产生更接近训练数据分布的结果,较高 CFG(5-7)增强对提示词的遵循度,同时带来更大的创造力空间。

2. 负向提示词

Base 模型完整支持负向提示词(negative prompt)。你可以指定"模糊、低质量、变形的手"等负面描述来排除不需要的元素。这是 Turbo 无法做到的。

3. 卓越的 LoRA 训练兼容性

这是 Base 模型最大的亮点。Turbo 作为蒸馏模型,在 LoRA 训练中存在限制——蒸馏过程已将模型参数空间压缩,可训练的自由度降低。

Base 模型保留完整的参数空间:

  • 训练质量更高:Base 的未蒸馏权重提供更丰富的特征表示
  • 风格多样性:从照片写实到手绘、油画、3D 渲染,Base 更能学习各种风格
  • 更好的泛化性:Base 训练的 LoRA 在新场景下表现更稳定

4. 更丰富的输出风格

Turbo 本质上是为大容量照片级输出优化的。当尝试其他风格(如水彩、动漫、像素艺术)时,Turbo 的表现参差不齐。

Base 模型在风格多样性上明显更强,因为它保留了原始训练分布的全部宽度。

部署与性能

硬件需求对比

GPU Z-Image Base (40步) Z-Image Turbo (8步)
RTX 4090 24GB ~8-12 秒 ~2-3 秒
RTX 4080 16GB ~12-18 秒 (BF16) ~3-5 秒
RTX 4060 8GB ~20-30 秒 (FP8) ~5-8 秒 (FP8)
RTX 3060 6GB ~8-15 秒 (GGUF Q4) ~5-10 秒 (GGUF Q4)

ComfyUI 工作流集成

在 ComfyUI 中使用 Z-Image Base 的步骤:

  1. 更新 ComfyUI 到最新版本(2026 年 1 月后版本原生支持 Base)
  2. 下载模型权重:从 HuggingFace Tongyi-MAI/Z-Image 下载
  3. 加载 Z-Image Base 节点(与 Turbo 共用加载器,但选择 Base 权重)
  4. 推荐参数:
    • 步数:30-40 步(黄金区间)
    • CFG:4-5(最平衡)
    • 调度器:DPM++ 2M Karras
    • 分辨率:1024×1024(最佳质量)

Base vs Turbo:何时选择哪一个?

选择 Z-Image Base 的场景:

  • 你需要训练 LoRA 或微调模型
  • 你想要探索多样化的艺术风格
  • 你需要使用负向提示词精细控制输出
  • 你愿意等待更长的推理时间换取更高创造力

选择 Z-Image Turbo 的场景:

  • 你需要最快的推理速度(生产环境)
  • 你的主要需求是照片级写实人像/产品图
  • 你的 GPU 显存有限(6-8GB)
  • 你不需要负向提示词或 LoRA 训练

实战心得

  1. 步数不是越多越好:Base 在 30-40 步时已到达质量高原,继续增加步数收益递减
  2. CFG 与步数的配合:高 CFG (6-7) + 较少步数 (28-30) 可获得有冲击力的结果
  3. FP8 量化质量损失极小:在大多数场景下,FP8 与 BF16 的质量差异几乎不可察觉
  4. Base 训练的 LoRA 也适用于 Turbo:Base 训练的 LoRA 在 Turbo 上也能用,但效果可能不如在 Base 上好

总结

Z-Image Base 的发布标志着 Z-Image 生态的成熟。Turbo 适合快速批量生产,Base 适合创意探索和定制化训练。两者的最佳使用策略是组合使用:用 Base 训练 LoRA 和实验参数,用 Turbo 进行大规模推理部署。

如果你已经在使用 Z-Image Turbo,Base 模型将为你的工作流打开全新的可能性。

Z-Image Team

Z-Image Base 模型完全指南:从零开始掌握基础模型 | Blog