Z-Image vs GLM-Image 深度对比:混合自回归/扩散模型 vs S3-DiT 架构
两条技术路线的正面交锋
2026 年 1 月,开源图像生成领域迎来两件大事:智谱 AI(Z.ai)在 1 月 14 日发布 GLM-Image——首个开源工业级离散自回归图像生成模型;阿里通义在 1 月 27 日发布 Z-Image 权重——基于 S3-DiT 单流扩散 Transformer 的 6B 高效模型。两者都瞄准「开源最强」的宝座,却走了完全不同的技术路线。
本文基于 Z-Image 技术报告(arXiv 2511.22699)、GLM-Image 官方 GitHub/HuggingFace 与 DeepLearning.AI 评测,从架构、基准、生态三个维度做一次硬核对比。
架构对决:混合自回归/扩散 vs 单流扩散 Transformer
GLM-Image:9B 自回归 + 7B 扩散解码器
GLM-Image 采用两阶段混合架构:
- Stage 1 — 自回归生成(9B 参数):先生成约 256 个低分辨率 token,逐 patch 确定图像的「布局」——主体位置、构图、文字内容
- Stage 2 — 扩散解码(7B 参数):再生成 1,000~4,000 个高分辨率 token(取决于输出分辨率),由扩散解码器渲染出最终图像
为了让文字渲染精准,GLM-Image 引入了 Glyph-ByT5 字形感知文本编码器——为每个要渲染的字符生成形状 token,让模型「认识」每个字的笔画结构,而不是把文字当花纹处理。后训练使用 GRPO 解耦强化学习(细粒度模块化反馈),显著提升语义理解与视觉细节质量。
Z-Image:S3-DiT 单流扩散
Z-Image 的 S3-DiT(Scalable Single-Stream Diffusion Transformer) 走的是完全不同的思路:文本、视觉语义 token、图像 VAE token 在序列级别拼接成单一输入流,最大化参数效率。6B 参数 + 8 步推理(8 NFE)实现亚秒级生成——这是双流架构(如 20B~80B 的 Qwen-Image、FLUX.2)难以企及的效率。
架构对比表
| 维度 | GLM-Image | Z-Image |
|---|---|---|
| 架构 | 混合:9B 自回归 + 7B 扩散解码器 | 单流扩散 Transformer(S3-DiT) |
| 总参数量 | ~16B(9B AR + 7B diffusion) | 6B |
| 生成阶段 | 布局 token → 细节 token → 扩散渲染 | 单阶段扩散去噪 |
| 文本编码器 | Qwen/Glyph-ByT5 字形感知 | 统一多模态流 |
| 训练硬件 | 华为昇腾 Atlas 800T A2(纯国产) | 未公开(阿里通义) |
| 推理效率 | 两阶段串行,需更多资源 | 8 步亚秒级,消费级显卡可跑 |
| 许可证 | MIT | Apache 2.0 |
基准测试:各有所长
文字渲染:GLM-Image 的绝对强项
CVTG-2K(复杂视觉文本生成基准,测多区域文字渲染的字级准确率):
| 模型 | Word Accuracy | 类型 |
|---|---|---|
| GLM-Image | 0.9116 | 开源 |
| Seedream 4.5 | 0.8990 | 闭源 |
| GPT Image 1 [High] | 0.8569 | 闭源 |
| Z-Image | 0.8671 | 开源 |
| Qwen-Image | 0.8288 | 开源 |
| Nano Banana 2.0 | 0.7788 | 闭源 |
GLM-Image 以 91.16% 的字级准确率登顶,超越所有开源与闭源竞品——这是它最锋利的卖点。Z-Image 的 86.71% 同样优秀(优于 GPT Image 1),但在纯文字渲染场景确实有差距。
综合质量:Z-Image 的高效王者地位
| 基准 | Z-Image | 排名 | GLM-Image 表现 |
|---|---|---|---|
| DPG-Bench(密集提示词跟随) | 88.14 | 全球第 3(开源第 1) | 与主流潜扩散持平 |
| GenEval(物体生成) | 0.84 | 并列第 2 | 未披露显著优势 |
| AI Arena Elo | 1025 | 全球第 4、开源第 1 | 未上榜 |
| LongText-Bench EN | 0.935 | 接近 SOTA | 0.9524 |
| OneIG 文字可靠性 | 0.987 | 满分水准 | 接近 |
GLM-Image 官方自述:「整体图像质量与主流潜扩散模型持平」——即其综合美学/构图能力并未碾压 Z-Image,优势集中在文字渲染与知识密集型场景。而 Z-Image 在 AI Arena 人类偏好榜上全球第 4、开源第 1,综合生成质量与效率仍是开源标杆。
推理成本与生态对比
| 维度 | GLM-Image | Z-Image |
|---|---|---|
| 本地运行门槛 | 高(两阶段模型,社区实测需大显存) | 低(8GB 显存可跑 Turbo) |
| 生成速度 | 两阶段串行,较慢 | Turbo 亚秒级 |
| 开源生态 | MIT,HuggingFace 官方仓库,生态初建 | Apache 2.0,ComfyUI/GGUF/Nunchaku/WebGPU 全生态 |
| 微调生态 | 尚在早期 | LoRA、One-Trainer、Z-Anime 等成熟 |
| 视频/工作流集成 | 未发现主流集成 | Hunyuan Video/Wan 2.2/Seedance 全链路 |
| 特色能力 | 文字渲染、知识密集型海报/信息图 | 速度、写实、中文渲染、编辑 |
关键差异:Z-Image 已经长成完整生态——GGUF 量化、Nunchaku 加速、WebGPU 浏览器推理、ComfyUI 全节点支持、动漫/风格微调模型一应俱全;GLM-Image 发布于 2026 年 1 月 14 日(比 Z-Image 权重发布早 13 天),生态仍在早期,但 MIT 许可证 + 混合架构的独特性吸引了大量关注。
选型建议
选 GLM-Image 当:
- 需要精确文字渲染:海报、PPT、信息图、日历、漫画对白
- 知识密集型场景:需要模型「理解」文字语义而非描摹形状
- 中英双语文字混合排版
选 Z-Image 当:
- 追求速度与效率:亚秒级出图、消费级显卡本地跑
- 综合美学优先:写实风格、构图质量、人类偏好
- 需要完整生态:LoRA 微调、ComfyUI 工作流、视频生成链路
- 成本敏感的批量生产场景
总结
GLM-Image 与 Z-Image 的对比,本质是「混合架构的专业化」与「单流架构的高效化」之争:GLM-Image 用 9B 自回归模块「读懂」画面与文字、7B 扩散解码器「画好」细节,在文字渲染基准上登顶开源第一;Z-Image 用 6B 单流设计把「质量、速度、显存」三角做到极致,在综合榜单上保持开源王者地位。对普通创作者,Z-Image 仍是日常主力;对文字密集型商业设计,GLM-Image 值得加入工具箱——两条路线,恰好互补。