Z-Image + Hunyuan Video 1.5 视频生成工作流:图像到视频的完整方案

8월 4, 2026

Z-Image + Hunyuan Video 1.5 视频生成工作流:图像到视频的完整方案

从静态大片到动态影像

Z-Image 生成的图像质量已经足够惊艳,但静态画面始终缺少「时间维度」。2025 年 11 月 20 日,腾讯混元团队开源了 Hunyuan Video 1.5——一个仅 8.3B 参数的轻量级视频生成模型,却在消费级显卡(24GB 显存)上跑出了旗舰级画质。本文基于官方技术报告(arXiv 2511.18870)、ComfyUI 官方博客与社区实测,完整拆解「Z-Image 出图 → Hunyuan Video 1.5 动起来」的图像到视频工作流。

为什么 Z-Image + Hunyuan Video 1.5 是黄金组合

视频生成的两大难题是「首帧质量」和「运动连贯性」:

环节 传统做法 本方案
首帧 文本到视频模型自行生成,构图不可控 Z-Image 精确控制构图、光影、风格
运动 模型自由发挥,容易漂移 Hunyuan Video 1.5 以首帧为锚点,保持角色/场景一致性
成本 大模型云端推理,成本高 两个模型都可本地运行,Z-Image Turbo 亚秒级出图
控制力 文本描述难以精确指定画面 图像即提示词,细节零损失传递

Z-Image Turbo 负责「定调」——以亚秒级速度生成高质量首帧;Hunyuan Video 1.5 负责「动起来」——基于首帧生成 5~10 秒的连贯视频。这正是 ComfyUI 官方模板库中 Z-Image-Turbo Text to Image 与 Hunyuan Video 1.5 工作流并排出现的意义。

Hunyuan Video 1.5 核心特性

模型规格

项目 参数
参数量 8.3B(DiT 架构)
发布 2025-11-20(权重 + 代码全开源)
模式 文本到视频 + 图像到视频(统一模型)
原生分辨率 480p / 720p(内置蒸馏超分网络可到 1080p)
帧率 24 fps
默认时长 121 帧(约 5 秒),支持 5/8/10 秒
文本编码器 Qwen 2.5-VL 7B + byT5(字形感知)
注意力机制 SSTA(Selective and Sliding Tile Attention,选择性滑动分块注意力)
VAE 3D 因果 VAE

SSTA 是关键创新:传统视频扩散模型的全局注意力在长序列上计算量爆炸,SSTA 只在部分 token 上做全局注意力、其余用滑动窗口局部注意力,兼顾质量与速度——这也是 8.3B 模型能在消费级显卡上运行的核心原因。

能力亮点

  • 指令跟随强:对镜头运动(推拉摇移)、物理规律(重力、碰撞)、情绪表达(表情、肢体)都有出色的指令遵循能力
  • 文字渲染:支持视频内文字渲染(中英文),海报、字幕类内容可直接生成
  • 风格多样:写实、动漫、3D 风格均支持
  • 一致性出色:图像到视频模式下,保持输入图像的角色身份、色调、视觉风格

⚠️ 许可证注意事项

Hunyuan Video 1.5 的许可证不适用于欧盟、英国和韩国(许可协议明确限定地域)。商用前务必确认你的所在地与分发范围。

ComfyUI 工作流搭建

准备模型

从 HuggingFace 下载并放入对应目录:

文件 放置目录
hunyuan_video_1_5_causal_vae.safetensors models/vae/
hunyuan_video_1_5_llava_llama3_vision.safetensors models/clip_vision/
hunyuan_video_1_5_qwen2.5_vl_7b_fp8.safetensors models/text_encoders/
hunyuan_video_1_5_1b_byt5_fp8.safetensors models/text_encoders/
hunyuan_video_1_5_fp8_e4m3fn.safetensors models/diffusion_models/

显存紧张时,在 Load Diffusion Model 节点选择 fp8 weight_dtype 可显著降低占用。

标准 I2V 节点连线

[Load Image] → IMAGE(首帧,建议 1280×720 或 720×1280)
[Load Hunyuan I2V 模型] → MODEL
[CLIP Vision Encode] → 图像条件
[HunyuanVideo15ImageToVideo] → LATENT
[KSampler](20~30 步)
[VAE Decode] → [Save Video]

关键点:首帧图像强烈驱动构图,提示词驱动运动与氛围。输入图像应清晰、构图良好,且宽高比与目标输出一致(避免裁切和留边)。

提示词与参数配置

提示词结构(推荐 JSON 格式)

{
  "prompt": "A stylish girl walking slowly past a busy restaurant, camera pans left",
  "motion": "slow walk, natural arm swing",
  "camera": "pan left, slight dolly in",
  "aesthetic": "cinematic, shallow depth of field, warm tones"
}

核心参数参考

参数 推荐值 说明
步数 20(默认)/ 30(高质量) 步数越高质量越好,耗时越长
分辨率 720p(1280×720) 原生输出,后续可超分到 1080p
帧数 121(约 5 秒) 可扩展到 8/10 秒
图像影响度 image_token_selection_expr ::4 值越大图像影响力越小(::8/::16 减弱)
EasyCache 开(可牺牲少量画质) 重复运行时缓存编码,显著提速

图像 token 选择技巧image_token_selection_expr 控制图像对视频的影响程度。默认 ::4 保留足够约束力;如果希望视频有更多自由运动,可调高到 ::8::16

实际案例与性能数据

案例:Z-Image 生成电影感首帧 → 动画化

  1. Z-Image Turbo 出图:提示词生成「夜晚霓虹灯下的街道,一位穿皮衣的女生走在雨中」——亚秒级完成,构图、光线完全可控
  2. Hunyuan Video 1.5 动画化:加载 I2V 工作流,上传首帧,提示词描述「缓慢行走、镜头从左向右摇、雨滴飘落」
  3. 输出:720p / 5 秒 / 24fps 视频,角色身份与色调全程保持一致

性能参考(RTX 4090)

阶段 耗时
生成 5 秒 720p 片段(30 步,Q5_K_M 量化) ~13 分钟
RIFE 24→60fps 插帧 ~1 分钟
Real-ESRGAN x2 超分到 1440p ~4 分钟
合计 ~18 分钟

首次运行需下载模型文件,会额外花费时间。使用 TeaCache 等缓存加速方案可进一步提升速度。

进阶技巧

  • 多镜头脚本:用 Z-Image 生成同一场景的不同机位首帧(全景/中景/特写),分别动画化后剪辑,实现可控的多镜头叙事
  • 首尾帧控制:部分工作流支持首帧 + 尾帧双输入,画面过渡更可控
  • 超分链路:720p 生成 → LatentUpscale 潜空间放大 → 蒸馏超分网络 → 1080p,画质显著提升
  • 批量出片:Z-Image Turbo 一次生成多张候选首帧,批量丢进 I2V 队列,适合短视频素材生产

常见问题

Q1:显存不够怎么办?
用 fp8 权重加载扩散模型;分辨率降到 480p;减少帧数。24GB 显存可流畅运行,16GB 用 fp8 也可尝试。

Q2:视频中角色容易「变形漂移」?
确保首帧清晰、构图完整;适当降低步数减少过拟合;保持提示词简洁,避免与图像冲突的描述。

Q3:视频运动幅度太小?
调高 image_token_selection_expr(如 ::8)降低图像约束;提示词中明确 motion 描述。

Q4:Hunyuan Video 1.5 能商用吗?
注意地域限制:许可证不适用于欧盟、英国和韩国。其他地区需仔细阅读协议条款。

总结

Z-Image + Hunyuan Video 1.5 的组合把「图像生成」和「视频生成」两大能力无缝衔接:Z-Image Turbo 以亚秒级速度提供构图完美的首帧,8.3B 的 Hunyuan Video 1.5 在 24GB 消费级显卡上把它变成 5~10 秒的电影感片段。对于短视频创作者、广告素材生产者和个人创作者,这是一条成本最低、控制力最强的本地视频生产路径——从静态大片到动态影像,只需要一个 ComfyUI 工作流。

Z-Image Team

Z-Image + Hunyuan Video 1.5 视频生成工作流:图像到视频的完整方案 | Blog