Z-Image + Hunyuan Video 1.5 视频生成工作流:图像到视频的完整方案
从静态大片到动态影像
Z-Image 生成的图像质量已经足够惊艳,但静态画面始终缺少「时间维度」。2025 年 11 月 20 日,腾讯混元团队开源了 Hunyuan Video 1.5——一个仅 8.3B 参数的轻量级视频生成模型,却在消费级显卡(24GB 显存)上跑出了旗舰级画质。本文基于官方技术报告(arXiv 2511.18870)、ComfyUI 官方博客与社区实测,完整拆解「Z-Image 出图 → Hunyuan Video 1.5 动起来」的图像到视频工作流。
为什么 Z-Image + Hunyuan Video 1.5 是黄金组合
视频生成的两大难题是「首帧质量」和「运动连贯性」:
| 环节 | 传统做法 | 本方案 |
|---|---|---|
| 首帧 | 文本到视频模型自行生成,构图不可控 | Z-Image 精确控制构图、光影、风格 |
| 运动 | 模型自由发挥,容易漂移 | Hunyuan Video 1.5 以首帧为锚点,保持角色/场景一致性 |
| 成本 | 大模型云端推理,成本高 | 两个模型都可本地运行,Z-Image Turbo 亚秒级出图 |
| 控制力 | 文本描述难以精确指定画面 | 图像即提示词,细节零损失传递 |
Z-Image Turbo 负责「定调」——以亚秒级速度生成高质量首帧;Hunyuan Video 1.5 负责「动起来」——基于首帧生成 5~10 秒的连贯视频。这正是 ComfyUI 官方模板库中 Z-Image-Turbo Text to Image 与 Hunyuan Video 1.5 工作流并排出现的意义。
Hunyuan Video 1.5 核心特性
模型规格
| 项目 | 参数 |
|---|---|
| 参数量 | 8.3B(DiT 架构) |
| 发布 | 2025-11-20(权重 + 代码全开源) |
| 模式 | 文本到视频 + 图像到视频(统一模型) |
| 原生分辨率 | 480p / 720p(内置蒸馏超分网络可到 1080p) |
| 帧率 | 24 fps |
| 默认时长 | 121 帧(约 5 秒),支持 5/8/10 秒 |
| 文本编码器 | Qwen 2.5-VL 7B + byT5(字形感知) |
| 注意力机制 | SSTA(Selective and Sliding Tile Attention,选择性滑动分块注意力) |
| VAE | 3D 因果 VAE |
SSTA 是关键创新:传统视频扩散模型的全局注意力在长序列上计算量爆炸,SSTA 只在部分 token 上做全局注意力、其余用滑动窗口局部注意力,兼顾质量与速度——这也是 8.3B 模型能在消费级显卡上运行的核心原因。
能力亮点
- 指令跟随强:对镜头运动(推拉摇移)、物理规律(重力、碰撞)、情绪表达(表情、肢体)都有出色的指令遵循能力
- 文字渲染:支持视频内文字渲染(中英文),海报、字幕类内容可直接生成
- 风格多样:写实、动漫、3D 风格均支持
- 一致性出色:图像到视频模式下,保持输入图像的角色身份、色调、视觉风格
⚠️ 许可证注意事项
Hunyuan Video 1.5 的许可证不适用于欧盟、英国和韩国(许可协议明确限定地域)。商用前务必确认你的所在地与分发范围。
ComfyUI 工作流搭建
准备模型
从 HuggingFace 下载并放入对应目录:
| 文件 | 放置目录 |
|---|---|
| hunyuan_video_1_5_causal_vae.safetensors | models/vae/ |
| hunyuan_video_1_5_llava_llama3_vision.safetensors | models/clip_vision/ |
| hunyuan_video_1_5_qwen2.5_vl_7b_fp8.safetensors | models/text_encoders/ |
| hunyuan_video_1_5_1b_byt5_fp8.safetensors | models/text_encoders/ |
| hunyuan_video_1_5_fp8_e4m3fn.safetensors | models/diffusion_models/ |
显存紧张时,在 Load Diffusion Model 节点选择 fp8 weight_dtype 可显著降低占用。
标准 I2V 节点连线
[Load Image] → IMAGE(首帧,建议 1280×720 或 720×1280)
[Load Hunyuan I2V 模型] → MODEL
[CLIP Vision Encode] → 图像条件
[HunyuanVideo15ImageToVideo] → LATENT
[KSampler](20~30 步)
[VAE Decode] → [Save Video]
关键点:首帧图像强烈驱动构图,提示词驱动运动与氛围。输入图像应清晰、构图良好,且宽高比与目标输出一致(避免裁切和留边)。
提示词与参数配置
提示词结构(推荐 JSON 格式):
{
"prompt": "A stylish girl walking slowly past a busy restaurant, camera pans left",
"motion": "slow walk, natural arm swing",
"camera": "pan left, slight dolly in",
"aesthetic": "cinematic, shallow depth of field, warm tones"
}
核心参数参考:
| 参数 | 推荐值 | 说明 |
|---|---|---|
| 步数 | 20(默认)/ 30(高质量) | 步数越高质量越好,耗时越长 |
| 分辨率 | 720p(1280×720) | 原生输出,后续可超分到 1080p |
| 帧数 | 121(约 5 秒) | 可扩展到 8/10 秒 |
| 图像影响度 | image_token_selection_expr ::4 |
值越大图像影响力越小(::8/::16 减弱) |
| EasyCache | 开(可牺牲少量画质) | 重复运行时缓存编码,显著提速 |
图像 token 选择技巧:image_token_selection_expr 控制图像对视频的影响程度。默认 ::4 保留足够约束力;如果希望视频有更多自由运动,可调高到 ::8 或 ::16。
实际案例与性能数据
案例:Z-Image 生成电影感首帧 → 动画化
- Z-Image Turbo 出图:提示词生成「夜晚霓虹灯下的街道,一位穿皮衣的女生走在雨中」——亚秒级完成,构图、光线完全可控
- Hunyuan Video 1.5 动画化:加载 I2V 工作流,上传首帧,提示词描述「缓慢行走、镜头从左向右摇、雨滴飘落」
- 输出:720p / 5 秒 / 24fps 视频,角色身份与色调全程保持一致
性能参考(RTX 4090)
| 阶段 | 耗时 |
|---|---|
| 生成 5 秒 720p 片段(30 步,Q5_K_M 量化) | ~13 分钟 |
| RIFE 24→60fps 插帧 | ~1 分钟 |
| Real-ESRGAN x2 超分到 1440p | ~4 分钟 |
| 合计 | ~18 分钟 |
首次运行需下载模型文件,会额外花费时间。使用 TeaCache 等缓存加速方案可进一步提升速度。
进阶技巧
- 多镜头脚本:用 Z-Image 生成同一场景的不同机位首帧(全景/中景/特写),分别动画化后剪辑,实现可控的多镜头叙事
- 首尾帧控制:部分工作流支持首帧 + 尾帧双输入,画面过渡更可控
- 超分链路:720p 生成 → LatentUpscale 潜空间放大 → 蒸馏超分网络 → 1080p,画质显著提升
- 批量出片:Z-Image Turbo 一次生成多张候选首帧,批量丢进 I2V 队列,适合短视频素材生产
常见问题
Q1:显存不够怎么办?
用 fp8 权重加载扩散模型;分辨率降到 480p;减少帧数。24GB 显存可流畅运行,16GB 用 fp8 也可尝试。
Q2:视频中角色容易「变形漂移」?
确保首帧清晰、构图完整;适当降低步数减少过拟合;保持提示词简洁,避免与图像冲突的描述。
Q3:视频运动幅度太小?
调高 image_token_selection_expr(如 ::8)降低图像约束;提示词中明确 motion 描述。
Q4:Hunyuan Video 1.5 能商用吗?
注意地域限制:许可证不适用于欧盟、英国和韩国。其他地区需仔细阅读协议条款。
总结
Z-Image + Hunyuan Video 1.5 的组合把「图像生成」和「视频生成」两大能力无缝衔接:Z-Image Turbo 以亚秒级速度提供构图完美的首帧,8.3B 的 Hunyuan Video 1.5 在 24GB 消费级显卡上把它变成 5~10 秒的电影感片段。对于短视频创作者、广告素材生产者和个人创作者,这是一条成本最低、控制力最强的本地视频生产路径——从静态大片到动态影像,只需要一个 ComfyUI 工作流。