ComfyUI-WanVideoWrapper 新手友好完整指南:文生视频与图生视频一次跑通
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
ComfyUI-WanVideoWrapper 是一个面向 AI 视频生成的自定义节点包,它能在 ComfyUI 里把一段文字描述或一张静态图片变成视频。读完本文,你可以完成安装、跑出第一支文生视频和图生视频,并把参数调到自己显卡能承受的范围内。
先看它能做什么
| 能力 | 一句话说明 |
|---|---|
| 文生视频 | 写一段场景描述,直接生成对应的动态画面 |
| 图生视频 | 给一张静态图作为首帧,把它延伸成视频 |
| 音频驱动 | 接入一段音频,画面里的角色跟随声音同步动作 |
| 相机控制 | 指定相机轨迹,镜头按你设定的路线运动(ReCamMaster、Uni3C) |
| 唇形同步 | 单角色或多角色说话,口型与语音对齐(FantasyTalking、MultiTalk) |
| 姿势控制 | 用一段姿态视频约束人物动作(SCAIL、SteadyDancer) |
核心模型架构位于wanvideo/目录,上面的每一项能力都对应各自独立的子目录。
准备清单:装好它只需三步
前置条件:已经装好并能打开 ComfyUI。显卡方面,建议从 1.3B 模型起步——项目实测中 1.3B 文生视频生成 1025 帧只用了不到 5GB 显存;14B 模型则需要更充裕的显存,可以配合块交换(把部分模型权重暂存到内存、用到时再换回显卡)来跑。
第一步,把仓库放进custom_nodes目录。第二步,执行安装命令,标准版和便携版二选一:
# 克隆仓库到 custom_nodes 目录 git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper # 标准版:在 ComfyUI-WanVideoWrapper 目录内安装依赖 pip install -r requirements.txt # 便携版:在 ComfyUI_windows_portable 目录内执行 python_embeded\python.exe -m pip install -r ComfyUI\custom_nodes\ComfyUI-WanVideoWrapper\requirements.txt第三步,把 WanVideo 模型文件放进正确位置。文件从项目文档中给出的模型链接下载。
| 模型类型 | 放置目录 | 作用 |
|---|---|---|
| 文本编码器 | ComfyUI/models/text_encoders | 把你的提示词转成模型能读懂的向量 |
| 视频主模型(Transformer) | ComfyUI/models/diffusion_models | 真正负责生成视频的画面模型 |
| VAE | ComfyUI/models/vae | 把压缩的潜空间表示还原成可见视频 |
| Clip vision | ComfyUI/models/clip_vision | 图生视频时读取图片内容 |
重启 ComfyUI 后,节点列表里出现 WanVideo 相关节点,就说明装好了。
三大玩法实操
文生视频:一段提示词生成视频
新建主模型加载节点和文本编码器节点,写好提示词,连接后运行即可。提示词建议写具体,把主体、场景、运动一起说清楚,比如"竹林里的古老石塔,微风轻拂,阳光穿过竹叶"。
推荐起步参数(1.3B 文生视频):
- 模型选 1.3B T2V,显存压力最小
- 窗口大小 81 帧,重叠 16 帧
- 长视频按窗口分段处理,不必一次生成全部帧
参考工作流:example_workflows/wanvideo_2_1_14B_T2V_example_03.json
图生视频:把静态图变成动态视频
流程与文生视频相同,多一步:加载你的静态图作为首帧参考。人物肖像和风景照都可以用。
推荐起步参数:
- 主模型选对应的 I2V 版本
- 窗口与重叠沿用 81 帧 / 16 帧
- 若要开 TeaCache(一种按阈值跳过部分计算步骤的提速缓存):新版阈值是旧值的 10 倍,系数取 0.25-0.30,起始步骤可为 0;阈值调得更激进时建议延后起始步骤,避免早期步骤被跳过导致动作断裂
参考工作流:example_workflows/wanvideo_2_1_14B_I2V_example_03.json
音频驱动视频:让画面跟着声音动
接入 Ovi 音频模型节点(相关代码在Ovi/目录),传入音频文件,角色的口型与动作节奏会跟随声音变化。
推荐起步参数:
- 先用 5 秒版流程跑通,再换 10 秒版长流程
- 音频与图片的时长、主体保持一致,口型效果更好
参考工作流:example_workflows/wanvideo_2_2_5B_Ovi_image_to_video_audio_example_01.json
省显存、提速度的技巧
- 块交换:把模型的一部分权重留在内存里,计算到哪块才换到哪块。显存不够跑大模型时的首选手段,块数越多越省显存、速度越慢。
- torch.compile:把模型编译成更快的执行代码来提升推理速度。注意项目更新后首次运行显存可能异常偏高,清理缓存再跑一次即可恢复。
- fp8 量化模型:fp8 是 8 位精度存储的模型文件,显存占用约减半、质量损失小。作者本人在文档中推荐使用 fp8 scaled 版本。
- 异步预加载:权重在后台提前搬到显卡,减少等待。新版 LoRA(给模型叠加的小份增量权重文件)也遵循这套卸载机制,可一起受益于预取。
常见问题速查
| 症状 | 原因 | 解决办法 |
|---|---|---|
| 首次运行显存异常高 | 旧的 Triton / torchinductor 编译缓存残留 | 删除C:\Users\<用户名>\.triton和C:\Users\<用户名>\AppData\Local\Temp\torchinductor_<用户名>的内容,重新运行 |
| 加了 LoRA 后显存变高 | 新版把 LoRA 权重并入对应块,块整体变大 | 增加交换块数补偿。例:14B 模型交换 20 块时,1GB 未合并 LoRA 使总占用增加约 500MB,再多交换 2 块即可 |
| 生成质量不稳定 | 模型目录、参数或提示词有问题 | 先确认模型放对了目录;再调整采样步数和 CFG(控制画面贴合提示词程度的参数);用括号给关键词加权并配合负面提示词 |
| 节点不显示 | 依赖没装全或未重启 | 确认 requirements 安装成功后重启 ComfyUI |
想玩得更深:扩展方向
以下模块都是独立目录,模型从项目文档链接下载后即可在对应节点中使用:
- SkyReels:更高分辨率视频生成,位于
skyreels/ - ControlNet:对画面构图和内容的精细控制,位于
controlnet/ - Uni3C:三维相机控制,位于
uni3c/ - ATI:视频中的物体跟踪,位于
ATI/ - ReCamMaster:相机运动控制,位于
recammaster/ - WanAnimate:动画生成,位于
wanvideo/modules/wananimate/ - MultiTalk:多角色对话,位于
multitalk/
ComfyUI-WanVideoWrapper 把 AI 视频生成拆成了连线就能运行的节点,参数和显存问题都有现成答案。下一步:打开example_workflows/,选一个 T2V 或 I2V 示例工作流导入 ComfyUI,跑出你的第一支视频。
【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考