Stable Video Diffusion是Stability AI推出的图像到视频生成模型,能够把一张静态图片变成一段流畅的短视频。相比在线服务,本地部署不仅免费,而且不限制生成次数,隐私性也更好。ComfyUI作为目前最流行的节点式AI绘画与视频工具,对SVD的支持相当完善,通过灵活的节点连接和显存管理选项,即使是中等配置的显卡也能顺利跑起来。本文将从环境准备、模型下载、工作流搭建到显存优化,完整走一遍SVD的本地部署流程。

一、环境准备与ComfyUI安装
ComfyUI支持便携版包和手动安装两种方式。对于新手来说,强烈推荐官方的Windows便携版整合包,解压即可使用,自带Python运行环境和PyTorch,省去了配置CUDA版本的麻烦。到ComfyUI的GitHub发布页面下载ComfyUI_windows_portable压缩包,解压到一个纯英文路径的目录下,比如D:\ComfyUI_windows_portable。注意路径中不要包含中文和空格,否则加载模型时容易出现奇怪的报错。
如果你的显存大于6GB,直接运行run_nvidia_gpu.bat即可。低显存用户可以运行run_nvidia_gpu_lowvram.bat,它会以低显存模式启动,后面会详细说明这个模式的作用。启动后浏览器会自动打开127.0.0.1:8188,看到节点编辑界面就说明环境已经就绪。
手动安装适合Linux服务器或有特殊版本需求的用户,核心步骤是创建Python虚拟环境、安装PyTorch对应CUDA版本,然后通过pip install -r requirements.txt安装依赖。无论哪种方式,建议显卡驱动保持较新版本,SVD对CUDA运算的依赖比较重,老驱动可能出现算子不支持的错误。
二、SVD模型下载与文件放置
ComfyUI支持两种SVD模型格式,分别是原版的扩散模型加VAE组合,以及社区整理的单文件版本。推荐从HuggingFace下载官方模型,地址是stabilityai的stable-video-diffusion-img2vid项目。需要下载的核心文件包括svd.safetensors(完整版,效果最好)或svd_xt.safetensors(扩展版,帧数更多但更吃显存),以及配套的VAE文件svd_vae.safetensors。
下载完成后,文件放置路径很关键,放错了ComfyUI就找不到模型。具体目录结构如下:
ComfyUI_windows_portable/
└── ComfyUI/
├── models/
│ ├── checkpoints/ # svd.safetensors 放这里
│ └── vae/ # svd_vae.safetensors 放这里
└── custom_nodes/ # 后续扩展节点放这里如果HuggingFace直连速度慢,可以使用镜像站点加速下载。模型文件体积较大,svd.safetensors大约9GB多,svd_xt版本更大,下载时确保磁盘空间充足。下载完成后重启ComfyUI,在Load Checkpoint节点的下拉列表中就能看到模型了。
三、图生视频工作流搭建
SVD本质上是图生视频模型,没有原生的文生视频能力,标准玩法是先用SDXL生成一张图,再把这张图喂给SVD生成动态视频。如果嫌搭建流程麻烦,可以直接在ComfyUI菜单里选择模板:选择Browse Templates,在Video分类中找到Image to Video with SVD,加载官方预置工作流,这个工作流已经把所有节点连接好了。
如果想自己理解每个节点的作用,核心链路是这样的:Load Checkpoint节点加载svd模型,同时输出MODEL和VAE两个接口;Load Image节点读取初始图片;Image Only Checkpoint Loader这类节点会把CLIP Vision也加载进来,因为SVD依赖视觉编码器理解输入图像。Video Linear CFG Guidance节点用于线性CFG引导,SVD在CFG值固定时画面容易崩坏,官方建议开启线性引导,基础CFG设在2到2.5之间,最小CFG降到1左右,这样生成的动态更自然。
采样器节点上,SVD推荐使用euler采样器,调度器选karras,步数20到25步就有不错的效果。Video Combine节点负责把生成的帧序列合成视频,输出格式可以选mp4或者gif。帧数方面标准模型生成14帧,xt版本可以生成25帧,帧率设置成6到8帧每秒比较符合SVD的训练参数。整段链路跑通后,你会得到一段大约2到4秒的短视频。
# 采样参数参考设置 sampler_name = "euler" scheduler = "karras" steps = 25 # 步数20-25即可,多了提升有限 cfg = 2.0 # CFG过高会导致画面闪烁 min_cfg = 1.0 # 线性引导的最低CFG width = 1024 # 建议不超过1024 height = 576 length = 14 # 标准版14帧,xt版25帧
四、显存优化:低配置显卡的生存指南
显存不足是SVD部署中最常见的拦路虎。SVD是视频模型,采样过程中要同时在显存里维护所有帧的潜空间数据,1024x576分辨率下跑14帧,峰值显存轻松突破10GB。好在ComfyUI提供了多层优化手段,合理组合之后,8GB甚至6GB显卡都能流畅运行。
第一层优化是低显存模式,也就是启动时选择lowvram的bat脚本,或在命令行加上--lowvram参数。这个模式会把模型权重分块加载到显存,用到哪块搬哪块,代价是推理速度变慢,但显存占用可以压缩到4GB左右。如果显存更紧张,还有--novram参数,把权重主要放在内存中,2GB到4GB的老卡也有机会跑,速度会明显变慢。启动参数还可以加--cache-classic来改善节点缓存策略,配合低显存模式效果更好。
第二层优化是降低分辨率和帧数。把生成的宽高从1024x576降到768x432,显存占用几乎是线性下降的,画质损失在视频场景里其实不算明显。帧数方面,14帧是标准模型的训练上限,强行调高不仅爆显存,画面质量也会劣化,想要更长的视频应该用svd_xt模型,或者采用首尾帧衔接、分段生成再拼接的思路。
第三层是VAE解码优化。视频VAE解码是显存杀手之一,因为解码时要一次性处理全部帧的高分辨率像素数据。在VAE Decode节点上启用Tiled(分块)模式,或者使用支持Tiled VAE Decode的节点,把解码过程拆成小块分批处理,能显著降低峰值显存,几乎不影响画质。此外,如果你的ComfyUI版本支持FP8量化加载,可以在模型加载节点上选择fp8_e4m3fn格式,权重体积直接减半,8GB显卡跑1024x576也会轻松很多。
五、常见报错与排坑
部署过程里几个高频问题值得提前了解。一是CUDA out of memory报错,这几乎都是分辨率、帧数或加载模式的问题,按上一节的方法逐层排查,优先降分辨率再考虑切换lowvram模式。二是生成视频只有静态画面没有动态,通常是CFG设置过高或者初始图片对比度太低,把CFG降到2以下并检查线性引导是否开启。三是合成视频时提示缺少ffmpeg,Video Combine节点依赖ffmpeg来编码mp4,需要在环境变量中配置好ffmpeg路径,或者直接把ffmpeg.exe放到ComfyUI的根目录下。
另外提醒一点,SVD对输入图片的比例有偏好,接近16:9或源数据常见比例的图片效果最好,极端竖图或方图可能出现构图漂移。生成前先用裁剪工具把图片调整到1024x576这类标准比例,能省去不少反复调试的时间。所有环节都跑顺之后,就可以安心享受本地无限量生成AI视频的自由了。
Stable Video DiffusionComfyUI显存优化修改时间:2026-09-08 09:59:09