用文字直接生成动态镜头已经不再是概念演示。Runway 的 Gen-3 Alpha 模型在画面稳定性和运动一致性上有了明显提升,普通创作者也能用它完成从概念图到短片的快速转化。这个平台把文生视频、图生视频和运动笔刷放在同一个工作流里,但很多人在具体参数和画笔控制上容易走弯路。这篇教程会按照实际制作顺序,拆解三种功能的核心操作和调参思路。

文生视频:从提示词到稳定画面
文生视频的入口在 Runway 的 Text/Image to Video 模块。进入后先选择 Gen-3 Alpha 模型,然后在提示词框里描述画面。默认生成时长通常是 4 秒,宽高比可选 16:9、9:16 或 1:1。建议刚开始不要拉满运动强度,保持默认值附近更容易得到稳定画面。
提示词的质量直接决定第一轮成片能不能用。一个有效方法是按照“主体 + 动作 + 环境 + 镜头 + 光影”的结构来写。例如不要只写“未来城市”,可以写成:一个未来城市的黄昏街道,霓虹灯倒映在潮湿路面上,镜头缓慢向前推进,带有体积雾效果。如果使用英文提示词,可以写成 a cinematic aerial shot of a futuristic city at dusk, neon signs reflecting on wet asphalt, slow forward camera movement, volumetric fog。这样的描述给模型的空间关系和运动方向都很明确。
除了提示词,种子值同样重要。固定种子可以在微调提示词时保留基本构图,方便做 A/B 对比。运动强度过高时画面容易出现抖动和主体扭曲,一般从 40 到 60 区间开始测试更为稳妥。生成后的 4 秒片段如果好用,可以用 Runway 的 Extend 功能继续延长 4 秒,逐步滚出完整镜头。
import requests
url = "https://api.runwayml.com/v1/video/generate"
headers = {
"Authorization": "Bearer YOUR_API_KEY",
"Content-Type": "application/json"
}
payload = {
"model": "gen3-alpha",
"prompt": "a cinematic aerial shot of a futuristic city at dusk, neon signs reflecting on wet asphalt, slow forward camera movement, volumetric fog",
"duration": 4,
"aspect_ratio": "16:9",
"motion_strength": 0.5,
"seed": 20240801
}
response = requests.post(url, json=payload, headers=headers)
print(response.json())
文生视频的短板在于细节随机性较大,比如文字招牌、手指数量、建筑结构可能会有瑕疵。遇到这种情况,不要反复用同一条提示词硬碰,可以加入反向提示词减少不需要元素,或者先返回一步,用图生视频把静态素材固定下来。
图生视频:把静态素材变成动态镜头
图生视频的核心逻辑是把上传图片当作视频首帧,由模型推断后续运动。这个方式非常适合概念图、产品展示和人物照片动态化。相比文生视频,它的优势是开局画面完全可控,不需要在提示词里描述颜色、构图和物体关系,只需要补充运动信息。
操作时选择 Image to Video,上传一张清晰度足够的图片。Runway 会提供镜头运动选项,包括推近、拉远、左移、右移、旋转和自定义。自定义模式允许输入一句运动描述,例如“镜头绕主体顺时针旋转 30 度,同时背景轻微虚化”。运动强度建议从 0.4 左右开始,太大容易把原图关键特征带跑。
想要保留原图质感,提示词不要让画面出现与图片内容冲突的动作。比如一张人物正面照,如果描述写“人物转身跑远”,模型往往会生成奇怪的身体结构。更安全的写法是“人物保持站姿,头发和衣服被微风吹动,镜头缓慢推近”。另外,上传前最好把图片裁剪到和目标画幅一致,避免模型自动补全边缘时产生不可控内容。
{
"source_image": "upload_01.png",
"motion_type": "custom",
"motion_prompt": "slow push-in, hair and clothing moved by gentle wind, background soft focus",
"motion_strength": 0.45,
"aspect_ratio": "16:9",
"seed": 112233
}
图生视频还有一个容易被忽略的用法:先让静态图生成 4 秒运动,再从最后一帧继续生成。这样可以逐步构成一个连续镜头,但每次延长都要检查动作衔接。如果中间出现了跳帧,可以把最后几帧导出后用剪辑软件做交叉淡化过渡。
运动笔刷:局部动态的精细控制
运动笔刷解决的是全局运动不够精细的问题。文生视频和图生视频默认作用于整个画面,而运动笔刷允许你框选一个局部区域,并指定这个区域向哪个方向移动、强度多大。比如画面中人物是静止的,但你希望围巾向左侧飘动,就可以只选中围巾区域并画出向左的箭头。
笔刷选区的边缘不要过硬,适当留出羽化过渡能让局部运动融进背景。强度参数是控制自然度的关键,如果直接从 0.8 或 1.0 起步,选区边界容易出现类似水波纹的拉扯。一般从 0.3 到 0.6 之间开始,生成后再根据效果逐步加减。多个区域需要独立运动时,可以分别添加笔刷,不建议一次把半个画面都涂满,因为模型很难在多个大幅运动之间保持空间稳定。
运动方向还要避免和镜头运动冲突。例如镜头本身在向右平移,笔刷却让主体向左移动,成片容易出现双重运动拖影。正确的思路是让笔刷方向和镜头运动形成协作,比如镜头缓慢推近时,笔刷只让水面产生纵向波纹,这样视觉上更自然。最后输出前建议逐帧检查选区边缘,如果发现闪烁,可以把视频导入剪辑软件,对局部画面做轻微模糊或叠加一层噪点来掩盖瑕疵。
{
"brush_region": "scarf_area",
"motion_vector": [-0.6, 0.2],
"strength": 0.5,
"feather": 24,
"blend_mode": "smooth"
}
实战流程与输出参数建议
把三种功能串起来,效率会更高。常见的工作流是:先用文生图工具生成一张高质量概念图,导入 Runway 用图生视频做成镜头草稿,再针对头发、水面、烟雾等细节用运动笔刷做局部控制。单独依靠文生视频一步到位,往往要试很多条才能找到可用的构图,而图生视频加运动笔刷的组合能把成功率提上来。
导出时优先选择高码率的 MP4 或 ProRes。分辨率建议与项目最终规格一致,避免后期放大导致画面变软。帧率一般保持 24fps 或 25fps,AI 生成素材本身存在一定抖动,过高的帧率并不能带来更多真实细节。若需要更长镜头,可以分段生成后用剪辑软件拼接,让每段之间保留 1 到 2 秒的过渡空间,这样即使模型在接缝处有些不稳定,也能被过渡效果遮住。
Runway 的三种核心能力并不是彼此替代的关系。文生视频适合快速探索创意方向,图生视频适合把确定的视觉稿动态化,运动笔刷则用来修正局部细节。实际项目中不要追求一次生成完美长片,把任务拆成多个 4 秒小段,逐段确认后再串联,是更可控的做法。