AI视频生成的核心难点不在画面美观,而在于运动的精准控制。很多用户生成的视频中,人物动作要么僵硬如木偶,要么幅度夸张到肢体变形,根本原因是对提示词中动作描述和幅度控制词的运用不够精细。本文将从动作序列描述、运动幅度分级控制、镜头与动作的配合三个维度,系统讲解如何写出可控性强的AI视频提示词。

一、人物动作序列的描述方法:把动作拆成可执行的时间轴
AI视频生成模型对动作的理解依赖文本的时序结构。如果你只写一句话,比如"一个人在跳舞",模型只能随机猜测动作细节,生成结果往往不可控。正确做法是把动作拆解为有先后顺序的子动作,并明确每个动作的起止状态。
一个实用的描述框架是:主体加起始姿态,然后是动作过程,最后是结束姿态。例如描述一个人转身回头的动作,可以这样写:
一位穿黑色风衣的年轻女性,背对镜头站立,双手自然下垂。 她缓慢向右转身约90度,身体重心从左脚过渡到右脚, 同时头部跟随身体转动,最后目光看向镜头, 面部呈现微笑,动作在3秒内完整结束。
这种写法的好处是给模型提供了清晰的动作逻辑链。模型生成时会按照文本中的顺序逐帧推理,动作衔接明显比笼统描述更自然。需要注意的是,单个视频片段建议只描述一到两个连续动作,动作过多会让模型在有限时长内难以分配帧数,导致每个动作都被压缩得仓促生硬。
另一个技巧是使用状态变化词汇来强化时序感,比如"从站立到坐下"、"由静入动"、"先停顿后加速"。这类词汇在训练语料中与明确的画面变化绑定,能显著提升模型对动作节奏的把握。
二、运动幅度分级控制词库:从轻微到剧烈的量化表达
运动幅度是AI视频生成中最容易失控的维度。同样是"走路",缓慢踱步和疾走奔跑在画面上完全是两种效果,如果你不明确指定幅度,模型大概率会给出中间值或者随机波动。建议建立一套分级控制词库,按幅度从小到大排列使用。
下面是经过实践验证的分级词表,可以直接嵌入提示词中使用:
| 幅度等级 | 可用控制词 | 适用场景 |
|---|---|---|
| 极轻微 | 微微、轻轻、隐约、几乎不动、轻微晃动 | 呼吸起伏、眨眼、发丝飘动 |
| 轻微 | 缓缓、缓慢、小幅、轻柔地 | 转头、抬手、点头示意 |
| 中等 | 平稳地、匀速、正常速度 | 行走、转身、拿起物品 |
| 较大 | 快速、有力地、大幅度挥动 | 奔跑、跳跃前奏、舞蹈动作 |
| 剧烈 | 猛然、急速、全力、剧烈晃动 | 打斗、跌倒、极限运动 |
使用分级词时有两条经验值得注意。第一,幅度词要紧跟在动作词后面,比如"她缓慢地抬起手臂"比"她抬起手臂,动作缓慢"效果更好,因为前置修饰能让模型在推理动作时就锁定幅度范围。第二,剧烈幅度的描述要搭配物理约束词,比如"快速奔跑但身体保持稳定"、"剧烈挥拳但脚步扎实",否则模型容易在大幅运动时出现肢体扭曲、画面撕裂等伪影。
此外,还可以用数值化的角度和距离描述来精确控制幅度,例如"头部向左转动约30度"、"手臂抬起至肩膀高度"、"向前走两步后停止"。这类量化描述在多数主流模型上都有不错的响应,尤其适合需要精确匹配后续剪辑的素材生成。
三、镜头运动与人物动作的配合:可套用的完整提示词模板
人物动作不是孤立存在的,镜头运动会放大或削弱动作的视觉感知。固定镜头下的轻微动作看起来克制优雅,而推镜头配合同样动作则会显得戏剧化。因此专业提示词通常把人物动作与镜头指令写在一起,形成一个结构完整的模板。
以下是一个通用的高可控提示词模板,可以直接套用:
【主体】一位25岁左右的亚洲男性,穿白色衬衫,短发, 【场景】站在傍晚的天台边缘,背景是城市灯光。 【动作序列】他先低头看了一眼手中的照片(1秒), 然后缓慢抬起头望向远方(2秒), 最后轻轻将照片收入口袋,转身离开画面(2秒)。 【运动幅度】所有动作平缓克制,头部转动幅度不超过45度, 步伐为缓慢的步行速度。 【镜头】中景固定镜头,画面稳定,无镜头晃动。 【氛围】电影感色调,浅景深,情绪平静克制。
这个模板的六个模块并非必须齐全,但动作序列和运动幅度两个模块强烈建议保留。实际使用时可以根据平台特性调整,比如部分模型对镜头指令支持较弱,可以把镜头描述简化或去掉;而对动作幅度敏感的模型,建议幅度描述越具体越好。
最后一个容易被忽视的细节是负面提示词的运用。在支持负面提示词的平台上,添加"肢体变形、动作卡顿、画面抖动、多余的手指"等内容,能有效压制大幅运动时的常见瑕疵。正向描述负责告诉模型做什么,负向描述负责告诉模型别做什么,两者配合才能让生成结果稳定在预期范围内。
掌握这些方法后,建议用同一段动作描述做对比测试:先不加速度控制词生成一次,再加上分级幅度词生成一次,直观感受提示词精度对成片质量的影响。反复几轮,你就能建立起自己的一套描述直觉,让AI视频生成真正听从指挥。