在AI视频生成任务中,提示词的质量直接决定画面稳定性与叙事清晰度。本文提出的万能公式将文生视频提示词拆解为五个核心维度:主体、动作、场景、风格、光线。这种结构并非简单罗列,而是模拟影视分镜的语言逻辑,让文本到视频的跨模态模型更容易对齐空间与时间信息。

为什么需要主体+动作+场景+风格+光线的公式
当前主流文生视频模型普遍采用扩散加时序注意力机制,文本编码器会将提示词映射为交叉注意力权重。如果提示词缺乏明确主谓宾,模型会在多概念间平均分配权重,导致主体模糊、动作漂移。例如仅写“美丽的森林”,模型可能生成空镜或随机生物;而“一只狐狸(主体)穿过(动作)积雪松林(场景)”则明确了视觉中心与运动路径。
从训练数据分布看,视频数据多带有镜头描述文本,这类文本常包含对象、行为、环境、影调等字段。使用五段式公式相当于用模型熟悉的语言格式喂入条件,减少语义鸿沟。实践中,同样硬件下,公式化提示词的首帧一致率比散写提升明显,且动作连贯帧数更长。
另一个容易被忽视的点是风格与光线的解耦作用。风格决定色彩与笔触倾向,光线决定立体与情绪。若二者缺失,模型会回退到默认中性光照,使视频缺乏记忆点。把风格和光线显式写出,等于给解码器设置了后处理约束,输出更易符合预期。
公式各字段的写法与代码示例
主体字段应写具体名词,避免“东西”“人物”等泛称。若需多个主体,用“与”连接并标明关系,如“穿红衣的女孩与金毛犬”。动作字段优先选可动画词:行走、旋转、飞翔,少写“显得开心”这类状态词。场景字段补充地点与背景元素,风格字段可引用已知流派或艺术家名,光线字段写硬光、逆光、暮光等。
下面用Python拼接提示词的例子展示结构化生成。该方式便于批量生产,也方便后期微调权重。
def build_prompt(subject, action, scene, style, light):
# 按公式顺序拼接,用逗号分隔保持语义块独立
parts = [subject, action, scene, style, light]
prompt = ",".join([p for p in parts if p])
return prompt
prompt = build_prompt(
subject="一只机械鲸鱼",
action="在云层中缓慢游动",
scene="黄昏时的悬浮古城",
style="蒸汽朋克插画风",
light="暖橙色侧逆光"
)
print(prompt)
# 输出:一只机械鲸鱼,在云层中缓慢游动,黄昏时的悬浮古城,蒸汽朋克插画风,暖橙色侧逆光
上述代码把五个维度参数化,实际调用时只需改字段。若使用支持权重符号的平台,还可在动作后加冒号与数字提升权重,如“游动:1.2”。但注意不同工具语法不同,有的用括号,有的用加减号,需查文档。
在网页端直接填写时,也可借助模板字符串。下面是用JavaScript拼装并插入页面的示例,演示如何把公式落到输入框。
const formula = {
subject: "白衣剑客",
action: "立于竹梢挥剑",
scene: "雾气缭绕的峡谷",
style: "水墨动画",
light: "清冷月光"
};
const text = `${formula.subject},${formula.action},${formula.scene},${formula.style},${formula.light}`;
document.getElementById("promptInput").value = text;
常见误区与进阶调整策略
新手常把风格写成“好看”“震撼”,这类词无视觉锚点,模型无法映射。应使用可检索的风格词,如“低保真像素风”“吉卜力背景美术”。同样,光线写“漂亮的光”不如“顶光突出轮廓”。精确名词来自看片积累,建议建立个人词库。
当视频出现主体闪烁,多是动作描述含歧义。比如“跳舞”可指全身也可指手,可改为“原地踢踏舞步”。若场景被忽略,检查是否把场景词写到了风格后,部分模型按位置赋权,场景靠后会导致背景崩坏。公式顺序本身也是一种位置编码暗示。
进阶用法是嵌套公式:在主体里嵌入子公式,如“(铜皮机器人+手臂变形)在雨中奔跑”。用括号制造局部权重组,适合复杂构图。也可在光线后加镜头词“浅景深”“广角”,扩展为六段。但段数越多越考验模型承载力,建议从五段扎实练起。
不同平台的适配与实测差异
开源模型如基于Stable Video Diffusion的衍生工具,对英文提示更稳,中文需翻译且保留专有名词。可先按公式写中文,再用翻译接口转英文,但风格词如“赛博朋克”直接留英文。闭源商业产品多已做中文优化,公式同样适用,仅分隔符可换为空格。
我们对比了三组输入:散写“海边少女笑”、四段“少女漫步沙滩日系”、五段“少女,漫步,沙滩,日系胶片,柔光”。五段组在人物保持与海浪节奏上优于前两者,四段组缺光线导致对比度随机。可见光线虽小,却影响成片质感。
最后提醒,公式不是僵化教条。当生成风景空镜时,主体可弱化为“薄雾”,动作写“流动”,依然成立。理解每字段的底层作用,才能灵活变通,写出既规范又有创意的文生视频提示词。