AI视频生成已经过了只看画质的阶段。同样的模型,提示词里有没有叙事结构,出来的镜头质感完全不同。常见写法是只描述画面内容,比如“一个穿风衣的人站在雨夜的巷子里”,这能生成画面,但生成不了紧张感。因为模型需要更明确的情绪锚点、节奏信号和变化曲线。下面分别拆开讨论悬疑氛围、喜剧节奏、情感曲线三个方向。

悬疑氛围构建词:把不确定感写进提示词
悬疑的核心不是吓人,而是让观众知道有什么不对,但不知道什么时候发生。提示词不能只写“恐怖”,要写清楚哪些元素制造了信息差。常用构建维度包括景别、光线、声音、镜头运动、物件细节。例如“缓慢推进的远景,人物站在走廊尽头,面部不可见”比“一个恐怖的人站在走廊”更有效,因为它限制了信息暴露,同时保留了空间纵深。
来看一个对比。
基础画面:夜晚的旧旅馆走廊 叙事型提示词: 近景缓慢前推,摄影机轻微晃动,走廊尽头的门半开,门缝透出冷白色光,人物站在阴影里只露出下半身,墙纸边缘卷起,远处有轻微的金属摩擦声,整体色调偏青灰,画面有一层薄雾
这组提示词里,近景缓慢前推限制观众视野,轻微晃动带来手持感,门半开和冷白光制造入口未知,人物隐藏上半身剥夺识别,金属摩擦声给声音暗示,青灰和薄雾统一压抑色调。模型收到的不只是“走廊”,而是一连串情绪线索。
悬疑提示词需要“三层结构”:环境异常、信息遮挡、后果暗示。环境异常写空间本身的不合理,比如“时钟全部停在同一时刻”;信息遮挡写观众看不到的部分,如“背影挡住桌面上的东西”;后果暗示写即将发生的轻微变化,如“门把手缓缓转动但没有完全打开”。按这个结构写,模型更容易理解紧张感来自哪里,而不是把所有黑暗元素无序堆叠。
喜剧节奏描述:制造停顿、重复和反差
喜剧节奏在AI视频里容易被忽略。如果提示词只写“一个人搞笑地摔倒”,生成结果往往只是夸张动作,没有节奏。喜剧感来自预期建立与打破之间的时间差。提示词里需要明确“停顿多久”“动作重复几次”“先正常后突然变化”等节奏词。
普通版写一个动作,节奏版会把动作拆成有停顿的节拍。
普通版:一个人端着咖啡走向办公室,突然滑倒。 节奏版:一个人端着咖啡自信地走向办公室,第一步正常,第二步脚下一滑,身体僵住半秒,咖啡杯飞出去,表情从微笑变成惊恐,随后摔倒,咖啡洒在键盘上,旁边同事先愣住再慢慢转头。
“身体僵住半秒”是停顿,它是喜剧节奏的核心。微笑到惊恐是反差,先愣住再慢慢转头是二次反应,让笑点有承接。重复提示也很有效,比如“连续三次试图捡起地上的文件,每次都在快碰到时被风吹走”,重复次数和失败节点要写清楚,模型才知道笑点不在动作本身,而在失败循环。
喜剧提示词还可以加入“表演语气词”和“画面节奏”。例如“动作突然加速”“镜头快速拉远”“背景音乐突然停下”,这些词会改变生成视频的剪辑感。不要一次给太多笑点,一个镜头里最多一个主笑点加一个反应镜头。多个笑点堆叠会被模型平均处理,反而失去节奏。
情感曲线设计:把视频拆成四个节拍
一段短视频也有情绪曲线。直接写“温馨到感人”很难让模型生成自然过渡。有效做法是先定义节拍,再用提示词控制每个阶段的情绪强度和镜头语言。常见四拍结构是起、承、转、合。起是建立状态,承是维持或轻推,转是打破状态,合是情感落点。每段提示词要包含情绪词、动作强度、镜头距离和色调。
下面是一组按四拍结构写的提示词。
起:清晨,老人坐在窗边慢慢喝茶,暖黄色阳光,安静微笑,固定镜头 承:他翻开旧相册,手指停在一张黑白照片上,镜头缓慢推进到照片 转:照片里是年轻时的自己和一条狗,现实房间突然变得安静,阳光被云遮住,色调由暖转冷 合:老人轻轻合上相册,把照片贴在胸口,窗外云散开,一缕光重新落在脸上,镜头慢慢拉远
起拍情绪强度通常不超过三成,转拍可以到七至八成,合拍回落到五成左右。提示词不能在同一段里一会儿高兴一会儿悲伤,要留出过渡空间。如果模型生成时转折生硬,可以在“转”之前加一句“情绪变化不是突然发生,而是从细微动作开始”,这样给模型过渡指令。
情感曲线还要配合声音和节奏提示。AI视频工具如果支持音乐或环境音描述,可以写成“合拍处弦乐渐弱,留出1秒静默”。同时使用顺序词和时间词,比如“先”“然后”“最后”,有些模型对秒数理解不稳定,但会把顺序词当作镜头顺序标记。
叙事型提示词模板与检查清单
把以上思路固化为可复用模板:画面主体加动作状态,加镜头运动,加光影色调,加声音氛围,加节奏词,再加情感变化。不必每项都写,但叙事型视频至少要有动作状态、镜头运动、节奏词、情感变化四项。
叙事型提示词模板: [主体]在[空间]里[动作],[镜头运动],[光影/色调],[声音暗示],整体节奏[快/慢/停顿], 情绪从[状态A]逐渐过渡到[状态B]
写完后可以用几个问题自查:是否写清了信息遮挡,有没有观众看不到但能感受到的东西;是否有节奏词,比如停顿、突然、缓慢或反复几次;情绪是否单一,一个镜头是否只走一条情绪线;结尾是否有落点,画面最后停在哪个物件、动作或表情上。
这些检查能帮助排除生成结果夸张但空洞的问题。AI视频提示词不是形容词越多越好,而是要让每一组词都服务于叙事。悬疑靠信息控制,喜剧靠节奏控制,情感靠曲线控制。这个思路不依赖特定模型,在Sora、Runway、Pika、可灵等工具里都适用。把这三种能力放进提示词里,生成的不再是一个镜头,而是一段可以被记住的情绪。