想让AI直接产出广告级短视频,第一步不是学剪辑,而是学会把创意翻译成可灵能读懂的分镜指令。很多人输给AI的提示词只有一句话,比如“一个女生在咖啡店喝咖啡,阳光洒进来”,这种写法生成的结果往往只有单一机位、画面拖沓、缺少镜头变化。真正有效的做法是把提示词改造成带有镜头编号、景别、运镜方式、动作描述和时长的结构化文本。下面这张图展示了从模糊创意到分镜脚本的转换逻辑,你可以把它理解成一条流水线:左边是自然语言创意,右边是AI能稳定执行的镜头拆解。

可灵对提示词中的“镜头语言”非常敏感,像“特写”“全景”“缓慢推近”“手持跟拍”这些词会直接影响生成的画面构图和运动轨迹。如果你在提示词里不写景别,AI会默认使用中景或全景,导致产品细节不够突出;不写运镜,画面就会像监控录像一样固定不动。因此,第一条规则是:每一个分镜都必须明确三个要素——景别、运镜、动作。例如写“中景,镜头缓慢推近,女生端起咖啡杯轻抿一口,眼神看向窗外”,比只写“女生喝咖啡”能获得更精准的结果。
分镜提示词的基础结构:以镜头为单位拆解
给可灵写分镜提示词,推荐使用“镜头序号 + 景别 + 运镜 + 主体动作 + 环境细节 + 时长”这样的字段组合。景别控制在远、全、中、近、特五个级别,广告片常用近景和特写来突出产品,用全景交代场景。运镜方式可以写“固定”“推”“拉”“摇”“移”“跟”“升降”,也可以直接写“缓慢推近”“快速甩镜”这类带有速度感的描述。动作描述要具体到肢体和表情,比如“手指轻轻划过杯沿”“嘴角微微上扬”,避免“很开心”这种抽象词汇。
下面是一个可直接粘贴到可灵输入框的分镜提示词示例,只用文本格式即可,不需要额外符号。注意每个镜头独立成段,用数字编号隔开,AI会按照顺序生成连续画面。
镜头1:全景,固定机位,清晨的咖啡店室内,暖黄色灯光,女生坐在靠窗位置,双手捧着白色马克杯,背景有其他顾客模糊走动,时长3秒 镜头2:中景,缓慢推近,女生低头看向杯中的咖啡拉花,蒸汽缓缓上升,阳光从左侧窗户照在桌面上,时长2.5秒 镜头3:特写,微距镜头,咖啡表面拉花逐渐清晰,奶泡纹理细腻,光线在液体表面轻微晃动,时长2秒 镜头4:近景,手持轻微晃动,女生端起咖啡杯送到嘴边,动作放缓,视线始终停留在杯沿,背景虚化,时长3秒 镜头5:特写,快速甩镜转场,杯底落在木桌上发出轻微声响,咖啡液面晃动,画面定格,时长1.5秒
这种写法的优点在于AI不会自由发挥镜头数量,而是严格按照你给的五个镜头去生成。如果只写一段长文字,AI可能自动合并镜头,或者在一个镜头里塞进多个动作,导致节奏混乱。另外,给每个镜头标注时长也能有效避免画面拖沓——广告级短视频的镜头一般不超过3秒,快节奏部分甚至只有1秒左右。
控制节奏与转场:用提示词强化广告感
广告级短视频和普通生活记录最大的区别是节奏快、转场硬、信息密度高。可灵支持在提示词中直接指定转场方式,常见的有“硬切”“叠化”“甩镜”“匹配剪辑”“遮罩转场”等。你可以在两个镜头之间加入一行转场描述,或者直接在当前镜头的结尾写上“接下一镜头:硬切”。更好的做法是把转场和运镜结合起来,比如“镜头向右快速摇动,利用运动模糊切换到下一个场景”,这样AI会生成带有动态模糊的过渡帧,比单纯的硬切更有冲击力。
如果想要更高级的节奏控制,可以使用“节拍式”提示词:把整个脚本分成“起、承、转、合”四个部分,每个部分规定一组镜头数和总时长。比如起部分3个镜头共5秒,用来建立场景;承部分2个镜头共4秒,展示产品细节;转部分2个镜头共3秒,加入冲突或惊喜;合部分1个镜头2秒,收尾喊口号。将节拍信息写在提示词开头,AI会整体规划画面的运动幅度和剪辑密度。下面给出一个节拍控制模板。
【节拍说明】起:3镜头/5秒;承:2镜头/4秒;转:2镜头/3秒;合:1镜头/2秒 镜头1(起):全景,固定,办公室清晨,主角推开玻璃门走进来,自然光,时长2秒 镜头2(起):中景,跟随,主角走到工位放下背包,动作利落,时长1.5秒 镜头3(起):近景,固定,主角按下电脑开机键,手指特写,时长1.5秒 转场:快速甩镜至产品 镜头4(承):特写,微距,产品logo在屏幕上亮起,光线反射,时长2秒 镜头5(承):中景,环绕,主角对着屏幕点头,表情满意,时长2秒 转场:硬切 镜头6(转):近景,手持快速推近,主角突然转头看向镜头,表情惊讶,时长1.5秒 镜头7(转):特写,快速变焦,产品界面弹出提示窗口,红色高亮,时长1.5秒 转场:叠化 镜头8(合):全景,固定,主角微笑举起产品,背景逐渐虚化,字幕区域留白,时长2秒
这个模板把节拍和转场都写清楚了,可灵在生成时会把“甩镜”“硬切”“叠化”作为画面转换的依据,而不是随意拼接。需要注意的是,AI对转场词的识别有优先级,像“甩镜”“硬切”这类词出现频率高,生成效果更稳定;“匹配剪辑”“遮罩转场”虽然更炫酷,但偶尔会被忽略,建议放在镜头描述末尾并且单独成行。
角色一致性与负向提示词:提升广告成片率
多镜头短视频最怕角色“变脸”——第一个镜头是长发女生,第四个镜头变成短发或者换了衣服。可灵虽然支持角色参考图,但在纯文本提示词模式下,可以通过重复描述角色关键特征来锁定形象。具体做法是在每一个镜头的主体动作前加上相同的角色描述短语,比如“穿米色风衣、黑色长发、戴细框眼镜的女生”。这个短语在整段提示词中重复出现,AI会把它当作固定属性,避免前后不一致。对于产品也是一样,要反复写产品颜色、材质、logo位置,比如“银色铝合金外壳、左上角圆形logo的笔记本电脑”。
负向提示词同样重要,可灵支持在提示词末尾通过“排除以下元素”或直接写“不要出现”来约束画面。常用负向词包括:文字乱码、多余手指、画面变形、低清晰度、模糊、抖动过度、人物表情僵硬、产品变形。在广告场景里,还需要排除“品牌logo模糊”“产品颜色偏差”“多余路人”等细节。以下是负向提示词的写法示例,紧跟在最后一个镜头之后。
负向提示词:不要出现文字乱码,不要多余手指,不要人物面部变形,不要低清晰度,不要过度抖动,不要产品颜色偏差,不要背景出现无关品牌logo,不要模糊帧
把这条负向提示词附加到提示词末尾,能有效减少生成废片率。另外,如果画面中需要出现文字或标语,建议直接写“字幕区域留白,无任何文字”,让AI不要凭空生成乱码文字。需要后期加字幕时,留白区域可以给后期软件使用,避免AI生成不可控的文字。
整体来看,让可灵自动生成广告级短视频脚本分镜,核心就是把自然语言创意改写成“节拍描述+结构化镜头+转场指令+角色锁定+负向约束”的五段式提示词。刚开始可以先用3到5个镜头练习,熟练后再扩展到10个以上镜头的完整脚本。每次生成后根据画面反馈微调景别和运镜词,比如把“中景”改成“近景”来提升产品存在感,把“固定”改成“缓慢推近”来制造呼吸感。坚持用这种工程化方式写提示词,产出的素材会越来越接近可以直接投放的广告短片。