过去做一条产品宣传片,要么找外包团队花几万到几十万,要么自己学剪辑软件折腾半个月。现在情况变了,AI工具已经能覆盖从创意到成片的全链路。这篇文章用一个完整案例,带你走一遍AI全流程制作宣传片的真实过程,包括工具选型、具体操作和踩过的坑,看完你就能照着做。

案例背景与前期准备:先想清楚再动手
这次的项目是一款智能台灯的产品宣传片,时长目标90秒,风格要求简约科技感,预算几乎为零,周期一周。需求方给出的素材只有产品图三张和一个简单的功能清单。这种条件在传统制作流程里基本等于巧妇难为无米之炊,但放在AI流程里,反而是一个很典型的场景。
前期准备阶段最重要的不是打开工具,而是把需求翻译成AI能理解的输入。我先把产品功能清单丢给大语言模型,让它帮我梳理宣传片的叙事结构。一个好的宣传片通常遵循「痛点引入、产品亮相、功能展示、场景升华、结尾行动号召」这个骨架,让AI基于这个骨架生成三版脚本初稿,再人工挑选融合。注意,AI生成的脚本往往堆砌形容词,需要人为删掉那些空洞的华丽辞藻,保留有画面感、能落到具体镜头的句子。
脚本确定后,下一步是拆分镜。这一步的做法是把每一句旁白对应到一个镜头描述,输出一张分镜表,包含镜头号、时长、画面内容、景别和运镜方式。这张表是后面所有生成环节的总纲,务必做细。一个经验是,每个镜头控制在3到5秒,AI生成短视频片段时成功率更高,超过8秒的镜头生成质量和一致性都会明显下降。
画面生成:文生图定风格,图生视频做动态
直接用文生视频工具生成整条片子,目前的可控性还不够,人物会变形、产品会走样。实际操作中更稳妥的路线是两步走:先用Midjourney或即梦这类文生图工具把每个镜头的关键帧生成出来,确定构图和风格,再用图生视频功能让静态画面动起来。
定风格的第一步是统一视觉关键词。我在所有提示词里都固定加入了一组风格描述词,比如minimalist tech aesthetic、soft studio lighting、cool blue tone,这样不同镜头生成出来的画面才不会五颜六色各说各话。产品本身的还原是重点,智能台灯有特定的外形,纯靠文字描述AI很难画准。解决办法是用支持垫图的工具,把产品实拍图作为参考图上传,并设置较高的参考权重,多轮迭代生成。即便如此,也要做好心理准备:产品细节比如logo位置、按键数量可能出错,需要生成十几张再挑最接近的一张,后期再靠修图微调。
镜头03 分镜描述:台灯在书桌上自动亮起,暖光洒开 关键帧提示词: a smart desk lamp on a wooden desk, automatically turning on, warm light spreading over the workspace, minimalist tech aesthetic, soft studio lighting, cool blue tone background, product photography, high detail --ar 16:9 图生视频提示词: the lamp light gradually brightens, camera slowly pushing in, subtle dust particles floating in the light beam
图生视频环节,把关键帧导入可灵、Runway或即梦的视频生成功能,配上简单的动态描述词。这里有个关键技巧:动态描述要克制。让AI生成「镜头缓慢推近」这种简单运动,效果通常不错;但如果你写「镜头环绕产品旋转360度同时人物走动」,画面大概率会崩。宁可多生成几个简单运镜的片段,在剪辑时拼接,也不要指望AI一次生成复杂运动。另外每个镜头建议生成两到三版备选,AI视频生成存在随机性,同一个提示词两次生成的结果可能差别很大。
音频制作:AI配音与配乐的配合逻辑
旁白配音用的是AI语音合成工具,国内的剪映、魔音工坊,国外的ElevenLabs都可以。中文配音现在效果已经相当自然,选一个沉稳的男声或知性的女声,把脚本分段贴进去生成。分段的粒度建议按分镜表来,一个镜头一段旁白,这样后面音画对位会轻松很多。如果片子需要英文版或多语言版本,直接让TTS工具切换语言生成即可,这是AI流程相对传统配音的最大优势之一,改语言不用重新找人录。
配乐方面,Suno、Stable Audio这类AI音乐生成工具可以按描述生成定制音乐。提示词不要写得太抽象,与其写「好听的背景音乐」,不如写「ambient electronic, slow tempo, corporate tech vibe, no vocals」。生成时长要留出余量,90秒的片子生成两分钟的音乐,方便剪辑时截取情绪合适的段落。生成三四首备选,挑情绪起伏和片子节奏最匹配的一首。
音画同步是收尾阶段最费耐心的环节。我的做法是先把旁白音频按顺序铺进剪辑轨道,根据每段旁白的实际时长调整对应视频片段的长度和速度,让画面跟着声音走,而不是反过来。配乐音量压到旁白的百分之二十左右,在产品功能特写镜头处可以让音乐稍微推高制造情绪点。这些操作在剪映或必剪里都能完成,不需要专业软件。
成片合成与避坑清单
最后合成阶段,把所有素材导入剪辑软件,加上字幕、转场和片尾logo。字幕建议用剪辑软件的自动识别功能生成后再人工校对,AI语音的识别准确率很高,但专有名词和数字仍需检查。转场别贪多,产品宣传片用简单的叠化和黑场就够了,花哨的转场会稀释科技感。输出参数选择1080P、H.264编码、码率15Mbps以上,兼顾清晰度和文件大小。
整个流程里有几个坑值得单独说。第一是画面一致性,不同镜头的色调和场景风格要靠统一的风格提示词加上后期调色来兜底,剪辑时可以给全片加一层轻微的统一滤镜。第二是产品准确性,AI生成的产品画面终究是「像」而不是「是」,关键特写镜头建议用实拍素材替代,AI画面负责氛围和空镜。第三是版权合规,AI生成内容的版权归属在不同平台规则不同,商用前要确认所用工具的商用授权条款,人脸相关的生成内容尤其要谨慎。第四是人物镜头,AI生成的人物容易出现手部畸形、表情僵硬的问题,能不出现真人正脸就尽量用剪影、背影或手部特写替代。
全流程算下来,这条90秒的片子实际耗时四天,其中一半时间花在画面生成的反复抽卡上。相比传统流程,AI全流程的优势是成本极低、迭代极快,改一版脚本只需要重新生成受影响的镜头;劣势是精细控制力弱,追求电影级质感依然需要实拍配合。对于预算有限、周期紧张的中小团队和独立创作者,这条路线已经完全跑得通,值得动手试一次。