用AI视频生成工具制作中国风短片时,提示词的质量直接决定画面是真正的水墨意境还是廉价的贴图感。水墨山水讲究墨分五色与留白,工笔古典建筑需要准确的斗拱、飞檐和色彩逻辑,汉服人物则依赖形制、面料与动态细节。本文把这些元素拆解成可组合的提示词模板,并加入音频提示词的配合方法,帮助你在文生视频或图生视频流程中稳定输出中国风画面。

一、中国风视觉元素拆解:水墨、工笔、古典建筑与汉服提示词要点
水墨山水在AI视频中容易被生成成普通的黑白风景,缺少中国传统绘画的皴法与晕染感。提示词需要同时控制媒介属性和笔法特征。英文提示词可以写ink wash painting、shuimo style、monochrome ink、misty mountains、negative space、xuan paper texture、splashed ink、layered washes、brush strokes。中文模型则更适合使用“水墨山水,墨分五色,留白,泼墨,皴法,云雾,意境”等连续短语。要避免只写black and white landscape,那样会变成普通灰度照片,失去水墨的渗透感和纸面纹理。
工笔古典建筑的提示词需要突出界画式的精细线条和宫廷建筑的色彩体系。典型关键词包括gongbi style、traditional Chinese architecture、dougong brackets、upturned eaves、glazed roof tiles、vermilion columns、turquoise eaves、golden roof、intricate wood carving、symmetrical courtyard layout。中文提示词可以使用“工笔,界画,斗拱,飞檐,琉璃瓦,朱红立柱,青绿彩绘,宫廷建筑,庙宇”。如果缺少这些具体构件词,AI容易把中国古建筑画成日式天守阁或东南亚寺庙。特别是飞檐的弧度和斗拱的层叠关系,需要在提示词中强调curved roof ridges、layered bracket system、wooden structure without nails。
汉服人物是另一个容易翻车的元素。只写traditional Chinese clothing常常出现影楼装或者和服混搭。建议明确形制与材质:hanfu、cross-collar、wide sleeves、silk fabric、flowing skirt、embroidered patterns、jade pendant、hairpin、classical makeup。中文提示词可以使用“汉服,交领,宽袖,丝绸,襦裙,刺绣,发簪,步摇,古风妆容,衣袂飘飘”。如果画面需要人物动态,还要补充动作和风力描述,例如walking slowly、dancing with flowing sleeves、wind blowing through fabric,这样视频生成时布料才有自然的飘动感。
二、提示词结构设计:从基础描述到风格控制
静态图像提示词通常按主体、风格、光影、质量四个部分组织,视频提示词还需要加入时间维度的描述。一个稳定的结构是从具体到抽象:先说画面主体和服装,再叠加风格修饰,然后描述光影氛围和运动方式,最后补充技术质量词。这样模型能先锁定物体结构,再渲染风格,减少结构崩坏的概率。
下面是一个可直接修改的完整提示词模板,文本类视频模型和部分图生视频模型都适用。
主体:a woman in traditional Chinese hanfu with cross-collar and wide sleeves, standing in front of an ancient palace 风格:gongbi style, ink wash painting, Chinese classical architecture, fine linework, elegant color palette, traditional Chinese painting 光影:soft diffused light, morning mist, subtle volumetric light, warm golden tone 动态:slow camera push in, fabric swaying gently, hair moving in breeze, leaves falling slowly 质量:8k, highly detailed, cinematic lighting, masterpiece, traditional art style 负面提示词:low quality, blurry, deformed hands, extra fingers, jpeg artifacts, plastic texture, messy lines, color bleeding
使用中文模型时,可以把上述内容改为中文短语,但注意保持同样的分层顺序。例如先写“一位身穿交领宽袖汉服的女子站在古宫殿前”,再写“工笔风格,水墨晕染,中国古典建筑,线条精细”,然后补充“柔光,晨雾,微风,画面前推,衣袂飘动”。负面提示词建议加上“塑料质感,线条杂乱,色彩溢出,结构错误,低清晰度”。
权重控制也很关键。许多模型支持通过<lora:hanfu_v1:0.8>这类语法调用风格模型,但不同平台格式不同。调用时注意权重不宜过高,否则人脸和结构会被风格模型拉扯变形。一般从0.5到0.8开始测试,逐步调整。提示词中越靠前的内容权重越高,所以主体和风格词应放在前面,质量词放在末尾。
三、AI视频生成中的动态与音频提示词配合
视频生成与静态图片的最大区别在于运动描述。水墨山水画面如果只写mountain and river很容易得到静止图片加上轻微镜头晃动。想要真正的水墨动画感,需要描述环境变化和笔触流动,例如ink spreading slowly、clouds drifting across peaks、water flowing through rocks、mist rising from valley。镜头运动可以写slow pan right、aerial tracking shot、close-up of brush texture。人物镜头则需要明确动作速度与幅度,避免生成机械式摆动。
音频提示词是中国风视频经常被忽略但非常有效的控制维度。部分AI视频工具支持音频生成或音画同步,提示词可以描述声音来源和环境音。例如水墨山水镜头可以配合guqin music、distant temple bell、flowing stream、wind through bamboo;汉服人物镜头可以加入bamboo flute、pipa plucking、fabric rustling、soft footsteps on stone。中文提示词可以使用“古琴,竹笛,流水,风过竹林,寺庙钟声,琵琶,衣料摩擦声”。
一个音频提示词模板可以这样写:
ambient sound: gentle guqin melody, distant bamboo flute, light rain on lotus leaves, occasional temple bell mood: calm, ethereal, traditional Chinese aesthetics tempo: slow, breathing rhythm sound effects: fabric rustling, water dripping from eaves, birds in distant forest
音频节奏要与画面运动保持一致。