用AI生成汉服人像已经成为很多设计师和自媒体创作者的日常操作,但一个常见的困扰是:在Midjourney里调好的提示词,换到Stable Diffusion或者国产绘画平台后,出来的画面完全变了样,汉服变成了影楼古装,人物面部也失去了东方韵味。这背后的原因在于不同平台对提示词的解析逻辑、训练数据倾向和参数体系都不一样,提示词必须针对平台特点做改写,才能真正发挥每个平台的优势。

Midjourney汉服人像提示词的基本结构
Midjourney对自然语言英文描述的响应非常灵敏,它擅长理解较长的、带有氛围感的句子式提示词。写汉服人像时,推荐采用“主体描述+服饰细节+姿态表情+环境光线+风格参数”的结构。主体部分说明人物年龄、性别、气质,服饰部分则需要准确使用汉服专有名词,比如hanfu、Qipao要区分清楚,齐胸襦裙可以写成ruqun dress with high waist,马面裙是mamian skirt或者horse-face pleated skirt。
服饰细节是汉服人像成败的关键。Midjourney对traditional Chinese embroidery、flowing wide sleeves、cross-collar design这类词组识别度很高,如果想突出面料质感,可以加上silk fabric、sheer gauze材质词。下面是一个典型示例:
a young Chinese woman wearing traditional hanfu, song dynasty style, cross-collar ruqun dress, flowing silk sleeves, delicate floral embroidery, hair in an ancient bun with a golden hairpin, standing in a bamboo forest, soft morning light, gentle smile, cinematic composition, photorealistic --ar 3:4 --v 6 --style raw
参数部分同样重要。--ar 3:4或--ar 9:16更适合人像构图,--style raw能减少Midjourney默认的过度美化,让画面更接近真实摄影质感。如果生成结果偏卡通,可以在提示词里强调photorealistic、shot on 85mm lens这类摄影术语来压制插画倾向。
不同平台解析提示词的核心差异
Midjourney是纯云端服务,提示词权重靠语序和::多段权重语法控制,而Stable Diffusion是本地模型推理,支持括号加权语法,比如(hand embroidery:1.3)表示将刺绣细节的权重提升到1.3倍。两者的训练数据分布也不同,Midjourney对东方美学的理解更偏“氛围渲染”,Stable Diffusion如果没有加载国风LoRA模型,很容易把汉服画成和服或者清宫戏服装,这是数据集偏差造成的。
国产平台如文心一格、通义万相对中文提示词的理解更自然,但对英文参数不敏感。在这些平台上,与其写long flowing sleeves不如直接写“飘逸的宽袖”“云肩领口”,中文描述反而更精准。另外要注意负面提示词的适用范围:Stable Diffusion支持negative prompt,可以把wrong costume、japanese kimono、bad hands放进去排除干扰;而Midjourney目前没有官方负面提示词功能,只能用--no参数实现类似效果,例如--no kimono, modern clothes,但力度比真正的负面提示词弱不少。
权重处理还有个容易被忽视的坑:Stable Diffusion里括号嵌套层数过多会导致画面崩坏,一般单层括号权重不超过1.4;Midjourney的::2分段权重如果数值差距太大,会让低权重段落几乎完全失效。改写提示词时要根据平台的权重机制重新分配关键词的主次,而不是简单翻译。
汉服人像提示词跨平台改写实战
假设我们已经有了一个Midjourney版本的提示词,目标是汉服少女在庭院赏花的场景。改写到Stable Diffusion时,第一步是拆分正向和负面提示词,第二步是给关键元素加权,第三步是根据所用基础模型补充质量词。Stable Diffusion的SDXL系列模型对bokeh、masterpiece、highly detailed face这类质量词响应明显,而Midjourney则不太需要这些凑数词。
正向提示词: (masterpiece, best quality:1.2), 1girl, solo, hanfu, song dynasty ruqun, (cross-collar design:1.3), flowing wide sleeves, (traditional embroidery:1.3), black hair, ancient hairstyle, looking at viewer, courtyard, peach blossoms, soft sunlight, shallow depth of field, 85mm portrait 负面提示词: japanese kimono, wrong hanfu structure, modern clothing, extra fingers, deformed hands, lowres, bad anatomy, watermark
改写到中文平台时思路又不一样。文心一格这类平台偏好结构化的中文描述,可以直接写“宋代制式汉服少女,交领襦裙,广袖飘逸,衣襟绣有缠枝花卉纹样,立于江南庭院桃树下,侧光柔和,浅景深人像摄影风格”。注意“制式”“交领”“缠枝纹”这些专业词汇在中文语料里对应着准确的汉服形制描述,比翻译过去的英文更容易命中平台的学习数据。
最后还有一个通用技巧:无论在哪个平台,生成汉服人像都要坚持小步迭代。先确定服饰形制正确,再调整面部细节,最后优化光影构图,一次性堆几十个关键词反而会让各平台的注意力机制顾此失彼。改写提示词的本质不是翻译,而是理解每个平台“听得懂什么话”,用它的语言去描述同一个创意,这样才能在多平台之间稳定产出高质量的汉服人像作品。
Midjourney提示词汉服人像AI绘画修改时间:2026-09-03 17:43:08