在Runway里输入提示词,最怕的不是参数不对,而是脑子里根本没有画面。你或许能写出“a beautiful landscape”,但Runway返回的往往是一段平庸的航拍镜头,和想象中云雾缭绕的峡谷相去甚远。问题出在提示词缺少可调用的视觉细节,而这些细节恰恰是分类词库要解决的核心。分类词库不是简单地把词语按主题堆放,而是把每个主题下最容易影响画面质量的关键元素拆解开,让你在想不出词的时候,能像查字典一样快速定位到“光影词”“材质词”“镜头词”,从而组合出有层次、有叙事感的提示词。

Runway背后的视频生成模型对自然语言有很强的理解能力,但它依然高度依赖提示词中具体名词和形容词的密度。比如写“a person walking in the forest”,模型可以生成一段人走路的视频,但人物穿什么衣服、森林是清晨还是黄昏、镜头是跟拍还是固定机位,这些信息全部缺失,最终结果自然充满随机性。有了分类词库,你可以快速补全这些信息,让提示词从模糊的“一个人走在森林里”变成“一个穿着米色风衣的年轻女性在晨雾弥漫的松树林中缓慢行走,镜头从侧面低角度跟拍,柔和的体积光穿过树冠”。这种改变不需要任何额外参数调整,纯粹靠词汇就能大幅提升画面质量。
为什么Runway提示词需要分类词库
人的记忆天然是分类存储的,但视频生成模型并不理解“风景”这个抽象概念,它只认识具体的像素特征和与之关联的文本标签。当你想到“风景”时,大脑会同时激活山脉、河流、云层、季节、天气、时间段等子类,但真正写提示词时,这些子类往往被简化为一个笼统的词。分类词库的意义就是把这种隐性的联想外化成可检索的列表,降低每次生成时的认知负担。你没有必要强行记住几百个专业摄影词汇,只需要在需要时打开对应的分类,勾选几个关键词,就能拼出一句结构完整的提示词。
另一个容易被忽略的点是,Runway的提示词对镜头语言尤其敏感。同样的主体和环境,加入“aerial view”“close-up shot”“tracking shot”等词之后,视频的构图和运动方式会发生明显变化。这些镜头词汇不属于任何单一主题,但可以独立成一个分类,和风景、人物、动物、科幻交叉使用。分类词库如果只按内容主题划分,仍然会漏掉这类跨主题的通用元素。因此一个完整的词库至少应该包含两层:内容层(风景、人物、动物、科幻等)和表现层(光影、镜头、风格、时间、天气),两层组合后才能最大化提示词的可控性。
从实际使用流程来看,分类词库还能减少重复试错。很多人在Runway中不断调整提示词,往往是因为第一次生成的结果偏离预期,但又说不清哪里不对。如果手边有一份结构化词库,你就可以逐项排查:是主体描述不够具体?还是缺少环境信息?是镜头运动没写?还是风格词冲突?分类词库提供了一种调试思路,让提示词优化从凭感觉变成按维度检查,效率提升非常明显。
四大主题分类词库:风景、人物、动物、科幻
下面给出四个最常见主题的基础词库框架。每个主题都拆成主体特征、环境背景、光影天气、镜头运动四个维度,你可以直接复制到自己的笔记软件里,按需取用。风景类最依赖光影和季节词,因为同样的山在不同时段呈现出的氛围完全不同;人物类则要把动作和服装细节写清楚,否则模型容易生成僵硬或穿着随意的人物;动物类必须配合生态环境,否则主体会显得悬浮不真实;科幻类则需要借助材质、光线和未来元素来营造陌生感。
风景类词库
风景提示词的核心是让场景有可被感知的时间和空间层次。不要只写“mountain”,而要写“snow-capped mountain at sunrise with cloud inversion below the peak”。季节词如“autumn foliage”“winter frost”“spring blossom”能瞬间改变整个画面的色调,天气词如“mist”“rain”“fog”“clear sky”则决定空气透视感。镜头方面,风景常用“panoramic view”“drone shot”“wide angle”来强调空间广度。把下面的关键词组合成完整句子,就能稳定生成具有电影感的自然风光。
主体特征:mountain range, ocean cliff, desert dune, pine forest, glacier lake, rice terrace 环境背景:winding river, ancient stone path, distant village, rocky coastline, bamboo grove 光影天气:golden hour, blue hour, overcast sky, volumetric light, sun rays through clouds, heavy mist 镜头运动:slow pan, aerial orbit, timelapse, dolly zoom, static wide shot 风格质量:ultra detailed, 8k, cinematic composition, natural color grading, National Geographic style
人物类词库
人物类提示词的关键在于可辨识的服装、动作和情绪。Runway对“a person”的理解非常模糊,但如果写成“an elderly fisherman wearing a worn-out yellow raincoat, standing on a wooden pier, staring at the horizon with a tired expression”,画面立刻有了故事感。动作词要具体到肢体姿态,比如“tying shoelaces”“flipping through a book”“leaning against the railing”,避免使用“doing something”这种空泛描述。情绪可以通过面部表情和身体语言共同体现,例如“shoulders slightly hunched”“gentle smile”“eyes looking away”。镜头方面,人物视频常用“medium shot”“close-up”“over-the-shoulder shot”来引导视线。
主体特征:young woman in beige trench coat, elderly man with silver beard, child wearing red beanie, street dancer in baggy jeans 动作姿态:walking slowly, tying shoelaces, flipping through a book, leaning against the railing, adjusting a camera strap 情绪表达:tired but determined, lost in thought, gentle smile, nervous fidgeting, calm and composed 服装细节:worn-out leather jacket, wool scarf, denim overalls, white sneakers, vintage round glasses 镜头运动:medium shot, close-up on hands, over-the-shoulder shot, slow tracking, static portrait
动物类词库
动物类提示词最容易出现的问题是主体和环境脱节。你写“a fox”时,模型可能生成一只站在空白背景里的狐狸,看起来像贴图。解决办法是强制加入生态环境和动物行为,比如“a red fox standing on a moss-covered rock in a misty forest, ears perked up, looking back over its shoulder”。动物的姿态和动作往往比外观更重要,因为观众对动物行为有直觉判断,站立、奔跑、捕食、梳理毛发等行为词能大幅提升真实感。镜头语言也可以辅助叙事,例如用“low angle close-up”强调动物的体型,用“telephoto lens compression”模拟野生动物摄影的质感。
主体特征:red fox, african elephant, humpback whale, snow leopard, barn owl, seahorse 生态环境:misty forest floor, savanna grassland, deep blue ocean, rocky mountain slope, coral reef 行为动作:ears perked up, looking back over shoulder, diving into water, stalking prey, grooming feathers 光影天气:dappled sunlight, underwater light rays, moonlit night, heavy rain, golden backlight 镜头运动:low angle close-up, telephoto lens, slow motion, tracking shot, aerial view
科幻类词库
科幻类提示词不能只堆砌“futuristic”和“neon”,那样只会得到廉价赛博朋克画面。真正高级的科幻感来自材质、光线和空间逻辑的组合。比如“a derelict space station corridor with exposed cables and flickering fluorescent lights, viewed from a low angle”就比“futuristic city street”具体得多。金属、玻璃、全息投影、悬浮结构、生物机械等材质词能快速建立视觉差异。光线方面,“volumetric laser beams”“holographic glow”“cold blue ambient light”都是常用元素。镜头运动可以更大胆一些,比如“slow orbital shot”“rapid push-in”“wormhole transition”来匹配科幻场景的陌生感。
主体特征:derelict space station, cybernetic android, floating island, quantum gateway, bio-mechanical creature 环境背景:exposed cables, holographic billboards, zero-gravity corridor, alien jungle, neon-lit alley 材质光线:brushed metal, transparent glass, glowing circuits, volumetric laser beams, cold blue ambient light 镜头运动:slow orbital shot, rapid push-in, wormhole transition, low angle tracking, dutch angle 风格质量:cinematic sci-fi, Blade Runner style, hard surface modeling, atmospheric haze, 8k octane render
从分类词库到高质量视频:提示词组合与调优技巧
有了分类词库,下一步是学会组合。一个可靠的提示词结构是:主体描述 + 环境背景 + 光影天气 + 镜头运动 + 风格质量。这个顺序不是死板的,但保持稳定有助于Runway理解各部分的权重。例如从风景类词库中选取“misty pine forest”“golden hour”“slow pan”“volumetric light”,组合成“golden hour sunlight filtering through misty pine forest, volumetric light, slow pan, ultra detailed, 8k, cinematic composition”。如果你想让画面偏向纪录片风格,可以加入“National Geographic style”或“documentary footage”;如果偏向电影感,就用“cinematic color grading, anamorphic lens flare”。这种组合方式比随手写五个形容词更容易控制输出方向。
常见误区之一是形容词堆砌。写“beautiful amazing stunning incredible landscape”并不会让画面变得更好,反而会稀释关键词的权重。Runway的文本编码器会尝试理解所有词,但无效形容词占用了注意力,真实有效的主体和环境信息反而被削弱。正确做法是挑选一两个精准的形容词,比如“ethereal”“moody”“serene”,然后让名词承担主要信息量。另一个常犯错误是缺少摄像机运动词,所有视频都默认成缓慢推拉镜头,导致看起来像幻灯片。即使你只想要静态画面,也应该写上“static shot, fixed camera”来明确意图,而不是留空让模型随机发挥。
调优过程中,务必利用Runway的负面提示词或排除词功能。如果在生成森林场景时总是出现奇怪的建筑,可以在排除词中加入“building, house, man-made structure”。如果生成的人物脸部扭曲,可以加入“deformed face, extra limbs, bad anatomy”。这些负面词同样可以整理成一个小词库,按主题分类,例如风景类排除“people, cars, power lines”,人物类排除“blurry face, extra fingers”,动物类排除“collar, leash, human hand”,科幻类排除“wood texture, organic overgrowth”。负面词库和正面词库配合使用,能显著减少废片率。
最后,分类词库不是一成不变的。你可以把每次成功生成视频所用的提示词保存回词库,标注出有效组合和无效组合,逐渐形成自己的风格偏好。用Notion、Excel或者纯文本文件管理都可以,关键是每周花几分钟回顾Runway的生成历史,把那些带来惊喜画面的词汇提取出来,补充到对应分类下。时间久了,你的词库会带有个人的审美印记,这时候灵感就不再是问题,因为你能通过已有词汇的组合不断推导出新的画面,而不是每一次都从空白开始。