Pika的负面提示词并不是把不想要的物体简单列出来,它真正参与的是扩散模型每一步去噪预测。生成视频时,Pika会在潜在空间中同时编码正向提示词和负面提示词,正向提示词负责拉高目标特征的出现概率,负面提示词则对不希望出现的特征施加负向引导。比如当你只写一个女孩在街头跳舞时,模型可能从训练数据里带入常见的低质量模式:多出一根手指、面部轻微扭曲、背景里闪过奇怪的文字或压缩块。把这些特征放进负面提示词后,模型在采样过程中会主动避开这些视觉模式,而不是等生成完再去擦除。

一、Pika负面提示词的工作机制
Pika目前对负面提示词的处理与主流的文生视频扩散模型类似,底层依赖无分类器引导。简单说,模型在每一步预测噪声时,会分别计算有条件预测和无条件预测,再用一个引导系数把两者拉开。正向提示词和负面提示词会被编码成不同方向的向量,最终决定潜在表示向哪一侧移动。负面提示词并不是直接删除某类物体,而是压制该类物体对应的激活区域。比如写 deformed hands,模型不会专门执行一个删除手的步骤,而是让手部区域的采样方向远离畸形手指的分布。这也是为什么负面提示词过强时,画面里的手部可能变得模糊、过小或者干脆被隐藏起来。
理解这一点后,写负面提示词就要避免一个误区:堆砌大量含义重复的词。重复的词并不会叠加出更强的排除效果,反而可能让不同负面特征的梯度相互干扰。例如同时写 extra fingers 和 deformed hands 是合理的,但重复写多遍 deformed hands 并不会让手部更正常。更有效的做法是把问题拆成几个独立维度,比如解剖结构、画质噪声、场景元素、运动伪影,然后每个维度只保留最准确的一两个词。
另一个关键点是负面提示词必须和正向提示词保持语义边界。不要在负面提示词里写画面中本来就没有的元素,也不要写过于宽泛的负面词,例如 bad quality 这种词可能会拖低整体细节。负面提示词越贴近你遇到的真实缺陷,模型越容易定位到需要修正的局部特征。后面会给出具体分类和可复用的模板。
二、按问题分类的负面提示词写法
按问题来源拆分,Pika视频生成中常见的负面提示词可以归为四类:人物解剖结构、画质伪影、场景杂物、运动与时间伪影。人物解剖结构主要针对手部、面部和肢体比例,常见词包括 deformed hands, extra fingers, fused fingers, missing fingers, bad anatomy, bad proportions, extra limbs, disconnected limbs, ugly face, gross proportions, mutation, long neck, cropped head。在写实人物场景里,手部经常是重灾区,因为手部在训练数据中的标注复杂度高,生成模型容易抓错模式。可以把这些词直接复制到负面提示词输入框。
deformed hands, extra fingers, fused fingers, missing fingers, bad anatomy, bad proportions, extra limbs, disconnected limbs, ugly face, gross proportions, mutation, long neck, cropped head
画质伪影包括模糊、低清、噪点、压缩块、过曝和色彩断层。这类词不要和结构类词混在一起写一大串,建议单独提出来,因为它们的模型梯度方向不同。画质伪影的常用负面词有 blurry, low quality, worst quality, pixelated, jpeg artifacts, compression artifacts, noise, grainy, overexposed, underexposed, color banding, faded colors。如果你生成的视频有明显的运动模糊或闪烁,可以再加上 motion blur, flickering, frame interpolation artifacts, temporal inconsistency。
blurry, low quality, worst quality, pixelated, jpeg artifacts, compression artifacts, noise, grainy, overexposed, underexposed, color banding, motion blur, flickering, temporal inconsistency
场景杂物类更依赖具体画面。生成城市街道时常见 random text, watermark, logo, signature, UI elements, subtitles, floating objects, clutter, broken objects;生成自然风景时可以写 power lines, fences, trash bins, people in background, cars。运动类伪影则针对视频特有的问题,例如 frame jumps, ghosting, smearing, warping, morphing, unstable background。把这几类分开书写,能避免负面提示词内部互相稀释。
三、权重与语法:让负面提示词更精准
权重调整是让负面提示词更精准的关键。Pika的提示词输入对短逗号分隔的短语响应较好,如果你需要强调某个排除项,可以把它放在负面提示词的最前面,或使用重复近义词来变相增加权重。部分版本也支持类似 (word:1.3) 的权重语法,但不同接口兼容性不一样,若遇到括号被当成普通字符的情况,优先使用顺序前置和近义补充。
deformed hands, extra fingers, fused fingers, missing fingers, bad anatomy, bad proportions, ugly face, gross proportions, mutation, low quality, worst quality, blurry, jpeg artifacts, watermark, logo, text
这里把结构类问题前置,画质和文字水印放在后面,既能优先约束手部,又保留对整体画质的过滤。如果发现某个问题反复出现,不要只堆形容词,可以尝试把负面提示词写成短语组合,比如 bad hand pose, interlaced hands, floating fingers, asymmetric eyes, extra pupils, distorted mouth, wrong teeth。这样描述更具体,模型对局部结构的约束会更强。还应注意负面提示词总长度不宜超过正向提示词的两倍,否则模型容易偏向过于保守,导致画面失去细节。
四、负面提示词失效的排查思路
有时你已经写了完整的负面提示词,但生成结果仍然有问题,这通常不是提示词无效,而是几个常见原因造成的。第一是正向提示词本身包含冲突信息。例如正向提示词里写 messy hair 或 surreal style,负面提示词里又写 messy, weird,模型会难以判断你到底想要哪种风格。解决方法是先检查正向提示词,把和目标冲突的形容词删掉,再调整负面提示词。
第二是负面提示词覆盖范围太大。像 bad quality, ugly 这类词太泛,模型可能把正常纹理也当成负面特征压制,导致人物皮肤像塑料、衣服细节丢失。更合理的做法是逐步缩小范围:先只保留结构类负面词生成一次,如果画质出了问题再加入 noisy, blurry, low contrast,而不是一次性把所有词都扔进去。
第三是视频时间维度的影响。视频生成不是单帧图像的简单堆叠,负面提示词还要考虑时间一致性。闪烁、物体突然出现或消失、边缘抖动,这些都是时间维度的伪影,单帧里看不出来。遇到这类问题,可以在负面提示词里增加 flickering, frame jumps, ghosting, warping, morphing, temporal inconsistency, frame interpolation artifacts,并适当降低运动幅度描述,避免模型为了维持一致性而把镜头完全锁死。