第一人称视角(POV,Point of View)是AI视频生成中最容易出彩、也最容易翻车的镜头类型。写得好,画面会带有强烈的代入感,观众仿佛亲临现场;写得含糊,模型要么生成第三人称旁观画面,要么镜头乱晃毫无逻辑。提示词的核心在于让模型明白两件事:镜头是谁的眼睛,以及这双眼睛正在做什么。本文围绕运动描述和沉浸感构建两大主线,拆解第一人称视角提示词的写法。

一、第一人称视角的基础表达:让模型理解镜头即眼睛
写第一人称提示词的第一步,是明确告诉模型这是一双眼睛看到的画面,而不是摄像机拍摄的客观画面。最直接的关键词是POV shot、first-person view、first-person perspective。英文提示词体系中POV是最通用的表达,几乎所有主流AI视频模型都能识别。中文提示词可以直接写第一人称视角、主观镜头。
仅写POV还不够,需要补充视角主人的身份信息,因为不同身份的第一人称画面差异巨大。例如同样是奔跑,士兵的POV会有战术动作和装备晃动,孩子的POV则视线偏低、动作轻快。示例如下:
POV shot, first-person view of a hiker walking through a misty forest, arms occasionally visible in the lower frame, camera bobbing with footsteps, soft morning light filtering through trees, shallow depth of field
这个例子包含了四个关键要素:POV声明、场景描述、身体部位入画提示、镜头运动节奏。其中arms occasionally visible in the lower frame这类手部入画的描述非常重要,它是强化第一人称感知的强信号。如果完全不提及身体部位,模型有很大概率生成类似无人机航拍的空镜头,代入感会大打折扣。
二、运动状态描述:不同动作对应不同的镜头语言
第一人称视频的核心是运动,而不同运动状态对应的镜头表现完全不同,提示词必须精确匹配。以下是几类常见运动状态的描述要点。
1. 步行类。步行是最基础的运动,关键词包括walking pace、steady gait、camera bobbing with each step。真实的第一人称步行画面会有明显的节律性上下起伏,如果提示词只写walking而不写bobbing,模型往往生成滑行般的平滑画面,反而显得虚假。适当加入slight camera shake能显著提升真实感。
2. 奔跑类。奔跑时画面晃动剧烈,视野边缘模糊,关键词有running, heavy camera shake, motion blur at frame edges, rapid head movement。同时可以描述呼吸带来的影响,如breathing heavily, visible exhalation in cold air,这是构建沉浸感的高级技巧。
3. 飞行与滑翔类。这类运动常见于梦境或科幻场景,关键词包括gliding forward、smooth floating motion、wind rushing past、hands stretched forward like Superman。飞行画面的要点是平滑与速度感并存,可以加上volumetric clouds passing by来强化空间位移。
4. 载具类。骑行、驾驶、划船等场景,需要描述手部与操控物的互动,如hands gripping the steering wheel、handlebar visible in lower frame、engine vibration shaking the view。载具类第一人称的优势是有天然的前景参照物,模型更容易锚定视角。
下面是一个驾驶场景的完整提示词:
First-person POV driving on a mountain road at dusk, hands on steering wheel visible at the bottom of frame, dashboard gauges glowing softly, windshield reflecting warm sunset, road curving ahead, slight camera vibration from engine, mountain scenery moving past the side windows
三、沉浸感构建关键词库:从视觉到生理感受
沉浸感的本质是让观众相信自己就在画面里,这需要调动多重感官暗示。可以将沉浸感关键词分为三个层次来使用。
视觉层:shallow depth of field(浅景深模拟人眼聚焦)、peripheral vision blur(视野边缘模糊)、eye-level perspective(视线高度)、natural blink moments(罕见但部分模型支持)。其中浅景深是最有效的单一关键词,它让画面从录像感变成眼睛看到的感觉。
运动层:head turning to look around(转头环顾)、looking down at feet(低头看脚下)、camera tilting up to the sky(抬头看天)。这些头部动作描述能打破单一方向的机械运动,让镜头像活人一样观察环境。
生理层:这是最高级的层次,包括heavy breathing sound implied、heartbeat rhythm、sweat dripping from forehead into view、arms pumping visibly while running。生理暗示会让模型在画面节奏上模拟出呼吸和心跳的起伏,即使模型不能直接生成声音,这种描述也会影响画面的节奏感。
一个综合运用三层关键词的探险场景提示词:
POV first-person exploring an abandoned warehouse, flashlight beam held in right hand visible at frame edge, shallow depth of field, dust particles floating in the light beam, head turning slowly to survey the room, footsteps echoing implied by cautious slow pace, breathing audibly nervous, dim industrial interior with broken windows
四、常见错误与不同模型的适配差异
写第一人称提示词时最常见的错误有三类。第一类是视角声明缺失,只描述场景不写POV,结果生成了客观镜头。第二类是运动描述冲突,比如同时写slow steady movement和fast running,模型会无所适从,画面出现诡异的速度跳变。第三类是身体部位描述过度,例如详细描写主角的全身外观,这会诱导模型切换到第三人称展示人物,破坏视角一致性。正确做法是只描写入画的局部,如双手、小臂、脚下。
不同AI视频模型对第一人称描述的敏感度也有差异。物理一致性较强的模型适合包含复杂手部互动的提示词,比如攀爬、驾驶;偏重画面美感的模型则对motion blur、shallow depth of field这类视觉关键词响应更好。建议的做法是保留一套核心POV提示词模板,针对所用模型微调侧重点:写实模型加强运动细节,风格化模型加强氛围与景深描述。
最后提供一个可复用的通用模板结构:POV声明加身份场景,加运动状态与镜头节奏,加身体部位入画,加环境细节,加沉浸感关键词。按这个顺序填空,基本可以稳定产出合格的第一人称画面,再根据生成结果逐项微调,就能得到代入感极强的AI视频片段。