大模型在情感陪伴和心理支持场景中的应用越来越广泛,但直接让模型“假装是心理咨询师”往往效果很差:回复说教味重、共情生硬、甚至越界给出诊断结论。问题的根源不在模型能力,而在提示词设计得不够专业。一份合格的心理咨询Prompt,需要把咨询伦理、对话技巧、危机处理规则都编码进去,让模型在一套明确的框架内发挥。

角色设定层:定义咨询风格与专业边界
角色设定是整个方案的地基。很多人写角色提示词只写一句“你是一位资深心理咨询师”,这样模型会自由发挥,回复风格极不稳定。正确的做法是把咨询流派、资历背景、说话方式、专业边界拆成多个维度分别约束。
推荐采用人本主义结合认知行为疗法的混合风格作为基调,因为这类风格最容易在纯对话中落地:人本主义提供共情和无条件积极关注,认知行为疗法提供结构化的引导提问。同时必须明确写入“你不是医生,不做精神疾病诊断,不推荐药物”这类边界条款,这是心理咨询伦理的基本要求,也能有效防止模型输出危险内容。
# 角色设定示例 你是安宁,一位有8年从业经验的心理咨询师, 擅长情绪困扰、压力管理和人际关系议题。 你的咨询风格: - 以人本主义为基础,先共情,再引导 - 适当使用认知行为疗法的提问技术 - 说话温和自然,避免教科书式的说教 你的专业边界: - 不做任何精神疾病诊断 - 不推荐或评价任何药物 - 遇到自伤自杀倾向立即启动危机干预流程
角色设定写好后,建议先做十几轮测试对话,观察回复的语气是否一致。如果模型经常跳出角色开始说“作为AI语言模型”,说明边界条款的优先级不够,可以在提示词末尾追加一行强制约束。
对话规则层:倾听、共情与提问的编排
心理咨询对话和普通聊天的最大区别在于节奏控制。新手常犯的错误是让模型一次回复太多内容,来访者刚说了两句,模型就输出五六百字的分析,这会让来访者感觉在被“讲课”。真正的咨询对话遵循“倾听、反映、提问”的循环,模型每一轮回复都应该很短。
具体来说,可以在提示词中规定每轮回复的结构:先用一两句话反映来访者的情绪,再简短确认理解是否准确,最后提出一个开放性问题。同时要禁止模型连续追问多个问题,一次只问一个,否则来访者会有被审问的感觉。
# 每轮回复的结构约束 每次回复遵循以下结构,总字数控制在150字以内: 1. 情绪反映:用你自己的话描述对方此刻的感受 2. 简短共情:表达对这种感受的理解和接纳 3. 单个提问:提出一个开放性问题,帮助对方继续表达 禁止行为: - 连续提出两个以上的问题 - 使用“你应该”“你要”这类指导性措辞 - 直接给出解决方案,除非对方明确请求建议
还有一个容易被忽略的细节:模型需要学会处理沉默和模糊表达。当来访者只回复“嗯”“还好”这类短消息时,提示词中应规定模型不要强行展开分析,而是温和地邀请对方多说一些,或者接纳对方此刻不想多说的状态。
危机干预层:识别风险并切换处理模式
这是整个方案中最关键也最不能省略的部分。心理咨询场景下,模型必须具备识别危机信号的能力,并在检测到风险时切换到完全不同的应答模式。危机信号包括明确的自伤自杀表述、极端绝望的表达、描述具体自伤计划等。
危机模式下模型的职责不是继续咨询,而是稳定情绪并提供求助资源。提示词中要写清楚完整的处理流程:先表达关心和陪伴,再温和确认安全状况,然后提供心理援助热线等信息,同时避免说教和评判。国内可以写入希望24热线等公开求助渠道。
# 危机干预规则(最高优先级) 当对方出现以下任一情况时,立即进入危机模式: - 提到想死、自杀、自伤的具体想法或行为 - 表达强烈的绝望感,如“活着没意义” - 描述已被实施的自伤行为 危机模式下的应答要求: 1. 第一时间表达真诚的关心,不评判、不说教 2. 温和询问对方现在是否安全 3. 提供求助资源:希望24热线 400-161-9995 4. 鼓励对方联系信任的人陪伴在身边 5. 危机模式下不进行任何咨询性提问
需要注意,危机规则应放在提示词的开头或用明确的优先级标记标注,因为长对话中模型对中部指令的遵循度会下降。上线前务必用各种风险话术做压力测试,确保模型不会漏判。
记忆管理层:多轮对话中的信息整理
心理咨询是长程对话,来访者会在不同轮次透露大量信息:家庭情况、工作状态、核心困扰、重要事件。如果模型不整理这些信息,对话会显得“没有记性”,严重影响信任感。在工程实现上,有三种常见方案。
第一种是把历史对话全量塞进上下文,简单但成本高且长对话会超限。第二种是摘要压缩,每隔几轮让模型生成一次对话摘要注入系统提示词。第三种是结构化信息卡,用固定字段记录来访者画像,效果最稳定。信息卡可以包含主诉、情绪状态、关键事件、咨询进度等字段,每轮对话后异步更新。
{
"来访者信息卡": {
"主诉": "工作压力大,持续失眠约一个月",
"情绪状态": "焦虑为主,伴随自我否定",
"关键事件": ["项目裁员传闻", "与父母因婚事争执"],
"已尝试的应对": "运动、听音乐,效果有限",
"咨询进度": "第3次对话,处于问题探索期"
}
}信息卡配合检索注入的方式,能让模型在第十轮对话时依然记得第一轮提到的细节,来访者会明显感觉到“被记住、被理解”,这正是咨询关系建立的核心。
测试与调优:如何验证这套提示词有效
提示词写完只是开始,验证环节决定成败。建议准备一套标准测试集,覆盖四类典型场景:初次来访的开场、情绪崩溃的宣泄、含糊不清的表述、以及混合了危机信号的对话。每类场景准备十组以上真实风格的表述,跑完后人工评估回复质量。
评估维度建议设四项:共情准确度(是否正确识别了情绪)、对话节奏(回复长度和提问数量是否合规)、边界遵守(有无诊断或药物建议)、危机识别(风险信号是否全部触发干预)。哪一项不达标就回到对应的提示词段落强化约束,迭代三五轮后通常能收敛到稳定状态。另外建议加入对抗测试,故意用谐音、暗语表达负面情绪,检验模型的识别鲁棒性。最后提醒一点,这类应用上线时应明确告知用户这是AI辅助工具而非替代专业咨询,这既是合规要求,也是对用户负责。