当你让大模型完成一份竞品分析报告、一段数据处理脚本或一个多轮推理决策时,如果只用一句话描述需求,得到的答案经常要么遗漏关键环节,要么逻辑跳跃、结论站不住脚。原因不复杂:模型在一次生成中要同时完成理解、规划、推理和表达,任何一环出错都会传导到最终结果。把任务显式拆解成多个步骤,让模型按顺序执行并在每一步输出中间结果,是目前性价比最高的提示词优化手段之一。本文围绕复杂任务的分步骤提示词写法展开,从原理到模板给出完整方案。

为什么分步骤提示能显著提升模型表现
大模型本质上是逐个token进行生成的,它在生成下一段文字时只能参考前面已经产生的内容。如果让模型一步到位回答一个需要五层推理的问题,它在写下第一层结论时,其实还没有对后四层进行任何显式思考,出错概率自然高。分步骤提示的作用,就是把原本隐式发生在模型内部的推理过程,强制转化为显式的文字输出,后一步可以明确依赖前一步的结论,相当于给模型铺设了一条推理轨道。
这类技巧在学术上称为思维链提示。早期研究者在测试数学应用题时发现,仅在提示词中附加一句“请一步步思考并展示推理过程”,准确率就有明显提升。其核心机制是:中间步骤的token生成扩大了模型的“思考空间”,每写一步相当于多了一次前向计算的机会,复杂计算和逻辑判断不再被压缩在同一个输出里。
除了提升准确性,分步骤执行还带来两个工程上的好处。一是可观测性,你能清楚看到模型在哪一步走偏,定位问题比面对一段含糊的最终答案容易得多。二是可控性,可以在提示词中规定每一步的输出格式和长度,避免模型把力气浪费在无关内容上。这两个特性在构建生产级应用时甚至比准确率本身更重要。
四类常用写法与提示词模板
写法一:显式步骤编号拆解
最直接的方式是在提示词中把任务拆成编号步骤,要求模型严格按顺序执行。适用于流程明确的任务,比如报告撰写、方案评审、数据处理。示例模板如下:
你是一名资深数据分析师。请严格按以下步骤完成任务:
步骤1:阅读用户提供的数据描述,列出所有字段及其业务含义;
步骤2:识别数据质量问题(缺失值、异常值、重复记录),逐项说明判断依据;
步骤3:给出清洗方案,每个问题对应一条处理规则;
步骤4:输出清洗后的字段清单和建议的后续分析方向。
要求:每完成一步先输出该步骤的结论,标注步骤编号,再进入下一步。
不要跳步,不要合并步骤。
用户数据描述:{在此粘贴数据描述}这个模板的关键在于最后一句约束。如果不强调“不要跳步、不要合并”,模型经常为了显得简洁把多步压成一段,中间推理过程就丢失了。实践中还可以加上“每步不超过150字”之类的长度限制,防止某个步骤无限膨胀。
写法二:思维链开放式引导
当你自己也不确定最优流程时,可以让模型先自行规划步骤再执行。这种方式给模型更大的自由度,适合探索性任务:
任务:分析以下产品评论,判断用户流失风险等级(高/中/低)。
请按这样的顺序工作:
1. 先制定一个分析计划,说明你需要从哪些维度判断流失风险;
2. 按你的计划逐条分析这条评论;
3. 基于分析给出风险等级和两条改进建议。
评论内容:{评论}注意第一步的价值:让模型先输出计划再执行,相当于一次自我对齐。你可以检查它的计划是否合理,不合理时及时调整提示词,而不必等到最终答案错误才发现方向偏了。在批量处理场景中,这个“先规划后执行”的结构尤其值得保留。
写法三:角色设定加阶段划分
对综合性强的大任务,可以给模型分配多个角色身份,每个角色负责一个阶段,形成流水线式的执行结构:
你需要依次扮演三个角色完成一份技术选型报告: 第一阶段(架构师):根据需求列出候选技术方案,每个方案说明核心组件; 第二阶段(评审专家):从性能、成本、社区生态、团队学习曲线四个角度 逐项评估每个方案,输出对比表格; 第三阶段(技术负责人):基于评估结论做最终决策, 说明取舍理由和落地风险。 需求:为日活10万的电商App选择消息推送方案。
角色切换能激活模型在不同知识子空间的能力,评审阶段的输出质量往往明显优于让单一身份一口气写完整份报告。这种写法的另一个优势是天然适合多轮对话:每一阶段单独一轮,你可以在中间插入修正意见。
写法四:带验证回环的执行结构
要求模型在最后一步自查前面所有步骤,是提升可靠性的低成本手段:
请按步骤执行: 1. 列出问题涉及的所有约束条件; 2. 逐一检查你的方案是否满足每条约束; 3. 输出最终答案; 4. 回头审视:如果步骤2中存在未被满足的约束,修改答案并说明改动原因。
这个回环结构在代码生成、数学计算类任务上效果突出。模型在自查时相当于做了一次独立的第二轮推理,很多第一轮的疏漏会在这一步被自己发现并修正。
拆分粒度与常见误区
步骤数量并非越多越好。经验上,单条提示词中的步骤控制在3到7步之间效果最稳。步骤太少起不到拆解作用,太多则有两个风险:一是模型可能忘记后面的步骤要求,注意力被前面的步骤稀释;二是任何一步出错,后续全部建立在错误结论上,链路越长错误传导越严重。对于确实需要十几个环节的任务,更好的做法是拆成多轮对话,每轮完成两三个步骤,确认无误后再继续。
第二个常见误区是步骤之间缺乏依赖关系的设计。拆步骤的意义在于让前一步的输出成为后一步的输入,如果各步骤彼此独立,那只是把一个大问题切成几个小问题,模型并不会因此推理得更深入。写提示词时要显式写出这种依赖,比如“步骤2必须基于步骤1列出的字段展开分析,不得引入步骤1未提及的字段”。
第三个误区是忽略输出格式约束。分步骤执行往往产生大量中间内容,如果不规定结构,最终输出会非常冗长且难以二次利用。建议在每个步骤的描述里直接写明输出形式,例如“以无序列表输出”“以三列表格输出”“每条不超过两句话”。在工程化场景中,还可以要求中间步骤用特定标记包裹,方便程序解析提取,例如要求模型把最终答案放在“【最终答案】”标记之后。
最后提醒一点:分步骤提示会增加输出token数量,意味着更高的调用成本和更长的响应时间。对简单任务不必强行套用这套结构,判断标准很简单,如果任务的完成需要两次以上的推理跳转,就值得拆步骤;如果一问一答就能解决,直接提问反而更高效。
可复用的通用模板
把上面的技巧整合起来,可以得到一个通用性较强的任务执行模板,覆盖角色、背景、步骤、约束、验证五个要素:
# 角色
你是一名{专业领域}专家。
# 任务背景
{描述任务背景、使用场景、目标受众}
# 执行步骤
1. 复述并确认你对任务的理解,列出关键约束;
2. {核心工作步骤A};
3. {核心工作步骤B,要求基于步骤2的结论};
4. 汇总前面各步结论,输出最终成果,格式为{指定格式};
5. 自查:逐条核对是否遗漏要求,如有遗漏先补充再交付。
# 约束
- 每步先标注步骤编号,再输出内容;
- 中间步骤可以展开,最终成果控制在{字数}以内;
- 遇到信息不足的情况,先列出缺失项并给出合理假设,不要凭空编造。
# 输入材料
{粘贴具体材料}这个模板的第一个步骤——复述任务理解——看起来多余,实际价值很大。模型复述的过程等于把你的需求重新编码一遍,如果理解有偏差,你在第一步就能发现并纠正,成本远低于拿到错误结果后返工。而“列出缺失项并给出假设”这条约束能有效抑制模型编造细节的倾向,在资料不全的真实场景中尤其重要。
总结来说,分步骤提示词的本质是把项目管理中的任务分解思想应用到人机协作中:明确阶段、定义依赖、规定交付物、加入验收环节。掌握这个思路后,你可以针对自己的具体业务场景灵活裁剪模板,不必拘泥于某一种固定写法。建议从本文的通用模板起步,跑通几个真实任务后,再根据模型的实际表现逐步微调步骤划分和约束条件,形成一套属于自己业务的最优提示词结构。