提示词设计的基本原则?从需求到指令的五步拆解
结论先行:提示词设计的关键不在措辞漂亮,而在把需求拆成机器能接住的五步——目标、输入、输出样、边界、验收。这五步来自我们小组2026年8月的一次内训,同一条需求前后两版指令,产出差距一眼就能看出来。你下一件事:挑一条最常跑的老指令,照五步重写一遍。
提示词设计这件事,多数人卡住的地方不是不会写,是根本没想清楚自己要什么。2026年8月14日下午,我们小组关起门做了一场内训,七个人人手一台笔记本,题目只有一个:把本周47条用户反馈整理成一页周报。先不教方法,每个人凭手感写一条指令,丢给模型跑。
结果挺难看的。七条指令里六条是「帮我把这些反馈整理成周报」的变体,模型每轮给的格式都不一样:有人拿到五类分类,有人拿到三段散文,还有人拿到一份自称完整版的表格描述。收上来逐条看,问题几乎出在同一处——指令里写的是动作,不是需求。
提示词设计的五步拆解:每一步在补什么漏洞
五步是目标、输入、输出样、边界、验收:说清成品给谁用、材料是什么、长什么样、哪些不能碰、怎么算合格。顺序别乱,前一步是后一步的地基,跳步的指令多半要返工。
第一步,目标。成品交给谁、被拿来干什么。内训时我先让大家补这一句,好几个人当场卡住——写了半年指令,头一回被问「这份周报给谁看」。同一条反馈,给产品组晨会用要分类计数,给客服主管看要挑能立刻改的痛点,目标一变,后面四步全跟着变。
第二步,输入。原始材料原样给到,别让模型猜。47条反馈整段粘进指令,标上1到47的编号。不粘材料就下单,模型只能靠编,回头你连验收都没法对。老实讲,这一步最没技术含量,但当天省掉它的人,全部在收尾时付了代价。
第三步,输出样。与其形容格式,不如直接给一小段样品。我现场造了三行假周报贴进指令:「每类一小节,标题是类别名,类内每行一条,格式是编号加竖线加一句话概括」。模型照着样品走,格式一次到位。给例子这件事有专门门道,怎么设计举例才能让AI按格式出活,可以看这篇举例提示词的设计方法。话说回来,样例三行就够,贴整页成品反而把模型框死在句式里。
第四步,边界。写明不能碰什么。当天最典型的一次翻车就出在这:有人的指令里写了「适当补充常见反馈」,模型热心地编了12条压根没人提过的功能建议,混在真反馈里,差点被当成真数据汇报上去。挺离谱的。边界就是给模型画圈:不改写用户原意、不新增内容、拿不准的归进「其他」并标编号。
第五步,验收。写清怎么算合格。我那条指令末尾写的是:随机抽5条编号能对回原文、小节不超过5个、全页不超过400字。这条被全场challenge得最狠,后面单独说。
不夸张地说,这五步没有一步是新鲜事。OpenAI 官方的提示词工程指南里,「提供参考示例」「指定输出长度」本来就是单列的策略,我们做的只是把它们跟中文工作场景缝在一起,变成顺手就能走的检查单。
同一需求,培训前后两版指令差在哪
培训前的指令只有动作没有需求,模型每轮重新猜;培训后把五步补齐,一轮基本到位,只剩小改。下面贴的是同一位同事、同一个需求的两次原文,一次在培训当天,一次在培训后的第一个工作日。
培训前,2026年8月14日现场收的原文:
帮我把这些用户反馈整理一下,写成周报,要简洁一点,重点突出。
培训后,8月17日周一早上重写的原文:
目标:把本周47条用户反馈整理成一页周报,给产品组周一晨会用。 输入:下方粘贴的47条原始反馈,已按顺序编号1-47,除编号外不做任何改动。 输出样:小节不超过5个,标题为问题类别;节内按提及次数从多到少排;每条一行,格式「编号|一句话概括」,概括不超过20字。 边界:不改变用户原意,不新增任何反馈,不出现用户昵称和联系方式;拿不准归类的放进「其他」并标编号。 验收:随机抽5条编号能对回原文;小节不超过5个;全文不超过400字。
差别不用我多讲,摆个直观的账:
| 版本 | 指令长度 | 来回改的轮数 | 主观评价 |
|---|---|---|---|
| 培训前 | 29字 | 5轮 | 像猜谜,模型每轮猜的方向都不一样,越改越乱 |
| 培训后 | 约200字 | 1轮 | 前期多花十分钟,省下后面近两小时;代价是动笔前得先想 |
小陈自己算过一笔账:培训前那次,他从下午两点折腾到四点,改了5轮还是不满意,最后手动改了半页才敢交;8月17日早上重写,10分钟写指令,一轮出稿,小改两处就完事。指令变长不是负担,多出来的每个字都在替你省后面的轮次。
被challenge最多的验收步:写指令还要验收,是不是形式主义
验收不是写给模型看的,是写给下指令的人自己的:写不出验收标准,多半说明需求没想清楚。测试组的老周当场拍过桌子,最后的答案他自己也认了。
老周的原话是:「让AI写个周报还要配验收标准,这不是把简单事搞复杂吗。」真不是。我把问题抛回去:这条指令的合格线是什么?他愣了几秒,答了句「整理得清楚点就行」。问题就在这——「清楚点」没法验收,模型交什么他都只能凭感觉挑毛病,所以改了5轮还是不满意。验收标准写得出来,说明目标真想清楚了;写不出来,指令多半还在糊涂账里。那天下午七个人,五个人的验收栏交了白卷,这个数字比任何道理都直白。
验收还有个副产品:它是复用的锚点。指令跑通一次之后,下周换一批新反馈,把输入段换掉就行,目标、边界、验收原样留着。写验收就是在给自己省第二遍工夫。
回到8月14日下午那间会议室。散场前小陈把培训前那条29字的指令又读了一遍,说了句「这不就是我平时说话的方式嘛」。提示词设计说到底就是一次把话说完整的练习:目标、输入、输出样、边界、验收,五步补齐,模型不用猜,你也不用改到天黑。挑一条你跑得最勤的老指令,今天重写一遍。
常见问题
五步每次都要写满吗?
不用。一句话能说清的小事,目标加输出样两步就够,比如「把这段话翻成英文,保持口语感」。五步的完整形态是留给复杂需求的:材料多、格式严、要交差。判断标准很简单,模型第一次输出你敢直接用,步骤就够用了。
输出样会不会把模型带偏,只会照抄不会变通?
会有一点,样例越具体,模型贴得越紧。我的做法是样例只给结构不给内容:格式、顺序、长度写死,具体词句让它自己填。要是产出的内容方向不对,该改的是目标那句,不是删样例。
这套五步法和角色设定、思维链这类技巧冲突吗?
不冲突,多数技巧挂在五步的骨架上用更稳:角色设定服务于边界和语气,思维链服务于验收里「过程要看得见」这一条。先有骨架再挂技巧,比反过来省事。
验收标准写到多细比较合适?
细到换个同事也能判卷的程度。「随机抽5条编号能对回原文」是可执行的,「内容准确」不可执行。每写一条就问自己:别人照这条,能不能判出合格还是不合格。
延伸阅读
想先练「落笔前想清楚」,这篇写提示词前的五问法跟五步拆解正好是前后脚,一个管想,一个管写。
主要用对话模型干活的话,chatgpt提示词三件套那篇把指令的基本结构拆得更细,可以搭配着看。