人物提示词怎么写?外貌、动作和神态的配比

人物提示词怎么写?外貌、动作和神态的配比
人物提示词配比实测:外貌、动作与神态的字数分配方法

先把答案摆在前面:人物提示词按外貌3、动作4、神态3的字数比例去配,成图最稳。外貌写成从头到脚的清单是崩坏重灾区,先把外貌砍到3个特征词,再把省下的字数让给动作和神态。

人物提示词最难的不是词藻,是配比。同一张脸,外貌写30字和写120字,出图质量能差出一倍,这事我拿12组指令实打实测过。

很多人写人物,习惯把外貌从头到脚铺一遍:发色、瞳色、脸型、身材、外套、鞋跟,一路列下去。写完一看,动作和神态只剩几个词的位置。结果呢,脸是好看的脸,人是不会动的人,像商场门口的雕像。这篇文章只讲两件事:三块内容怎么分字数,神态词哪些能用哪些要躲。

人物提示词里外貌写太细,图反而崩

外貌只留3到5个特征词就够,细节写满全身,崩坏率直接翻倍。模型把每个词都当权重,外貌词越密,脸和手的可控性越差。这不是玄学,是我一组一组跑出来的结论。

2026年3月,我给一组杂志插画风格的人物图做测试。同一底模、同一组种子,A组外貌只写30字(发型、一件外套、一个配色),B组外貌写到120字,从发梢的卷度写到鞋跟的高度,各出10张。结果摆在面前:B组7张手指数量不对、2张五官位移,能用的一张没有;A组只有1张手部小瑕疵,出图即用。

挺离谱的。当时我不死心,又把B组的词拆一半回去重跑,崩坏立刻降下来。原因说穿了不值钱:提示词里的字数就是权重,你花120字刻画一双手套,模型就得在别处还债,还的往往是最贵的脸和手。

外貌到底留什么?我的取舍是留「可识别特征」:一个发型、一件有记忆点的服装、一个配色。瞳色、身材比例这类词,模型有自己的默认审美,写了反而添乱。至于崩坏点的逐项排除,我把人像常见的翻车项整理在人物反向提示词的排除清单里,配着本篇的配比一起用,效果翻倍。

外貌、动作、神态按几比几配?我跑了四组对照

总字数固定时,外貌3、动作4、神态3的组合最稳,实测10张能成8张;外貌占一半以上的组合,人物姿态全都发僵。配比比总字数更能决定成图质量。

2026年8月,我把总字数锁死在100字左右,只改三块的字数分配,每组固定种子跑10张,得出下面这张表。坦白讲,跑之前我以为外貌占比高一点更精致,数据直接打了脸。

配比(外貌:动作:神态)可用张数(每组10张)我的评价
5:2:34脸是漂亮,人像雕塑,动作僵得像摆拍
3:4:38最省心的一组,动作把整个人带活了
2:5:36动感足,脸开始随机,只适合远景
3:3:45神态过浓,惊悚感冒头,慎用

规律很清楚:动作是三块里的发动机。外貌只负责让人认得出,神态负责给情绪定调,中间那口气得靠动作提。神态压到4以上,模型会过度解读情绪词,脸就开始往诡异的方向使劲。

神态词清单:哪些稳,哪些容易画出惊悚感

微笑、闭眼、若有所思这类词出图稳定;狞笑、咧嘴大笑、媚眼一类容易把脸画歪,能用动作替代的神态,就别直接写。惊悚感的来源基本是牙齿和眼形。

稳定档:微笑、闭眼、若有所思、侧头、低头看东西、平静地看向镜头。这些词和五官结构绑得松,模型自由度大,不容易把脸挤变形。我跑了几百张,它们几乎没让我收拾过残局。

惊悚档:狞笑、狂喜、咧嘴大笑、眯眼笑、媚眼如丝、单独一个「嘴角上扬」。嘴咧得越大,牙越容易画错;眼一眯,两只眼常常不对称。我试了下把「咧嘴大笑」换回「大笑」再补一句「手拍着桌子」,牙齿崩坏的次数肉眼可见地少了。说实话,情绪这东西,交给动作去演,比直接喂形容词靠谱。

话说回来,我一度迷上收集神态词,攒了小一百个,后来发现常用的就那十来个。五官词本身的取舍顺序,我在这篇ai脸部提示词的五官优先级里单独写过,两篇对着看正好补全。

两条能直接抄的成稿指令

指令一写实人像,指令二走插画感。方括号里的词换成你的需求,槽位顺序别动,顺序本身就是配比的骨架。抄完先跑一张看脸,再微调。

指令一(写实人像):[年龄性别] + [两三个外貌特征词] + [一个核心动作] + [一个神态词] + 环境 + 光线 + 镜头。例:28岁女性,齐肩黑发、米色风衣,快步穿过斑马线时回头,脸上带一点没收住的笑,傍晚的十字路口,暖色逆光,85mm。

指令二(插画感):[画风] + [角色身份] + [一到两个外貌词] + [动作] + [神态] + 色调。例:扁平插画,咖啡馆店员,马尾、白围裙,单手压着磨豆机,目光落在刻度线上,暖棕色调。

不夸张地说,这两条模板里动作和神态加起来的字数,是刻意压过外貌的。这就是3:4:3落到纸面的样子,你照着填,配比就不会跑偏。

回到开篇那个场景:下次写人物提示词,别再从头发写到鞋跟。把外貌压到三个词,想清楚这个人正在做什么、脸上是什么表情,按外貌3、动作4、神态3把字数填进去,人物图的可控性立刻不一样。配比这件事,比多加十个形容词都管用。

常见问题

人物提示词里动作写几个合适?

一个核心动作加一个辅助小动作,上限就到这。两个以上动作同时写,模型会让人物同时做两件事,肢体经常拧着长。

神态词放在句子的哪个位置?

紧跟在动作后面。放句首容易被当成画面主体放大,五官占比会异常;放句尾又会被环境词稀释,情绪出不来。

外貌词用中文写还是英文写出图更好?

同一配比下差别不大,关键还是三块的字数分配。英文高频词响应更直接,中文长句容易夹带多余修饰,写之前先做减法。

配比调好了,还要配负面提示词吗?

要。配比管的是别把模型带偏,负面词管的是兜底。人像常见的多指、牙齿错位、双眼不对称,照例挂上负面清单再跑,双保险。