ai图生视频提示词怎么写?让首图动起来的指令写法
我的答案:ai图生视频提示词别贪多,一句话写主体怎么动,一句话写镜头怎么动,剩下的全删掉,首图反而动得最稳。这是我拿一张自己的人脸照片和一张保温杯产品图当首图,两个晚上六十三次生成换来的结论。先照这个公式改你的指令,再对照下面的翻车表排错。
ai图生视频提示词这件事,说实话我以前一直写反了。总以为写得越细,画面越听话,结果把光线、情绪、风格、氛围全塞进一行字里,生成出来的视频人脸像隔着果冻在漂,五秒钟能崩三次。挺离谱的。
2026年8月底的一个晚上,我不服气,把自己一张正面人脸照和一张保温杯产品图分别拖进图生视频工具当首图,第一晚跑了三十次,第二晚跑了三十三次,一共六十三次,每次都留着原始指令和生成时长。结论比我想的简单得多:指令越短,画面越稳。下面按翻车、写法、公式三步讲清楚。
三种典型翻车:人脸漂移、手指融化、背景乱晃各对应什么写法
人脸漂移来自情绪形容词,手指融化来自手部特写加复杂动作,背景乱晃来自镜头词堆太多,三种崩法都能对应到具体的指令写法。不是玄学,是六十三次实测里反复出现的规律。
先说人脸漂移。只要我在指令里写「微笑着轻轻眨眼,眼神温柔而坚定」这类带情绪的句子,脸部微表情就会失控,嘴角偶尔抽到耳根。删掉情绪词,只留「眨眼,头部微微右转」,脸立刻稳了大半,具体数据放在下一节的对照实验里。
手指融化更好定位。我让产品图里的手握住保温杯并缓缓拧开盖子,五秒视频里手指有两帧黏在一起,像融化的蜡。手部特写加复合动作,基本必崩;换成「手指保持不动,只有杯盖顺时针旋转」,崩的概率立刻降下来。
背景乱晃最冤,因为它根本不是主体的问题。有一次我写了「镜头缓慢推进,同时微微环绕,光线逐渐变暖」,画面里的桌面全程在波纹状扭动。三个镜头词叠在一起,模型谁都想照顾,结果谁都不敢动到位。
| 指令写法 | 实测结果(共63次) | 我的评价 |
|---|---|---|
| 情绪形容词+复合动作 | 人脸漂移,10次崩7次 | 最该戒掉的写法 |
| 手部特写+拧、握等复合动作 | 手指融化,5次崩4次 | 能避开就避开 |
| 三个及以上镜头词叠加 | 背景乱晃,6次崩5次 | 纯粹自找的 |
| 主体一句话+运镜一句话 | 22次里18次能直接用 | 值得当成默认写法 |
ai图生视频提示词怎么写:主体动作和镜头运动要分成两句话
把「主体怎么动」和「镜头怎么动」拆成两个独立短句,中间用句号隔开,模型对主体的控制力立刻变强。混在一句里写,模型会自己猜权重,猜错就崩。
我做过一组对照。同一张人脸照片,同一个工具,同样生成5秒:写「镜头缓慢推进她轻轻眨眼头部微转」这种一逗到底的,20次里能看的只有9次;改成「她轻轻眨眼,头部微微右转。镜头缓慢推进。」两句分开,同样条件跑了22次,18次能直接用。差距就是这么大。
老实讲,拆开写还有个隐藏好处:崩了你知道改哪句。人脸崩就删主体句里的形容词,背景崩就砍运镜句,只留一个镜头词。混写的指令崩了只能整条推翻,那一个晚上我推翻过十一条。
运镜句一次只留一个词,这是我用产品图试出来的。缓慢推进、环绕、拉远、固定机位,四个词单用都稳,任意两个组合成功率就往下掉,三个组合必出背景扭动。图生视频模型的镜头控制远没到那个自由度,别高估它。
我留下的极简公式:主体动作一句话+运镜一句话,别的都别写
公式就两句:第一句写主体做什么动作,第二句写镜头怎么动,其余的形容词、氛围、风格全部删掉。生成时长选5秒,成功率比10秒高一截。
模板直接给:主体+一个简单动作。镜头+一个运动方式。套到人脸照片上就是「她轻轻眨眼,头部微微右转。镜头缓慢推进。」套到保温杯上就是「杯盖缓缓升起悬浮。镜头固定不动。」这两条都是一次生成直接过。
时长我统一用5秒。同样的指令拉到10秒,后5秒崩的概率肉眼可见地涨,人脸漂移几乎都发生在第6秒之后。真不差那几秒。
话说回来,别把这套公式当成铁律封死。想加一句风格词试试完全可以,我试过加「胶片质感」,十次里有三次不算成功但也没崩,属于可接受范围。我的建议是先用裸公式跑两次,稳了再一次加一个变量,一次只加一个。
回到我那两张图。人脸照片最终那条能用的视频,指令只有十四个字;保温杯那条十二个字,两条都是一次生成直接过。ai图生视频提示词写到这里已经不需要技巧了,需要的是克制:少写一半的字,多留一半的稳定。你下次让首图动起来之前,先把指令里除主体动作和镜头运动以外的东西删干净,再点生成。
常见问题
提示词写中文还是英文,差别大吗?
我两种都试过,同一张图各跑五次,可用率没有拉开明显差距。工具对中文短句的理解已经够用,与其纠结语言,不如把句子砍短。带从句的长英文反而比短中文更容易崩。
首图本身模糊或者侧脸,还有救吗?
提示词救不了底子差的首图。我试过一张夜景糊脸照,指令写得再克制,人脸照样漂。先把首图换成清晰正面图,这一步比改指令有用得多。
生成出来几乎看不出在动,怎么调?
把主体句里的幅度词加半档:轻轻眨眼改成眨眼,微微右转改成向右转头。只动主体句,不动运镜句,一次调一处,调完重跑两三次看稳定度。
想让人物动加镜头动,能写三个短句吗?
不建议。实测三句以上模型又开始猜权重,背景乱晃的次数明显变多。真有需求,把两个动作合并进主体句,比如「眨眼并举起右手」,运镜句保持一个,比拆三句稳。
延伸阅读
想让文字直接生成视频,先看这篇 AI文生视频提示词三个关键项,里面拆的主体、动作、镜头框架和我这篇是同一套思路。
手头有现成视频想提取指令风格的,可以试试 视频反推提示词的做法,拿成片反推写法再改造成自己的。