拍视频提示词怎么写?用AI生成分镜和口播稿
开门见山:拍视频提示词的核心不在一句万能咒语,而在拆成三条指令——分镜表、口播稿、道具清单各来一条,让AI在开拍前把拍不了的镜头提前筛掉。三条指令都有固定槽位,照抄就能用。先从背景说明写起。
拍视频提示词的价值不在辞藻,在开拍前。2026年8月16日我去一家新开的面馆拍探店短视频,全片58秒,前期用AI把分镜、口播、道具三样东西全部过了一遍,现场拍摄加吃饭只用了两小时十分钟。片子发出去之后我更确定一件事:AI最大的用处不是替你拍,是替你把「到了现场才发现拍不了」的镜头提前筛掉。
把拍视频提示词理解成「给AI生视频工具写的那段描述」,是常见的误会。这篇讲的是实拍前的用法:让对话式AI产出分镜表、口播稿、道具清单三份稿子,你打印出来带去现场。我试下来,废片率掉得很快——之前拍探店十条废六条,这套流程跑顺之后基本一条过。
探店短视频开拍前,AI前置工作分三步
前置工作三步走:先给AI一段背景说明,再依次要分镜表初稿、口播稿、道具清单,三份稿子共用同一段背景,镜头之间才对得上。背景说明是我踩坑之后加的。第一版指令没有背景,AI默认我带着稳定器、默认后厨随便进,分镜里全是移动长镜。后来我固定写这段:「58秒竖屏探店视频,主角一人,手机拍摄,普通街边店,走道一米二,后厨免进,结尾要回头客钩子。」别嫌啰嗦,这段话每多一个实地信息,后面的废镜头就少一个。
拍视频提示词第一步:分镜表指令成稿:镜号、景别、时长、画面内容
分镜表指令的关键是把输出格式钉死:五列表格,镜号、景别、时长、画面内容、收音方式,八个镜头,总时长对齐58秒。指令我是这么写的:
「按下面的格式给分镜表:列依次为镜号、景别、时长、画面内容、收音方式。共8个镜头,时长加起来58秒。景别从远景、中景、近景、特写里选,前三个镜头按门口、进店、招牌的顺序铺。画面内容写到动作级,比如『筷子挑起面,热气挡住半张脸』,不许写『展示美食氛围』这类空话。收音只分现场声和后期补录两种。」
第一次跑出来的表,八个镜头里塞了五个特写,挺离谱的。补一句「特写最多三个,中景近景合计不少于四个」,第二次就正常了。指令里的数字要给死,AI很吃这一套。
口播稿指令和道具清单指令,各给一份成稿
口播稿指令要给语速和字数:按每秒四个字折算,58秒的片子口播压在200字上下,每个镜头一到两句,句尾留气口。我的成稿是:
「照分镜表逐镜写口播,每镜一到两句,全篇200字左右,按每秒四个字的语速读。第一句十个字以内,直接进正题。别出现连续三句『这家店』开头,语气像跟朋友说话,不要广告腔。每句末尾标注对应镜号。」
实拍时我用手机秒表掐过,自己正常说话的语速就是每秒3.5到4个字,200字的稿子读出来55秒上下,正好留三秒给现场声。老实讲,口播稿是三份稿子里最省心的一份,AI写得比我顺,尤其第一句的钩子——它给的「这家面馆的辣椒是老板娘自己晒的」,比我自己憋的「今天探一家面馆」强了一个档位。
道具清单指令更简单:「照分镜表逐镜列道具,格式为镜号、道具、用途备注,店里自有的标『店内』,结尾单独汇总一栏『容易忘的』。」8月16日那天清单列了14件,容易忘的一栏里躺着充电宝和备用手机支架,出门前靠它查了两遍。不夸张地说,这份清单是三份输出里我原本最不看重的,结果最救命。
AI分镜和实拍对照:放弃了哪两个镜头
八个AI分镜里有两个现场放弃:「跟拍进店到座位」的移动长镜和「老板甩面入锅」的慢动作特写,前者走道架不开稳定器,后者后厨不让进。对照表挑关键的几行:
| 镜号 | AI分镜写的画面 | 实拍结果 | 取舍 |
|---|---|---|---|
| 1 | 门口远景,行人虚化 | 照拍,站对面等红灯间隙抓了两条 | 保留,性价比最高的一条 |
| 2 | 跟拍进店到座位 | 放弃,走道架不开稳定器 | 改成两个定点中景 |
| 3 | 招牌仰拍 | 照拍,早到十分钟避开人流 | 保留 |
| 5 | 老板甩面入锅慢动作 | 放弃,后厨不让进 | 改拍出餐口递面,现场声很好 |
| 6 | 筷子挑面热气特写 | 照拍,让面静置20秒再挑 | 保留,全片封面就用的它 |
| 8 | 门口回头客钩子 | 照拍 | 保留 |
复盘下来规律就一条:AI不知道你的现场。它默认设备齐全、默认人人配合,放弃的两个镜头全栽在这个信息差上。栽得都不冤。解法也简单,把实地约束塞进背景说明——第二次跑这条流程时我直接写了「走道一米二、后厨免进」,分镜头一回就没出废镜头。走道那一米二是真拿卷尺量的,稳定器侧向展开要一米五,差着三十公分呢。
话说回来,那位店主看完成片,把视频转进了自己的老顾客群,这条到现在还是我探店系列里播放量最高的一条。AI给的钩子句确实帮了忙,可老板娘的辣椒是真晒的,内容有底子,指令才接得住。
拍视频提示词这件事,说到底是开拍前把你的现场约束讲给AI听。8月16日那条面馆视频,八个AI镜头成片六个,两小时十分钟收工,靠的不是指令多花哨,是三份稿子里都塞进了实地信息。下次出门拍摄前,花二十分钟把分镜、口播、道具三张稿子打出来,现场会清闲得不像在干活。
常见问题
拍视频提示词用中文写还是英文写?
中文就够。实拍前置要的是AI按格式吐表格和中文口播,直接用中文下指令最稳,绕英文反而容易带翻译腔。需要琢磨英文的场景是AI文生视频那条路,跟实拍前的这套准备工作不是一回事。
AI排的分镜时长为什么总对不上?
因为它不知道你的语速。别让AI直接编秒数,用口播稿字数倒推:每秒3.5到4个字是我拿秒表掐出来的实际读速,200字对应55秒上下,分镜时长跟着每句口播标注的镜号归拢,误差就能压住。
不是探店题材,这套三条指令还能用吗?
框架通用,改背景说明就行。产品口播把「探店」换成产品名,道具清单里加上产品本体和备用机;纯录屏教程把镜头砍到五个以内,AI分镜的价值主要落在开场钩子和转场上,实拍部分的分镜可以整个砍掉。
提示词里要写设备参数吗?
写「竖屏、手机拍摄」两个词就够。AI默认你设备专业,会给出需要滑轨和稳定器的运镜,写明设备后分镜会收敛很多。画质问题留给实拍现场解决,提示词只管镜头结构。