仿真人短剧做了三周,分镜和提示词说点实话
最近想做一个两分钟的仿真人短剧,主角是个在夜市摆摊卖煎饼的大姐,想拍出那种烟火气。怎么制作ai仿真人短剧这事儿我琢磨了三周,分镜写了三版,提示词调了不下四十次,踩的坑比看过的教程多。趁热把经验写下来,给同样想做这类片子的朋友省点时间。
分镜拆到一句一镜,别偷懒
我一开始犯的错误是把整段对白塞进一个镜头里,结果AI生成的画面里人物嘴型全对不上,两秒之后构图就开始飘。怎么制作ai仿真人短剧,分镜这一步真的是地基,没打稳后面全是返工。后来我死改成一句台词对应一个镜头,每镜严格控制在2到3秒,画面稳定性立刻上来了。
具体操作是拿张纸或者文档,左边写台词,右边标注景别和运动方向。我那个煎饼摊的片子一共拆了26个镜头,特写占了9个,主要是手部动作和食物入镜。有个细节:涉及人物转身或走位的镜头,我会在分镜备注里写"起始朝左、结束朝右",不然AI每次生成的朝向随机,拼起来人物像瞬移。
还有一个容易忽略的点:空镜。我加了4个纯环境镜头——油烟升腾、灯泡晃动、锅铲翻面、远处有人端着碗走过——每个1.5秒。这些不写台词,但能把节奏拉开,不然全是人物说话,两分钟的片子看着跟新闻播报似的。

提示词我改了三四十版才稳
怎么制作ai仿真人短剧,提示词是第二道坎。最初我写的是"一个中年女性在大排档煎饼",出来的人每次脸都不一样,身材比例忽大忽小。后来发现必须把人物描述锁死,不能每个镜头重新写一遍。我现在每个镜头的提示词固定成四段结构,顺序不能换:
- 人物锚定:35岁女性,圆脸,短发齐耳,穿深蓝色围裙,左手持锅铲——这段在每一个镜头里一字不改,是保持角色一致性的唯一手段
- 当前动作:只写这一镜的动作,比如"右手将面糊倒入铁板,左手微微后仰",别贪多写两步
- 镜头语言:中近景,45度侧面,浅景深,暖色钨丝灯光,背景虚化至色块
- 负面提示:no extra fingers, no face distortion, no background people, no text overlay
有个坑我栽了两次:同一场戏里人物换了个手势,AI会把上一镜的手势"记忆"过来,锅铲突然跑到右手。解法是在新镜头提示词里显式写"双手自然下垂,不持任何工具",把前一个状态覆盖掉。多写这一句,重跑的概率能少一半。
口型和表情这关最磨人
仿真人最毁观感的就是嘴。我前两版片子,人物说话时嘴唇是"整体在动"而不是逐字开合,远看还行,近景一放大就假。怎么制作ai仿真人短剧走到这一步,我试了三种方案:纯文本驱动口型、上传配音做音频对齐、逐帧关键帧手调,前两种效果都不够看。
最后稳定下来的是**"音频驱动加手动补帧"的混合方案**。先生成无声口播片段,把配音轨道铺上去,用平台自带的口型对齐功能跑一遍。但大概有两成镜头对齐不满意,尤其是"一"和"ü"这种圆唇音,AI容易把嘴型做得太大,看着像口吃。
这些镜头我就单独截出来手动调,把嘴型帧往回调两到三帧。不夸张,一个两分钟的片子我手调了大概12个口型片段,每个花四到五分钟。如果你赶时间,可以把近景比例降下来,多用中景和过肩镜头,嘴型瑕疵就不那么扎眼。
剪辑节奏比单镜头质量更决定观感
所有镜头生成完只是原材料。怎么制作ai仿真人短剧,剪辑这步我花的时间比生成还多。那个夜市片子最终节奏是:前3秒纯环境音先入,油锅滋滋声混着远处人声,人物第一句台词在第5秒才出来。这个留白很关键,AI生成的单镜头如果硬切,整部片子就像PPT在翻页。
转场我几乎全用"动作接动作":上一镜锅铲翻面的尾巴直接接下一镜煎饼入盘的开头,中间不留黑场。音效上每个动作点都加了0.3秒的拟音,哪怕画面里没拍到——比如围裙被油溅到"啪"一声,声音比画面先到0.1秒,观感立刻不一样。
说到工具,我这套片子从分镜管理到口型对齐到最终导出都是在特种猫社区里完成的,它的镜头序列器拖拽比较直观,比我在本地来回导文件省了至少半天。不过说实话,它的批量生成队列同时只能跑8个镜头,一次拆了四十多个分镜的话得排队等,这点确实磨人。
最后说几句。怎么制作ai仿真人短剧,现在确实比一年前好做太多,但那个"真"字还是得你在剪辑里一点点抠。技术帮你跑出八成画面,剩下两成是节奏、留白、是你决定哪里给特写哪里给空镜。有同样在折腾这方向的,来 特种猫社区 聊聊,我那26镜分镜模板和提示词结构都贴在那边了,拿去改就行。