拆完六十个分镜,短剧出片快了一截
这阵子在赶一组竖屏短剧,每集四到五分钟,一共八集。之前用ai视频短剧制作工具跑分镜,画面要么构图跑偏要么人物一致性崩掉,一集得重跑七八次。前前后后折腾了两周,把流程理顺了,今天把几个关键节点拆出来,踩过的坑你们就不用再踩一遍。
分镜别急着出图,先把镜头语言拆明白
我之前的错误是拿到剧本直接对着写提示词出图,结果镜头之间跳切很生硬,观众根本理不清空间关系。后来我改成先写一张镜头语言表再出图:每句台词对应一个镜头,标清楚景别、机位高度、运镜方向,逼自己把画面想具体了再动手生成。
举个例子,第三集有个对峙戏,两个人隔着一张桌子说话。分镜如果只写"两人对话",生成出来就是两个人站着各说各的,空间感全丢。改成"过肩中景,A在前景虚化,B在焦点位置,镜头从A左肩越过",画面立刻有了纵深。这个写法在ai视频短剧制作工具里直接决定你要不要后期重拍那个镜头。
我一般用表格拆,四列:镜号、景别加机位、画面内容含人物动作、单镜头时长。八集拆下来大概六十多个镜头。拆完再逐条写提示词,比边想边画效率高,因为你被强制把每个镜头的视线方向和空间锚点想清楚,不然生成出来人物朝向经常是反的。另外我加了个硬规则:同一景别最多连两个镜头,第三个必须切,不然观众视觉疲劳。

提示词我改了三版才不算难用
第一版我直接写"一个男人站在窗前,表情悲伤",出来的图构图居中、光线均匀,看着像证件照。问题在于ai视频短剧制作工具对"情绪"这类抽象词响应很弱,你得把情绪翻译成具体的视觉元素它才认得懂。
第二版改成"侧面近景,男人站在落地窗前,下巴微抬,嘴唇抿紧,窗外灰蓝色阴天,室内暖光只打到肩膀"。画面立刻有了方向感和冷暖对比,但人物一致性还是崩,同一角色换到下一个镜头脸型就变了,这个问题让我多跑了将近一天的生成量。
第三版我在每条提示词最前面加了一段角色锚定句,固定格式:"角色:男性,28岁,短寸头,左眉尾有一道浅疤,深灰色立领衬衫"。后面不管镜头怎么变这几句不动,一致性好了很多,大概十张里还有两张脸型偏,我现在的处理是生成完挑最接近的,后期用液化轻微拉一下。
参数、时长和拼接节奏
单镜头时长我卡在两到四秒,超过四秒动作连贯性明显下降,尤其人物手部会穿模。ai视频短剧制作工具在短时长上比较稳定,一拉长手指就多了或者比例漂移,所以我的原则是一个镜头只做一个动作,别贪心塞两个。参数这块我测了两周换过四五组配置,下面这组复用最多次:
- 分辨率:竖屏9:16,1080×1920,别拉2K,生成时间翻倍肉眼看不出提升
- 帧率:24fps够用,30fps对短剧没意义还多耗算力
- 运动幅度:中低档,高档容易糊,尤其头发和衣摆
- 风格关键词:整部片子固定一组,我用"cinematic, shallow depth of field, natural lighting",别每集换
生成完不是串起来就完事。我后期用达芬奇剪,卡点跟台词气口走,转场九成硬切、场景大跳加半秒黑场,别用叠化,竖屏节奏快花转场反而拖。声音层我最开始忽略,现在每集铺三层:环境底噪、TTS对白压掉高频毛刺、情绪点叠80Hz低频。就这三层,听感从"演示demo"变成能看完的片子。我在特种猫社区发过一版加环境音前后的对比,完播率确实上来了。
几个目前还没绕过去的坑
说点不行的,免得你们期望拉太高。第一,多人同框超过两个角色,肢体交互还是会崩。两人握手、一人拍另一人肩膀这种动作,手指和接触点经常穿模,怎么调都治不好。我现在的处理是能拆成单人镜头就拆,用正反拍代替同框,靠剪辑暗示交互,不硬凑多人画面。
第二,长镜头运镜,比如一镜到底的横移跟踪,跑三四秒背景就开始"呼吸",就是那种微微抖动但又不像手持的违和感,很出戏。如果你要做文艺感很强的长镜头,ai视频短剧制作工具目前还撑不住,老老实实拆成两三个短镜头剪接,别跟工具较劲。
第三,画面里的文字和UI元素。手机屏幕上的字、文件标题、店铺招牌,生成的基本都是乱码或者拼错的字母,完全没法用。我现在的办法是后期在剪辑软件里手动贴上去,或者提示词里写"blank white screen"生成空白区域再合成文字图层。这个环节暂时没法在生成端解决,算是用这套流程做短剧必须接受的手工部分。
跑顺这套流程之后,一集四分钟的短剧从剧本到成片我大概用三天,之前得五六天。工具本身也在迭代,这阵子人物一致性又好了一个档次。如果你们也在用ai视频短剧制作工具磨短剧,欢迎来特种猫社区交流,我把我那张分镜表格模板和角色锚定句的写法整理成帖了,直接拿去改就行。