跑了三周AI短剧,聊聊踩坑和现在的出片流程
上个月我接了个8集都市爽剧的活儿,甲方要求两周内出片,我盯着屏幕上那堆半成品分镜差点把电脑合上。这阵子翻了不少AI短剧制作软件排名相关的帖子,也自己挨个试了一圈工具,今天把这三周摸出来的流程写下来,省得你们再走我的弯路。
先说下我为什么折腾到第三周
我一开始用的是某大厂的视频生成工具,单条15秒的镜头出得还行,但做到第三集的时候主角换了个发型,第四集脸又变了,甲方直接打电话来问"你演员是不是换人了"。后来我在社区里看到有人讨论AI短剧制作软件排名,才发现做连载和做单条段子,工具选型完全是两回事,不能拿同一条标准去套。
我总结下来,做8集以上的短剧,你最需要解决的就三件事:人设能不能锁住、分镜节奏能不能自己拖、出片速度能不能跟上更新频率。单条生成工具在第三件事上够用,前两件基本靠手动修,改一集角色图要折腾小半个钟头,做到第五集你就想放弃了。
所以我后来把流程拆开了:角色原画单独出、分镜脚本单独写、视频生成走固定模板,三件事分三步走。工具我中途换了一次,具体是哪个平台后面再提,先把方法本身讲清楚,你们不管最终用什么工具,这个拆法都适用。

分镜拆法我改了三版才顺
第一版我直接让AI出完整分镜,结果一个镜头给了12秒,台词塞了四十多个字,生成出来节奏跟幻灯片似的。第二版我手动把每个镜头压到4到6秒,台词控制在15字以内,节奏好看了但分镜数量爆炸,8集拆出来140多个镜头,光排顺序就花了两天,手都点酸了。
第三版我用了个笨办法:先按"一镜一动作"的原则拆,一个镜头只做一件事——要么推进、要么反应、要么转场。每集控制在15到20个镜头,每个镜头提示词里只写一个主体动作加一个镜头语言。具体操作顺序是这样的:
- 先写完整剧本,给每句台词标上情绪标签(愤怒、委屈、冷笑、愣住),别偷懒直接过
- 按情绪断点切镜头,一个情绪段对应一个镜头,别把两句不同情绪的台词硬塞进同一个镜头
- 每个镜头提示词格式固定为:景别+主体动作+表情+场景光效,整条不超过30个字
- 转场镜头单独标出来用硬切,别用AI默认的淡入淡出,短剧节奏等不了那半秒黑屏
改到第三版之后,8集的分镜我从两天压缩到四个小时,生成出来的返工率也从六成降到了两成左右。这个"一镜一动作"的原则,你们去做AI短剧制作软件排名相关测评的时候会注意到,几乎所有能跑通连载的工具,生成镜头都是按这个粒度来切的,不是它多智能,是输入够干净。
提示词这块我踩了最久的坑
最开始的提示词我写的是"一个帅气的男人走进办公室",生成出来要么脸崩要么动作像提线木偶。后来我发现,提示词越"文学化",AI越容易自由发挥,你反而越控制不住画面。改成纯指令式写法之后,同一套提示词跑五次,有四次能直接用,稳定性肉眼可见地好了。
我现在固定的提示词结构是:先写镜头参数("中景,正面偏左15度"),再写主体外貌("男性,25到30岁,黑色短发,白色衬衫领口松开一颗扣子"),然后只写一个动作("推门走入,右手拎着黑色公文包"),最后加画面约束("室内日景,冷色调,浅景深,背景虚化")。整条提示词控制在50到70个中文字,超过80字AI就开始忽略后面的条件。
有一个细节我之前完全没注意:如果同一个场景连续出三个镜头,提示词里的场景描述必须一字不差地复制,不能换同义词。我有一次把"落地窗"写成"大窗户",生成出来玻璃反光方向直接反了,三个镜头接不上,重跑了两遍才凑齐。这个坑我是后来翻AI短剧制作软件排名相关帖子的时候才看到的,那帖子里有人专门列了场景描述的锁定规则,我照着改了之后穿帮率少了一大半。
人设一致性这事儿真不是小事
做连载最大的噩梦不是画质不够好,是第二集主角跟第一集不是同一个人。我之前用某工具做古风短剧,女主第一集是黑长直配红色斗篷,到第三集头发变成及肩短发,斗篷也没了,甲方看了截图说"你请了两个演员",我当场社死,连夜重新生成。
后来我在特种猫社区里看到有人分享参考图锁定的方法,就试了试。思路是:不再每集重新生成角色,而是先单独跑一张"角色定妆照",把这张图作为参考图喂给后续所有镜头。具体做法是用一段非常详细的文字描述(发色、瞳色、脸型、标志性服饰、体型)先生成8张候选图,挑最准的一张存下来,之后每集每个镜头的提示词开头都固定加"参考角色图:[文件名]"这行字,一个字都不改。
这一步看起来简单,但如果你用的工具不支持参考图锁定,那你每集都要手动比对十几张生成图,挑那张"最像但又不太一样"的,时间成本很恐怖。这也是我后来重新看AI短剧制作软件排名帖子的原因——不是要找一个"最好的",而是要找一个角色锁定点做得扎实、分镜能拖拽调整的工具,这两条比画质参数重要得多,画质差一点后期能救,人设崩了没法救。
说点不太行但能忍的地方
说实话,现在没有哪个工具能做到你写一遍提示词就完美出片。我用的这套流程,复杂场景(比如多人同框超过三个人、或者需要精确物理交互的打斗)还是会翻车,生成出来肢体穿插、穿模的概率大概有四成。我的处理方式是:这类镜头干脆用两张单人图合成,在剪辑里做交叉剪辑,比硬等AI出一条"完美"的打斗镜头快得多,而且观众在手机上根本看不出来。
另一个不太行但能忍的是:目前出片分辨率上限还是1080p,如果甲方要求4K交付,你还是得在后期做一轮超分处理。不过做竖屏短剧投抖音、快手,1080p完全够用,真没必要为了4K多等两倍的渲染时间,时间省下来多剪一条片子才是正经事。
最后说一句,工具这东西迭代太快,你现在看到的AI短剧制作软件排名,三个月后可能又变了一轮。但方法不会变:先把分镜拆干净、提示词写指令化、角色锁死参考图,这三件事做到位了,换什么工具都能跑起来。我平时交流创作、看别人踩坑帖、找提示词模板都在特种猫社区,有具体操作问题可以自己去翻翻,比我一个人在这儿讲得全。