特种猫社区
灌水茶馆

折腾三周,我的ai短剧制作全过程终于不返工了

发布于 2026-08-26 · 15 浏览

上个月接了个甲方单子,要一集八分钟的都市情感短剧,预算只够AI出画面,不能实拍。头两天我拆了六十多镜,生成出来一半废片,手指长错四回,人物从第三镜起发色就变了。后来我把ai短剧制作全过程从头捋了一遍,分镜粒度、提示词结构、筛选阈值全调了,现在废片率压到三成以内,返工只剩转场那一两镜。

分镜别按场景切,按镜头语法拆

我一开始按"客厅对话""街头追逐"这种场景切,一个场景塞七八个镜头,提示词写成"两人吵架、切特写、再拉远",模型根本处理不了。后来我定了个规矩:把ai短剧制作全过程里最头疼的分镜环节单独拿出来啃,每镜只写一个固定机位下的一个动作,时长控制在一到三秒。

"客厅对话"拆出来长这样:中景-女方转身甩包(两秒);近景-男方后退扶桌沿(一点五秒);特写-咖啡杯被震到杯架边(一秒)。每镜只含一个主体、一个动作、一个景别,我拿二十条做A/B对比,出图合格率从不到四成拉到了七成以上。

操作顺序我固定成三步:通读剧本标情绪转折点,按"谁在看谁、谁在动"拆单镜,再给每镜标景别、镜头运动、最大同框人数。一集八分钟我拆五十五到七十镜,超八十就太碎,剪辑找不到呼吸点。另外同一套服装跨三镜以上,分镜表里必须加一行"服装锚点"写死颜色款式,不然到生成阶段裙子颜色肯定飘,重跑素材很浪费时间。

折腾三周,我的ai短剧制作全过程终于不返工了

提示词我改了三版才稳定

第一版纯自然语言,"愤怒的女人摔包",十次有六次出来是微笑。第二版加了镜头术语(medium shot, dolly in, shallow DOF),构图稳了但人物一致性还飘。第三版是现在用的结构,也是ai短剧制作全过程中我改得最频繁的一步:

  • 第一行:景别+运动+焦距,如 "Close-up, slow push-in, 85mm lens feel"
  • 第二行:主体写死一个人,发型+瞳色+服装,如 "straight black hair past shoulders, amber eyes, red satin dress"
  • 第三行:一个动词一个宾语,如 "throws a black handbag onto the leather sofa"
  • 第四行:微表情+光源+色调,如 "jaw slightly clenched, overcast window light from left, desaturated cool tone"
  • 第五行:负面提示,如 "no extra fingers, no text, no smiling"

每行只承担一个功能,哪行错了改哪行,不用整段重写。把"angry"换成"jaw slightly clenched"出图准确率高很多,模型对微表情词汇比大情绪词灵敏。负面提示那行别省,"no extra fingers"这一句在我这里至少救回了二十条本来要扔的素材。

生成和筛选,这步最磨人

说点实话,ai短剧制作全过程中最耗时间的不是写提示词,是跑图和筛。我一镜跑四到六条候选,筛选标准卡得很死:手指数量对、面部无畸变、背景没随机多出的人、服装颜色和分镜表锚点一致。四条里通常留一条,运气差六条全废,回头一看多半是景别和动作冲突了——我写了"extreme close-up"又让主体"walks toward camera",特写里走两步画面直接穿帮。

参数上我比较稳定的组合:分辨率1024×576横屏或576×1024竖屏,步数三十到三十五,引导系数CFG设七左右。CFG拉太高画面过饱和、表情僵硬,低于五动作跑偏。单镜生成大概四十秒到一分半,六十镜跑完光排队小半天,所以我按"同场景同人物"分组连续跑,减少切换参考图的开销。

人物一致性靠把第一镜确认过的脸截出来当ref,后面同角色全挂这张图。但超过八镜之后ref权重会被新画面稀释,我每隔五到六镜用最新一条合格输出替换旧ref。笨办法,但比调权重参数靠谱,我在特种猫社区里被问过好几次,确实没有更优雅的解法。

剪辑节奏,别让AI的呼吸感毁了成片

素材筛完进剪辑。AI单条视频普遍有一点二到一点八秒的起势收势,开头半秒在稳定、结尾半秒在衰减,直接硬切很跳。我的处理:每条掐掉首尾各零点一二秒,同场景内用零点一五秒交叉溶解衔接,场景切换硬切加零点三秒黑场。整集节奏"紧-松-紧",不会每刀都在溶、显得拖。

音频这块是ai短剧制作全过程中我返工最多的环节。AI画面没声音或底噪很怪,我直接铺环境音加BGM。客厅段铺空调嗡鸣和远处车声,街头段铺脚步和远景人声。BGM用轻爵士或piano solo,情绪转折处把音量压到负十二分贝以下让对白先出来,情绪到了再拉回,动态范围拉八到十分贝,观众体感上会觉得节奏在走。

说个局限:对话多的剧这套流程还行,但复杂动作戏——两人近身格斗、多人同框走位——AI目前真不太行,手指交叠和身体穿透我调了两周没解决。现在退一步用AI出背景板和情绪特写,动作戏拿实拍空镜覆盖,质感有点跳但比"五指变六指"强。整集做完十一天,比纯手工快一倍。

这套ai短剧制作全过程跑下来,踩的坑远比看教程多,纯靠自己摸。如果你也在折腾,可以来特种猫社区看看,有人贴过分镜表模板和提示词结构,直接抄改比从零快,有搞不定的场景发一帖问,回复挺快。

全部回复 0
登录后即可回复参与讨论…去登录 →
相关主题