跑了两周AI短剧,分镜提示词我改了三版
这阵子手上攒了个都市悬疑短片,一分钟出头,两角色三场景,想自己用AI短剧生成工具从分镜跑到成片。前两周基本在跟提示词搏斗,第三天才把节奏顺下来。今天把踩过的坑和跑通的做法写一写,给同样在折腾的朋友看看。
分镜先砍到七八个,别贪多
我最初把剧本拆了十五六个镜头,觉得反正AI短剧生成工具出图快,多来几个无所谓。实际跑起来才发现,每个分镜都要单独调提示词、检查首尾帧衔接,镜头一多整体节奏就散了,观众根本不知道哪个是重点。后来砍到八个分镜,每个镜头四到六秒,整片刚好六十秒出头,这个数量下你才有精力逐帧看光影对不对。
拆的时候我总结了一条:每个分镜只交代一个动作或一个信息点。"女主角推门走进办公室"是一个镜头,"她看见桌上有把钥匙"是下一个,别把两组动作塞一起。提示词里写了两组连续动作,出来的画面大概率只执行前半句,后半句要么被吞,要么变成一个很勉强的过渡帧。我最终按时间线拆了八个镜头,列出来供参考:
- 开场空镜:走廊缓慢推入,冷色调,3秒
- 角色A入画:中景走路,手持微晃,4秒
- 发现线索:特写手部伸向桌面钥匙,4秒
- 转身反应:中近景,表情由平静转警觉,5秒
- 闪回碎片:三个一秒钟快速画面,白闪衔接
- 角色B出现:远景门口逆光,4秒
- 对话:固定机位两人同框中景,8秒
- 收尾:拉远,门关上,黑场,3秒

提示词我改了三版,前两版都在翻车
第一版我写得很"电影感",什么浅景深、自然光45度侧打、胶片颗粒感,结果八个镜头打光全一样,看着像同一个房间换了道具。第二版改成纯动作和构图描述,画面对了但角色表情全是木头的。第三版才找到节奏,把提示词拆成三层来写:
- 第一层(必填):景别 + 主体动作 + 身体朝向。例:"中近景,女性角色右手伸向桌面,身体微前倾,面朝镜头左侧"
- 第二层(氛围):光源方向 + 色温 + 一个情绪词。例:"冷白顶光,偏蓝灰,紧张"
- 第三层(可选):镜头运动,写"缓慢推进"或"固定",不写默认固定
有个细节很多人忽略:AI短剧生成工具对抽象情绪词的理解很浅,你写"悲伤"和写"眼眶微红、嘴角下压"出来的东西完全不是一个级别。能用具体肌肉动作描述的,就别用形容词糊弄过去,省得反复重跑浪费额度。
角色一致性,我折腾最久的一块
两个角色要在八个镜头里保持同一张脸、同一套衣服,这件事我卡了两天。最后跑通的做法是:先单独生成角色定妆图,正面侧面各一张,确认没问题后,后面每个分镜提示词里都复贴同一段角色描述,同时上传定妆图当参考。关键是把发型、发色、衣服款式、一个辨识配饰全写死——我给女主角加了"左耳单颗银色耳钉",不然跑到第五个镜头耳朵就空了。
说个它不太行的地方:两个角色同框且距离很近时,AI短剧生成工具目前处理得还是勉强。我第七个镜头两人面对面近景对话,调了四次,有一版鼻子跟对方肩膀"融合"了一下。这种场景我现在倾向把景别拉到中景偏远,或者用正反打拆成两个镜头,少让它做近景双人互动。
角色描述那段我后来在特种猫社区贴出来过,有老用户提醒我加一句"无纹身、无额外饰品",不然它偶尔会自作主张给角色脸上加个痣或者手上多只戒指。这个否定描述加上去之后,后面重跑的角色就稳多了。
配音和转场,别全交给自动
自动配音我试了AI短剧生成工具自带的那个,用了一次就放弃了。语调太平,悬疑片要的那种压着嗓子说话的感觉完全出不来,听着像产品说明书。后来自己手机录了对白,单声道就够,导入时音量比背景音乐低6到8个分贝,人声才不会被压住。BGM选了段无版权钢琴loop,30秒循环,第40秒左右淡出,留两秒静默接黑场。
转场前五个镜头我全用了硬切,没加任何过渡效果。悬疑片用淡入淡出反而破坏紧张感,硬切加一声低鼓音效比花里胡哨的转场有效得多。只有最后闪回那三个一秒钟碎片,用了快速白闪,每次持续大概两帧,模拟记忆闪过的感觉。这个参数我在时间线上手动卡,比自动转场靠谱。
整片从分镜到成片前后跑了十一天,纯生成和调参大概四天,剩下全在剪声音和卡节奏。有人问我用哪套AI短剧生成工具跑的,就是平台基础流程,没什么花活,核心还是分镜拆细、提示词写具体。如果你也在折腾同类片子,特种猫社区里能翻到不少踩坑帖和分镜模板,比我一个人闷头试要快。有问题评论区聊。