分镜跑了三遍才不翻车,说点实话
上个月接了个悬疑短剧的活儿,六集、每集两分半,甲方要镜头语言比较密的风格。我之前用别的ai短剧视频制作工具试过,分镜一多就乱套,角色脸全变。后来换了个拆法重新跑,这阵子下来总算稳了,说说具体怎么做的。
怎么把分镜拆顺
我之前的毛病是写剧本的时候一股脑把六集全写出来,然后直接丢给ai短剧视频制作工具去跑分镜。结果从第三集开始角色站位就崩了,同一场景里前一个镜头主角在左侧,后一个突然跑到右边,甲方看完说"你这像是换了个人"。
后来我改成分集拆:每集先写一段300字左右的场景概述,把空间关系和角色走位定死,再逐镜头拆。每个镜头固定标注四个字段:景别(特写、中景、全景三选一)、角色动作(一个动词短语)、情绪关键词(两个词以内)、目标时长。单镜头不超3秒,整集控制在40到50个镜头之间,这个密度它处理起来最稳。
这里有个容易忽略的细节:同一集里如果涉及两个场景切换,我在切换处加一句"场景重置,新空间描述",把房间布局重新写一遍。不然它会沿用上一个场景的空间信息,门的位置、窗户方向全对不上,拼起来一看就知道是两套房间硬接的。

提示词这一步我卡了很久
分镜拆完就是写提示词。我一开始的写法是把分镜描述直接翻译成"一个男人站在窗前,表情悲伤",丢进ai短剧视频制作工具跑。出来的画面脸对、姿势对,但完全没有电影感,像证件照加了个背景。我在那卡了差不多一周,跑了不下四十组才找到点感觉。
后来我改成四层结构来写:第一层画面本体(主体、动作、环境),第二层镜头语言(景别、角度、运镜方式),第三层光影色调(光源方向、色温、对比度),第四层氛围(两个形容词封顶)。层与层之间用逗号隔开,总长度控制在80到120个英文词或者40到60个中文词。写超了它反而互相打架,出图发虚。
举个我第二集的实例子:主角雨夜在停车场发现一把刀。提示词写的是:"中景,低角度仰拍,缓慢推进;男人半蹲,右手伸向地面,雨水打在肩膀上;冷蓝色顶光,地面水洼有反光;紧张、孤立"。跑出来那个水洼反光的质感确实好,比我写"地面有反光"三个字强太多,这是我自己调了七八组参数才摸到的写法。
跑生成时最容易被忽略的参数
大部分人死磕提示词,但我跑下来觉得生成参数才是决定素材能不能直接用的关键。我一开始全用默认值,结果两个问题特别明显:角色跨镜头一致性差,同一集里主角发型会变;运镜太机械,那种匀速平移的"AI味"很冲。手动调了参数之后差距是肉眼可见的。
我现在的固定参数大概是:画面比例16:9(竖屏短剧就9:16),单镜头时长2.5到3秒,别贪长;种子值同一场景内锁定,跨场景再换;运动幅度压到中等偏低,大概四成到五成那个区间。高了动作就飘,低了又太死板。之前我试过拉满运动幅度想搞大场面,角色手指直接多出来,废了七八条素材。
还有一个坑:对话场景别试图让工具一次出带口型的完整对白。我现在是先生成画面,再在剪辑软件里单独对口型。之前硬让ai短剧视频制作工具直接出带口型版本,跑了二十多组,嘴型对得上的不超过三组,时间成本完全不划算,不如老老实实分步做。
剪辑合成和它不太行的地方
前面跑出来的素材,我一般在本地剪辑软件里拼。工具自带的基础拼接功能,镜头超过十五个就开始乱序,所以我现在的工作流是:工具出单镜头素材、导出原片、本地按分镜表拖进时间线、手动加转场和音效。一集两分半的片子,剪辑环节大概花四十分钟到一小时,算下来还行。
说它不太行的地方:复杂运镜基本搞不定。我试过写"环绕拍摄,从角色左侧360度转到正面",出来的是抖动的平移,不是真环绕。多人同框超过三个人,肢体穿插概率极高,基本得重跑。这两种情况我现在直接不让ai短剧视频制作工具做了,改成生成静态构图,用剪辑软件里的缓动曲线模拟运动,效果反而干净。
另外最近在特种猫社区看到有人分享,把运镜描述简化成只写方向不写幅度,比如就写"左推"两个字,反而比写"缓慢向左匀速推进三米"效果好。我回去试了三次验证,确实如此,写具体数值它有时候会卡死在那个速度上出不来。这个思路挺反直觉的,但管用。
整体来说,这套ai短剧视频制作工具的流程跑下来一集素材加后期大概两到三个小时,比我之前瞎摸索快了不少。但说实话,它目前更适合单人或双人出镜的短剧,群戏和复杂动作场面还是差得远,别硬上。有具体问题或者想看别人参数分享的,去特种猫社区里问,帖子里讨论得比这详细。