用ai视频生成软件拍了条6集短剧,说几个踩坑点
这阵子我拿ai视频生成软件拍了条6集AI短剧,悬疑向,每集40秒到1分钟。从第一版到能看的前后折腾了快三周,中间崩脸、穿模、提示词写了删删了写,心态崩过不止一次。今天把我觉得最关键的几个点捋一下,给同样在试水的朋友省点时间。
分镜拆法决定后面省不省事
写分镜这步我一开始图快,直接写"主角推门进去,看到桌上有封信,表情震惊"就丢进ai视频生成软件了。结果出来的画面里门往内开、信飘在半空、主角的手穿进桌腿,"表情震惊"更是变成了一个诡异的歪嘴。后来我逼自己每个镜头只写一个动作,加上镜头运动方向和光源位置,出片率直接翻了一倍多。拆得细一点,后面调参和拼接的返工真能少一大半。
我在特种猫社区看到有人分享过类似的拆法,试了一下确实管用。我现在每条分镜固定写五个字段,写完整段复制进提示词框,不用每次重新组织语言。坚持写下来之后,同一条故事线里景别和镜头运动不会前后打架,拼到一起节奏是顺的,不会出现上一秒特写下一秒突然跳到航拍那种断裂感。
- 景别:特写、中景、全景,三选一
- 镜头运动:推、拉、摇、固定,不超过四个字
- 主体动作:一个镜头只写一个动作,别塞"然后"
- 光源:逆光、侧光、顶光,后面跟一个颜色词
- 情绪锚点:紧张、温暖、压迫,只写一个

提示词我改了三版才稳住
第一版我学网上那些模板,"电影级光影、4K、超写实、史诗感、8K细节"全往上堆。大部分ai视频生成软件对这种长串形容词的处理方式是:画面确实漂亮了,但人物动作全崩,因为模型把算力都分给了氛围渲染。第二版我狠心砍掉所有风格词,只留主体加动作加环境加镜头,出片稳定了但画面有点"干",像产品说明书的配图。
第三版我在环境描述里加了一句带情绪的具体细节,比如不写"夜晚的城市",而写"雨夜,路灯昏黄,水洼里碎光晃"。就这么一句话,画面突然有了呼吸感,观众能感觉到角色是真的"在"那个环境里。现在我所有提示词都固定成下面这个四段结构,基本不再大改了。
- 主体:谁在做什么,一句话说完,不超过15个字
- 环境:场景加光线,必须带一个情绪词或感官细节
- 镜头:景别加运动方向,控制在8个字以内
- 禁止项:固定写"不要出现文字、不要多余人物、不要变形"
角色一致性是我卡最久的地方
做短剧最要命的问题就是同一角色跨镜头不能变脸。我前两周基本纯靠运气roll,同一集里主角的脸能换三四次,有次连发色都变了,绿了一下又变回黑。后来我发现几个确实有用的办法,但说实话目前这些ai视频生成软件在角色一致性上还是**"多生成加人工筛选"**的路子,没有真正一劳永逸的方案,你得先接受这个前提。
我现在的做法是:每个角色先单独生成一张定妆参考图,之后所有镜头的图生视频都上传同一张;提示词里把五官特征写死,不写"帅气男主"这种模糊词,而是"圆脸、单眼皮、短发碎刘海、左眉尾有一小段缺口";每生成一条立刻看脸,不对就重roll,别想着后期修。前两周光重roll就花了小两百次,心疼积分但没别的办法。
还有一个隐蔽的坑:如果一集里同一角色出现在正反打两个镜头里,两个镜头的光源方向必须一致。我有一次正面用侧光、背面用了顶光,拼出来就像两个人在对戏。这个细节一开始没注意,后面每条分镜我都把光源写进去了才解决,多花了不少时间但值得。
拼接和节奏上几个小习惯
片段生成完不是直接拖进时间线就完事。我一般把每段生成视频截成2到3秒的短镜头,用硬切拼接,悬疑片转场就用0.3秒黑场,那些溶解、缩放、粒子转场一律不用,太散了。配乐选低频环境音铺底,关键节点才加一记重音,别铺太满,留白比堆料有效得多。
有个坑我踩了两次才记住:不同ai视频生成软件、甚至同一个软件不同模型出来的片段,帧率可能不一样,有的是30fps有的是24fps。混在一起剪的时候肉眼看不太出来,但观众看的时候会觉得某些镜头"顿"了一下。我现在拼接前第一件事就是统一帧率到24fps,悬疑片用24比30更有那种微微的胶片颗粒感。
字幕这块我偷懒了,直接让语音转文字再手动调轴,手打实在来不及。但有个原则我坚持:悬疑片字幕别用花体,白色无衬线、底部居中、单条出现时间控制在1.5秒以内,干净利落比好看重要。观众看悬疑片注意力全在画面上,字幕花里胡哨反而抢戏。
跑顺之后,一集40秒的片子从写脚本到出片大概两到三个小时,比我之前纯手工剪辑省了差不多一倍时间。当然,现在这批ai视频生成软件做不了多人对白、复杂调度的戏,那种还是得老老实实拍。我在特种猫社区发过完整分镜模板和几版提示词对比,有具体操作问题的可以去特种猫社区翻翻。