我拿AI跑了三集短剧,说点分镜和提示词的实话
上个月想试水做一部竖屏短剧,四集那种,每集两分钟。刷了一圈 ai短剧制作平台推荐 的帖子,大部分都在晒成品,没人讲中间过程。我就自己跑了一遍完整流程,从分镜到成片翻车了不下十次,今天把能落地的东西写出来,给同样卡在这一步的人省点时间。
分镜怎么拆才不会乱
我第一部试的剧本是悬疑向的,主角在电梯里发现一封信。搜 ai短剧制作平台推荐 的时候我以为最大门槛是工具,结果分镜拆法才是第一道坎。最开始我图省事,把一整段剧情塞进一个提示词,生成出来动作全糊在一起,电梯门开了又关,信飘到天花板上去了。
后来我想明白:一个镜头只允许一个核心动作。电梯门开、主角低头、信纸展开,这是三个镜头不是一个。改完之后我按八秒一个镜头拆,两分钟大概十五到十六个分镜,每个分镜单独写一句画面描述加一句运动方向,比如"中景,主角坐电梯角落,目光从手机移到门缝,镜头缓慢推进"。这样喂进去人物不会瞬移,背景也不会每帧都变。
如果你也是从剧本直接跳到生成这一步的,建议先拿纸笔把分镜表列出来再动手,省得生成到第三个镜头才发现空间逻辑接不上。我用的表格不复杂,五栏就够:
- 镜号(01、02……纯数字)
- 景别和角度(中景、特写、过肩、俯视)
- 画面内容(一句话,只写一个动作)
- 镜头运动(推、拉、摇、固定,选一个)
- 时长(我统一写8秒,后期微调)

提示词我改了三版才稳
ai短剧制作平台推荐 的帖子里大家最爱晒提示词,但我实际用的时候发现,网上抄来的长 prompt 反而容易翻车。我试过一个四十多词的英文描述,塞了光线、材质、情绪、参考导演名,画面倒是漂亮,但人物动作完全不可控,想让他抬手他偏扭头,想让他站着他偏蹲下。
后来我把提示词砍到二十词以内,核心就三样:主体动作、场景约束、风格关键词。比如"close-up, woman opening an envelope in a dim elevator, cinematic 35mm, shallow depth of field"。注意我写的是"opening"进行时态不是"opens",这个差异影响很大:进行时让模型捕捉动作中间帧,画面有动感;完成时容易出一张静态图,像海报不像视频帧。
还有一个我踩了三次坑才记住的点:负面提示词别超过三五个词。我一开始学别人写"no text, no watermark, no extra fingers, no blurry, no distortion",结果模型把否定理解得很混乱,反而频繁出现手指畸形。砍到"no text, no extra fingers"之后问题就少了大半。多不如少,别贪心。
生成那一关我踩了个坑
前面分镜和提示词都理顺了,我以为生成就是按按钮等结果。结果第一集第三个镜头,主角从电梯走出来,连续生成了六次,每次走路姿势都不一样——第一次小碎步,第三次突然变跑步,第五次直接滑行。我后来加了"natural walking pace, left foot leading"才把步态固定,但代价是每个镜头多跑两到三遍才能挑出一条能用的。
批量生成还有隐性成本:同时提交十五个镜头,排队四十到五十分钟,期间不能改任何参数,改了就得重新排队。我一开始四集六十个镜头全丢上去,对着进度条干等了一个半小时。后来改成每次只提交四个,边等边写下一批分镜,时间利用率好很多。赶时间交片的话千万别一口气全提交,分批跑、分批审、分批改,节奏反而快。
每批出来我先快速刷一遍,把明显崩的——手指、脸变形、背景穿帮——直接标记重跑,不纠结细节。第二轮筛动作连贯性,第三轮才逐帧看。三遍下来六条里能留三到四条,剩下回炉。这个"三遍筛选"的节奏我之前在特种猫社区里看到有人提过类似思路,但没人把三遍各干什么讲清楚,我就补上了。
剪辑拼接比想象中磨人
以为生成完就能直接拼?别想太美。十五个八秒片段拼起来,最头疼的不是画面是声音。AI生成的视频自带环境音很弱,我四集里电梯的"叮"声、信纸窸窣声、脚步声全得另外找素材叠上去。我的做法是每集先铺一层很轻的底噪,比如电梯嗡鸣,再在关键动作帧上点一个音效。一集别超过五个音效,多了就吵。
转场也翻过车。"主角抬头看按钮"接"按钮特写"这个剪辑点,我用了交叉叠化,节奏断了一下,观众会觉得"怎么慢了"。后来改成硬切,干脆多了。做 ai短剧制作平台推荐 这类短视频的人应该都有同感:动作接动作用硬切,情绪转折才用叠化,两分钟里叠化最多两三次,多了就拖。
导出参数也说一嘴。竖屏短剧我统一 1080×1920、30fps、码率 8 到 12Mbps。别用 60fps,生成的素材本身帧间一致性就不够,插帧之后抖动更明显。投短视频平台的话码率压到 6Mbps 左右就行,文件小一半,画质肉眼看不出区别。这些不算什么秘密,但第一次做的人确实容易在帧率上多耗时间。
说实话有些场景它还是不行
写了这么多也得说点不好用的,不然看着像通稿。ai短剧制作平台推荐 这类话题下面经常有人问"多人大戏能不能做",我的答案:三个人以上的同框动作戏,目前别碰。我试过一段走廊追逐,两人一前一后跑,生成出来要么步频同步像跳操,要么其中一个人消失两帧再弹回来。群像调度这件事,现在的模型理解不了谁在前谁在后谁该被遮挡。
还有对白口型。有一集主角说了三句台词,对口型生成完我逐句看:第一句还行,第二句"啊"的嘴型偏大,第三句直接闭嘴说话。我最后的处理是对白镜头全用侧面或过肩角度,把嘴藏在后面,观众注意力在对方反应上,口型问题就不明显了。正面特写配口型目前还是得后期逐帧修,或者干脆换角度躲。
但单人情绪戏、空镜转场、简单双人对话(一坐一站、一近一远),现在的生成质量够用了。我这部四集里百分之八十的镜头是单人或空镜,真正需要"表演"的不超过二十个,靠角度和剪辑节奏把瑕疵盖过去了。所以选剧本时先想画面能不能用现有能力撑住,再决定要不要写这段,别先写了再硬凑。
以上就是我拿这套流程跑完四集短剧的完整体会。工具会更新,但分镜拆法、提示词克制、分批生成、角度规避这几个习惯,不管换哪个 ai短剧制作平台推荐 帖子里提到的工具都通用。想试的话从一集两分钟开始,别一上来奔十集,翻车概率会让你怀疑人生。我平时交流创作都在 特种猫社区,有具体镜头怎么调的问题也可以去那边问,回复快一些。