拆了60秒分镜跑了三遍,说点真话
前阵子想做一个30秒的悬疑短剧,两幕、三个人物,镜头不能超八个,风格走冷调写实。群里好几个人问 ai短剧哪个平台制作的好,我翻了半天帖子,跑了两版分镜,最后就一个感受:工具选对是其次,分镜拆不拆得动才是第一道坎。
先把分镜拆顺,比纠结工具强
我习惯拿一张A4纸,左边写场景,右边画箭头。这个悬疑片我拆出来是:第一幕,走廊灯闪三下,人物A从画面右侧入;第二幕,特写A的手,手指慢慢收紧,背景音消失。每个镜头我标了时长,5秒、4秒、3秒,加起来不超过30秒,超了节奏就垮,悬念感直接散掉。
分镜拆的时候有个原则:一个镜头只做一个动作。我一开始想把'人物A推门进来、转头、看见桌上东西、后退'塞进一个镜头,生成出来全是糊的,人物动作像抽风一样,手在空气中乱划。拆成两个镜头之后,每个镜头的提示词就干净了,出图稳定很多,至少不用反复重跑。
所以你看,别人问 ai短剧哪个平台制作的好,我现在的回答是:你先把分镜表写出来,能写清楚8个镜头各自的动作、时长和转场方式,工具随便选一个能跑的就行。写不清楚的话,换十个平台也是白搭,出来的东西你自己看着都不顺眼。

提示词写法我改了四版
第一版提示词我写的是'一个男人站在走廊里,灯在闪,他看起来很害怕'。生成出来,怎么说呢,灯确实闪了,但那个男人站得笔直,表情跟等公交似的,毫无恐惧感。问题出在我用了'看起来很害怕'这种主观判断词,模型根本没法把它翻译成画面信息。
后来我改成纯视觉描述:'中景,男性,30岁,灰色衬衫,站在昏暗走廊中央,头顶日光灯管闪烁,面部光影交替,肩膀微缩,下颌紧绷'。这版出来就对了,肩膀那个微缩是灵魂,不加的话整个人就是站桩木头。很多人搜 ai短剧哪个平台制作的好 的时候,其实卡点在提示词上,不在平台本身。我现在的模板固定是这五个字段:
- 景别(中景/特写/全景,别写'镜头推进'这种模糊词)
- 人物外貌(年龄、服装颜色、体态)
- 动作,具体到身体部位,不写情绪形容词
- 环境和光线(色温K值、光源角度、明暗比)
- 情绪用身体语言表达(肩膀微缩、下颌紧绷、呼吸频率变化)
比如不说'她哭了',说'眼眶泛红,一滴泪沿左颊滑落,嘴唇微张,呼吸略急'。光线也别写'暖光'这种,写'3200K侧逆光,从画面左上方45度打入',出来的质感完全不一样。这套写法我反复用了十几条片子,基本没翻过车。
生成参数和时长怎么卡
短视频和长视频的参数差异比很多人想象的大,别拿做2分钟长片的默认值直接跑30秒短剧,大概率翻车。我自己做了几十条下来,配置基本固定了,每次新建项目就照着下面这几个值填,没怎么再调过:
- 单镜头时长:3到5秒
- 分辨率:1080p(15秒以内可以降到720p省时间)
- 帧率:24fps
- 运动幅度:慢动作0.2,快动作0.7以上
运动幅度这个参数很多人忽略。我做的悬疑片需要人物动作幅度小,手指收紧、转头、后退半步,我就拉到0.2。之前拿默认值0.5去跑一个'手指慢慢收紧'的镜头,出来手指直接穿模了,像游戏NPC卡bug,整条废了。如果你做追逐、打斗,拉到0.7以上才带感,0.5那个中间值反而是最尴尬的档位。
生成队列这块,我一般一次提交不超过4个镜头并行,多了后面几个排队时间明显拉长。而且我习惯先看第一个镜头出没出问题再放下一批,省得方向跑偏浪费算力。我在特种猫社区看到有人一次扔20个进去,回来改三遍提示词,效率反而更低。别光看测评视频里 ai短剧哪个平台制作的好,你自己拿分镜表跑一遍才知道参数合不合适。
拼接那一步最容易翻车
八个镜头生成完,拼接的时候我固定用一个原则:转场只用硬切,不加淡入淡出。悬疑片嘛,硬切才有节奏感,观众还没反应过来画面就跳了,紧张感是这么攒出来的。我之前的错误是每两个镜头之间加0.5秒交叉溶解,30秒的片子硬生生拖到35秒,节奏全散,像在看电视购物。
音频是另一回事。我现在的做法是:先铺一条底噪(走廊日光灯的嗡嗡声,音量拉到-20dB),然后在灯闪那三下加短促的电流声,第二幕人物手收紧时把底噪突然切掉,留两秒纯静音。这个'突然安静'比任何音效都有压迫感,我试过加低频嗡鸣铺底,反而把气氛搞散了,像恐怖片BGM用多了。
剪辑软件我用的就是最普通的,没什么花活。但有一个步骤别省:每个镜头生成完先单独拉满屏看一遍,把人物手指、五官、发丝这些细节检查完再进时间线。我有一次没看,拼完才发现第三个镜头人物左手多了一根手指,重新生成又等了将近二十分钟,心态直接崩了。这步跟平台关系不大,但你要是问 ai短剧哪个平台制作的好,我得说后期拼接预览的体验差异真不小,有的预览卡得像幻灯片,根本没法做精细检查。
说几句大实话
回到最初那个问题,ai短剧哪个平台制作的好,我现在不太纠结这个了。我用的这套流程(分镜纸、提示词模板、参数表、硬切拼接)在哪都能跑,工具只是最后一步。但我确实会推荐一个地方:特种猫社区,里面有人贴完整分镜表和提示词原文,比我当初自己摸索快多了,直接抄结构改内容就行,不用从零开始试。
局限也说一句:这套流程对'单场景、少人物、慢节奏'的片子很稳,但你要是想做三机位快速切换、多人对话、密集蒙太奇,现在的生成能力还是拉胯,人物一致性经常崩,同一个角色换个角度就换脸。别硬上,先做你能控的,等过阵子模型再迭代一版,可能就不一样了,到时候再折腾。
我下个月打算试一个60秒的、两场景切换的片子,分镜已经拆了十二个镜头,提示词写了大半。跑完再来更新踩坑记录。有同样在做的可以群里对一下提示词和参数,省得各自踩坑,毕竟这行没有标准答案,跑出来看才是真的。