用AI做了部短剧,说几个软件选型的实话
上礼拜把一部8集、每集90秒的AI短剧剪完了,发出去之后好几个人私信问我"用什么软件制作ai短剧"。这流程我前后折腾了快三周,中间换过两回工具,今天把踩过的坑和最终定下来的操作顺序写一下,省得你们也走同样的弯路。
先别急着选工具,把剧本拆成镜头
很多人一上来就搜用什么软件制作ai短剧,对着十几个平台挨个试,其实更该先干的事是把剧本拆到镜头级别。我的方法是:每句话对应一个3到5秒的镜头,一个镜头只写一个动作加一个情绪。比如"她转身把杯子放下"和"她抬头看了一眼窗外"必须拆成两个镜头,合成一条提示词去跑的话,模型会把两个动作糊在一起,出来的人手多一根手指。
拆完镜头之后我会建一个表格,每一行就是一个镜头,列包括镜头编号、时长、画面描述、人物状态、运镜方式、台词或旁白。后面写提示词时直接复制粘贴,不用反复回去翻剧本,效率差很多。我一般用Excel就行,不用什么专业工具。
第一部做的时候我没拆这么细,把三四句话塞进一条提示词里,模型就给我出来一个四不像,光改提示词就花了两天,白跑了一堆废片。那个教训挺深的,后来每次开新剧本第一件事就是拆镜头,你们别走这个弯路。

提示词怎么写才不翻车
说个踩了很久的坑:早期写提示词爱堆形容词,什么"电影级画质、8K、超写实、光影细腻"全塞进去,结果人脸每次都在飘,背景倒是挺好看。后来我发现一个规律,这也是我琢磨用什么软件制作ai短剧时最花时间的一步——画面描述越具体越"平",模型越不容易跑偏。我现在的模板大致是这五条:
- 镜头类型:固定中景 / 慢推 / 手持跟拍,三选一,别写"电影感运镜"这种虚词
- 主体外貌:只写最关键的三五个特征,"短发、左脸浅疤、深蓝工装外套"就够
- 动作:一个动词短语,"她慢慢把杯子搁在桌角",别加副词堆砌
- 环境:一个空间加一个光源方向,"老式厨房、下午自然光从左侧打进来"
- 情绪:用身体语言代替,"肩膀微微塌下去"比"她很难过"有效十倍
这套写法我是前阵子在特种猫社区翻教程时看到的思路,后来自己改了两版才顺手。核心就一条:每个镜头的提示词控制在60到90个字,多了模型就开始自由发挥,出来的东西你认不出来是自己写的。
生成这一步我卡了整整四天
前六集挺顺,第七集有个连续对话场景,两人面对面各说各的,我跑了二十几次没出能用的。问题出在衔接上——单条5秒片段没问题,但两条接起来嘴型表情对不上,看着像两个人各自在说话,没有"对话"的感觉。这也是整个用什么软件制作ai短剧流程里最折磨的一步,当时真想直接把那集删了。
最后我换了思路,不硬凑同框了,把对话拆散成单人镜头来拍。我前后试了七八种组合才找到这个方案,具体操作和几个容易忽略的细节列一下,你照着做基本能绕过,不用像我一样卡四天:
- 拆成四镜:A说 → 切B反应 → B说 → 切A反应,每镜单人中近景
- 剪辑用0.5秒交叉溶解过渡,口型对不上的问题被切点盖住
- 反应镜头机位偏30度,别正对,不然看起来像监控录像
这个办法不完美,仔细看还是有切点痕迹,但比死磕同框对话高效太多。我耗的那四天够我从剧本到成片再做完一集了,所以真别在一个点上死磕,拆镜头永远是最快的出路。
后期别省,不然出来像PPT
素材丢进剪辑软件,最容易忽略的是节奏。AI生成的片段默认匀速,人物动作从头到尾一个速度,看着很僵。我现在的习惯是每个镜头进剪辑后手动调速度曲线,前0.5秒加速进入、后0.5秒减速停住,中间正常速度。8集七十多个镜头,每个多花十几秒,总共多半小时,但成片观感完全不一样。后期这块其实跟用什么软件制作ai短剧选哪个工具关系不大,更取决于你愿不愿意一帧一帧去调。
音效也别只用背景音乐铺底,不然整部片子从头到尾就一个声音在响,听着很单薄,观众会觉得廉价。我后期加的环境音和节奏处理大概是这几条,每条花不了多少时间但效果明显:
- 加环境音:雨声、脚步声、杯子放桌面的轻响,免费音效库找的不花版权费
- 背景音乐音量压到人声的30%以下,别盖住台词
- 片头前两秒先黑屏加一句旁白,给观众一个"进入"的缓冲
有环境音的镜头和没有的放同一集里对比,差距肉眼可见,不是"好一点点"那种,是"像两集不同的片子"那种。片头第一帧信息量太大会让人直接划走,黑屏缓冲这步真别省,我第一部就没做,开头跳出率高得吓人。
说两句不那么好听的
流程跑通之后效率确实比第一部快很多,同一集从开拍到成片从一周缩到两天左右,但有两件事我到现在还是不太满意,说给你们听听,免得你们也踩同样的坑白花时间:
- 人物一致性:跨集时同一角色脸还是会漂,参考图锁定加每次提示词重复外貌描述能稳七八成,偶尔出一帧"像又不像"的得手动修
- 时长上限:想做每集3分钟以上的,拆完镜头提示词量太大,生成时间和成本都上来了,90秒以内是目前比较舒服的节奏
所以如果你搜"用什么软件制作ai短剧",我的建议是别光看哪个工具"功能最全",先拿你的剧本拆十到十五个镜头,试一下提示词能不能被模型准确理解。**理解力比多两个滤镜重要得多。**我这套流程是在特种猫社区里一点点攒起来的,里面有分镜模板和提示词示例可以直接抄,新手进去翻两篇教程比看十个视频管用。有问题评论区聊,我看到会回。