ai文生视频做短剧,踩了两周坑说点实话
最近接了个客户单,要做一组六集竖屏短剧,每集九十秒,全走ai文生视频,不实拍。听起来挺省事对吧?实际操作下来,光分镜拆解就卡了我三天,提示词改了不下二十版才勉强能看。这帖把我踩的坑和最终跑通的流程写出来,给同样想走这条路的人省点时间。
先把分镜拆成它听得懂的粒度
我之前习惯写电影分镜那种表格,一格里塞"三十秒,中景,男主从左侧入画,背景是雨夜霓虹街",整段话直接丢进去生成。结果出来的东西,镜头根本不会动,雨和霓虹糊在一起,人脸糊得像打了马赛克。后来我发现,ai文生视频对单条提示的理解上限大概就是一个动作加一个场景,你塞多了它就开始平均用力,每个元素都给你打个六七折。
我现在的做法是把九十秒拆成十五条分镜,每条不超过六秒。每条只写一个主体动作加一个环境锚点,比如"镜头固定,一只橘猫从画面右下方跳上窗台,窗外是模糊城市夜景,暖黄灯光"。主体一个,动作一个,环境一个,不贪多。做ai文生视频这行,拆镜粒度直接决定你后期返工量,拆细了后面剪起来省一半时间。
- 单条时长控制在四到六秒,超过八秒动作就开始飘
- 一条只写一个主动作,别写"他转身然后走向门口然后蹲下"
- 环境描述放动作后面用逗号隔开,别跟动作混在一句话里
- 竖屏加"九比十六竖构图,主体居中偏下",横屏写"十六比九电影宽幅"

提示词我改了三版才不翻车
第一版我写的是那种"电影级画质,超真实,光线追踪"的堆料型提示,做ai文生视频最忌讳的就是形容词堆砌。生成出来的东西确实好看,但好看的方式很诡异,所有画面像套了同一个滤镜,雨夜和晴天长得差不多。第二版我去掉了形容词,只留具体视觉信息,比如"钠灯色温三千K,地面有积水反射,雨滴打在伞面上",效果好了不少,但还差一口气。
后来我研究了几十条ai文生视频的出片案例,发现真正拉开差距的是运镜描述。不写运镜的时候它默认给你轻微推近或者固定,但你要跟拍或者环绕,不写就永远出不来。我现在每条分镜提示词最后都加一句运镜,比如"缓慢跟拍,速度均匀"或"固定机位,景深渐浅"。在特种猫社区里看到有人把运镜关键词整理成对照表,我照着改了一下,基本没再翻过车。
- 格式固定为:构图,主体加动作,环境锚点,风格,运镜,画幅
- 风格只写一个关键词,"胶片感"或"写实",别写"赛博朋克加水墨加赛博"
- 连续镜头衔接:前一条结尾写"画面渐暗",下一条开头写"从暗处亮起"
运镜连贯性是我卡最久的一步
单条四秒的片段跑出来都挺像样,但拼到一起就露馅了。第三条和第四条之间,男主冲锋衣拉链颜色变了,背景那棵梧桐突然多了一根枝丫。做短剧最要命的是角色一致性,你不可能让观众每切一次镜头就怀疑这人怎么换衣服了。我试了用同一张参考图做图生视频来锁角色,效果比纯文生好不少,但ai文生视频纯文字锁角色的能力确实还差一截,同一段描述跑五次,脸能出三种。
最后我用了个土办法:角色描述写成固定字符串,每条分镜里原封不动复制粘贴,一个标点都不改。比如"穿黑色冲锋衣的短发男人,左眉尾有一道细疤",这串字从第一条到第十五条完全一样。环境描述每条独立写,但光线色温保持一致,全程"暖黄偏橙"。这样角色至少不会在衣服和五官上跑偏,背景变化反而是合理的叙事需要。
- 角色固定描述控制在五十字以内,超了模型会开始自由发挥
- 背景描述每条独立写,但色温和光源方向必须一致
- 某条跑出来角色崩了别硬用,重跑三次取最接近的那条
剪成片之前还有几个小坑
生成完十五条片段,我以为到剪辑环节了,结果音画同步又坑了半天。自动配的背景音乐节奏跟剪辑点完全对不上,我干脆全删了,自己卡着每段四秒的节点铺鼓点,人声单独录旁白。说实话,纯ai文生视频做有对白的短剧还是不太行,口型对不上是硬伤,我最后把台词全改成了画外音,视觉上干净多了,观众也接受。
还有个事,竖屏九比十六生成的时候画面上下会各裁掉大概百分之十。我一开始没注意,两条分镜的关键信息被裁没了,一条是角色头顶的帽子,另一条是画面底部本来打算放字幕的位置。后来学会在提示词里写"主体置于画面中央,上下各留百分之十五安全边距",这细节论坛里少有人提,全靠自己废了两版才悟出来。
- 导出前逐帧检查角色脸部,重点看转场衔接帧
- 音频单独导出再对齐,别在生成器里混着出
- 竖屏项目每条提示词都带安全边距描述,别省这几个字
整套流程从写第一版分镜到出十五条能用片段我花了五天,真正等渲染不超过四小时,剩下全是拆脚本改提示词挑废帧。做ai文生视频这件事瓶颈不在渲染,在你肯不肯把每条提示词拆到骨头里。目前做概念验证和前期预览够用了,客户验收级交付细节还得人修。如果你也在琢磨这条路,可以去特种猫社区翻翻,里面有人把分镜模板和运镜对照表整理得挺细,我那套底子就是那儿找到的。有具体问题评论区聊,我看到都会回。