特种猫社区
灌水茶馆

用ai视频生成做了条三分钟短剧,说点踩坑心得

发布于 2026-08-17 · 18 浏览

这阵子接了个活儿,给一个小品牌做条三分钟的产品故事短片,要求用 ai视频生成 跑画面、自己配旁白和剪辑。我平时主要做单镜头的 B-roll,突然要连起来讲完整故事,前两条片子全废了。今天把踩过的坑和最后跑通的流程写出来,省得你们再走一遍弯路。

怎么把分镜拆顺

我一开始犯的错是贪心,一个镜头想让它跑十五秒以上,结果 ai视频生成 出来的东西到后半段就开始飘,人物走形、背景跳。后来我把三分钟拆成大概十九个镜头,每个控制在八到十二秒,每段生成的容错空间就大很多。分镜表我直接拿 Excel 写的,每行一列镜头号、一列景别、一列动作、一列情绪关键词,看着土但确实管用。

景别分配上我有个经验:特写和近景别超过五个,不然观众盯太久脸会腻。全景和远景穿插着来给节奏留气口。还有一个细节,相邻两个镜头景别差距别拉太大,从大特写直接跳大远景,观众会恍惚,中间最好垫一个中景过渡,我前两条废片就是栽在这。

说到拆镜头,我建议在特种猫社区里搜一下别人发的分镜模板。我当初看了一个做悬疑短剧的帖子,他那个表把「视线方向」单独列了一列,我才意识到这个字段对 ai视频生成 的镜头衔接有多关键。以前我全靠手感,现在每次下笔之前先把视线对齐了再写动作,返工少了一半。

用ai视频生成做了条三分钟短剧,说点踩坑心得

提示词这块我重写了好几遍

第一版提示词我写得很「文学」,什么「金色夕阳下她缓缓转身,眼里映着远处的海」,ai视频生成 出来人物是转了,但海变成了一堵墙,夕阳颜色也对不上。后来我改成纯描述性指令,固定成五层结构,写的时候跟填表一样,下面这套我用了快两个月了:

  • 景别加机位:中景 / 过肩 / 俯视,镜头固定或缓慢推进,别写「电影感运镜」这种虚词
  • 主体:人物外貌三四个关键词,「黑色长发、白色连衣裙、高马尾」够了,别堆形容词
  • 动作:一个主动作加最多一个副动作,用「缓慢」「微微」控制幅度,别写连续三个动作
  • 背景环境:具体到物件,「旧木桌上一杯冒热气的茶」比「温馨室内」管用十倍
  • 光线色调:一句话带过,「侧光,冷蓝调」就行,写三段反而让它顾此失彼

有个坑必须说:连续三个镜头都是同一个人时,提示词里人物描述必须一字不差地复制。我有一次把「高马尾」写成「束发」,生成出来发际线位置就变了,剪在一起肉眼可见地跳。现在我的习惯是建一个「角色卡」,所有镜头共用同一段描述,改一处全部同步改,别图省事。

生成出来对不上的时候怎么办

ai视频生成 最让我崩溃的不是生成不出来,而是出来了但不太对。有一回我写「他推门进去,桌上没有人」,出来六条里有两条桌上坐了个人,还有一条门没推开人直接穿过去了。我的处理是:先别急着重跑,把六条全部看完,有时候你只需要中间三四秒,剪掉头尾废的部分就能用,别一上来就删掉。

如果六条全废,我就拆动作。「推门进去」太复合了,拆成两个镜头:第一个只拍手握住门把手往后推,第二个拍门开了之后他走进去。分别生成,剪辑时用 0.3 秒叠化接起来,观众根本注意不到。拆了之后每条命中率从大概三成提到了七成,虽然多跑了一轮生成,但省下来的返工时间远比这多。

素材宁多勿少。一个镜头我通常生成八条而不是五条,因为 ai视频生成 的随机性比你想象的大,同一条提示词跑两次构图可能差很远。我在特种猫社区发帖问过「你们一个镜头跑几条」,大部分人回六到十条,最夸张的一个哥们跑到二十条才挑出能用的。多出来的不一定用得上,但挑的时候有得挑,心态就不焦躁。

剪辑节奏和素材衔接

素材跑完真正花时间的其实是剪辑。三分钟成片我剪了四个半小时,其中两个半小时间在调节奏。ai视频生成 出来的每段都是独立运镜,接在一起容易有跳切感,尤其两个镜头都是固定机位的时候。我处理衔接基本靠下面几条规则:

  • 相邻镜头运动方向一致(都是左到右):直接硬切,干净利落,别加多余转场
  • 方向相反:加 0.2 秒交叉溶解,别超 0.3 秒,长了画面会糊成一片
  • 情绪要转:插 2 到 3 帧黑场,或者切一个 1.5 秒的环境空镜做缓冲
  • 同人物不同景别衔接:前一个镜头的出画方向必须等于后一个镜头的入画方向

配乐和旁白我是最后才铺的,不是先剪画面再贴声音。原因是 ai视频生成 的镜头时长很难精确控到秒,你按十五秒设计配乐,剪完实际十四秒八,全部对不上。我的顺序是:画面粗剪定节奏,录旁白,根据气口微调入出点,最后铺 BGM。BGM 我选没有明显鼓点的,鼓点一响就要跟画面对齐,没对上特别刺眼,用柔和的弦乐或钢琴安全很多。

这阵子还在头疼的事

说点不中听的。现在 ai视频生成 在单镜头质量上进步确实明显,但多镜头人物一致性还是老大难。我这条片女主换了三次服装,每次换装都得重新生成一整套提示词,脸还是有细微差别,尤其下巴和眉骨。目前的缓解手段是换装前先生成一张参考图喂进去,比纯文字稳一些,但也只是一些,做不到照片级一致。

长镜头运镜控制也是。我想做缓慢环绕跟拍,提示词写了 camera slowly orbits around subject,出来十次七次是正面固定机位,另外三次绕着绕着人直接没了。这个场景我现在基本放弃硬做,改成两张不同角度的人物图中间用 Keyframe 过渡模拟环绕,出来效果反而自然,就是多了一步手动操作。

如果你之前一直做单镜头的 ai视频生成 内容,想转做连续叙事的短剧,建议先拿三十秒的练手片把整套流程跑一遍,别上来就冲三分钟,分镜、提示词、剪辑三块哪块卡住都够你耗一个下午。有具体问题可以来 特种猫社区 发帖问,我平时也在,看到能答的就回。

全部回复 0
登录后即可回复参与讨论…去登录 →
相关主题