口播ai数字人视频做了二十多期,几个翻车教训
这阵子帮一个做跨境电商的朋友批量出产品口播片,ai数字人视频一口气做了二十多期,从第三期开始我基本摸顺了套路。今天把踩过的坑和现在稳定的流程捋出来给大家看,尤其是提示词写法和背景替换那两步,真不是随便拖进去就能出片的。
口播稿怎么拆才不会让数字人念成机器人
很多人第一次做ai数字人视频,直接把整篇文案丢进去生成,出来的东西像在念课文。我第一期就是这个毛病,一百多字一口气读完,数字人表情从头到尾一个样,观众三秒就划走了。后来我改了个习惯:每三四句话切一个镜头,中间插 0.5 秒静帧或者一个手势过渡。拆法我按下面这个来,每次开工前都过一遍:
- 先按语义断句,一个完整意思不超过 25 字就断一刀,别为了凑镜头硬切
- 每段前面标情绪词:「停顿」「微笑」「点头」「摊手」,这几个词直接写进提示词
- 产品名和关键数字标「重点强调」,生成时数字人会放慢语速、加大手势幅度
我一般一集 90 秒的口播拆成 6 到 8 个片段,每个单独生成再拼到一起。比一次性丢进去效果好太多,至少面部有变化了,不会像 PPT 自动配音那样全程一张脸,看着就舒服。

提示词里加这一句表情自然了一半
生成ai数字人视频的时候,光写「微笑讲述」出来还是太板正。我试了好几种写法,最后发现加一句「镜头感:像对着朋友聊天,偶尔看镜头偶尔看侧面」,出来的面部肌肉松弛很多,不再那么正襟危坐,观感立刻不一样。
还有一个参数我反复调过:语速。默认语速偏快,产品口播我一般把语速拉到 0.85 到 0.9 之间。太快观众跟不上信息密度,太慢又拖沓。我第一期用了默认值,播到一半自己回放都觉得赶,后来统一调了。
说个翻车案例:有次提示词写了「热情洋溢地介绍产品」,出来的数字人嘴角几乎咧到耳根,像个过度热情的电视购物主持人,完全不能看。后来我换成「自然、略带兴奋」,分寸感一下就对了。
背景换完才发现口型对不上
生成完ai数字人视频的口播段,我习惯在剪映里换背景。步骤不复杂:口播轨道和背景素材轨道叠放,选中口播视频,右侧功能区点「智能扣像」把原背景去掉,数字人就浮在素材背景上了。背景轨道的声音关掉就行,不然两段音频会打架。
但有个坑我栽过两次:如果背景素材本身有动态元素,比如水面波动、人群走动,扣像边缘会跟着抖。我第一版用的就是一条海浪视频做背景,数字人下巴那一圈像素每帧都在跳,看着特别假。后来换成纯色渐变或静态棚拍背景,问题就消了。
字幕那步倒省事,选中口播轨道右键「识别字幕/歌词」一键出来,手动改几个错别字就行。封面我一般选数字人正面、嘴微张的那一帧,跑了十期数据下来,比闭嘴帧点击率确实高一些,体感挺明显。
多语言翻译那段我返工了三次
那朋友产品要发东南亚市场,我拿同一版ai数字人视频做了泰语和印尼语版本。平台支持 175 种语言翻译加对口型,听起来省事,但第一次出的泰语版我一看——数字人嘴型跟音节差了两三帧,拖沓感很明显,直接废了。
后来我调整了方法:翻译之后先单独听音频,确认语速和断句没问题,再回去看口型对齐。泰语有升降调,我提示词里加了「语调起伏明显,注意声调变化」,第二版口型就贴合多了。印尼语反而一次过,音节比较平,对口型压力小。
说句实话,这套翻译流程对英语、印尼语这种音节结构跟中文接近的语言还行,碰到泰语、韩语这种音调语言,对口型还是差一口气。我现在泰语版单独重录一版口播音频再手动对口,比 AI 翻译完再修正反而快。
现在出片流程基本定型了
跑了二十多期下来,我现在做一集ai数字人视频从写稿到出片大概两小时:稿子 30 分钟,分镜拆分 20 分钟,生成加微调 40 分钟,剪映合成加字幕封面 30 分钟。比刚上手时五个小时一集快了不止一倍,核心就是别在单步上死磕,拆碎了跑。
工具方面我主要用 HeyGen 做数字人生成,剪映做后期合成和包装。这阵子我常泡在特种猫社区里看别人怎么调提示词,上周有帖子讲用「负面提示词」去掉数字人多余眨眼,我试了确实管用,加上「避免频繁眨眼、避免嘴角不对称」之后面部稳定性好了不少。
要说局限,目前做ai数字人视频这类工具处理单人口播、产品讲解、知识分享已经够用了,但多人同框对话、复杂肢体动作、电影级打光它还差得远。我想做两三个数字人同框聊天的形式,试过拼接,接缝处总有个微妙的不自然,还没想好怎么绕过去。最近这类问题我都在社区里发帖问,有同好在做多人对话的可以一起聊:特种猫社区