用AI跑了一集漫剧,分镜提示词踩了两周坑
这阵子想把自己那个三话漫剧脚本跑成成片,翻了十几篇ai短剧漫剧制作教程,结果发现大部分都停在"输入提示词、出图、剪视频"这个层面,真正卡人的分镜衔接、镜头语言、角色一致性压根没展开讲。我在特种猫社区蹲了两周,把跑通过的流程整理出来,算是给自己做个记录,也给同样在折腾的人一个参考。
怎么把分镜拆顺
很多教程讲ai短剧漫剧制作教程的时候,分镜这一步就一句"按剧本拆"带过去了。实际操作里,你面对的可能是一个30秒的场景,里面有对话、有动作、有情绪转折,直接让AI一口气出完,出来的东西基本没法用。我的做法是先写文字分镜表,一个镜头一行,标注景别(远景、中景、近景、特写)、镜头运动(固定、推拉、跟拍)、角色动作和台词,全部落字。
然后每一行对应的提示词单独写,别贪多,一行塞太多东西AI会顾此失彼。我一般一个分镜就对应一个生成任务,时长控制在2到3秒,这样出图质量最稳。如果一段对话超过15秒,我会硬拆成4到5个短镜头,靠剪辑节奏和音效去撑,而不是硬凑一个长镜头让画面糊掉。
这里有个具体参数:我用的生成设置是16:9画幅、512×288分辨率起步,先跑小图看构图和角色位置对不对,确认没问题再放大到1280×720出成片。小图阶段试错成本很低,改个提示词重跑也就十几秒的事,比直接出大图翻车后再从头再来省心太多了。

提示词里最容易翻车的几个地方
很多ai短剧漫剧制作教程会提醒你"提示词要简洁",但简洁到什么程度、哪些词能砍哪些绝对不能砍,基本没人细说。我前两周翻的教程里,有七八个给了示例提示词,但全是那种"一个美丽的少女在花园里"的泛泛写法,拿到实际分镜里根本用不了,你得自己拆出结构来。
第一个坑是角色描述里塞了太多形容词,什么"精致的五官、柔顺的长发、水灵的大眼睛",堆在一起AI反而会给你一个很泛化的脸,跟上一镜头完全对不上。后来我改成只写两个最关键的视觉锚点,比如"短发、圆框眼镜",其他交给整体风格关键词去控制,出图一致性立刻好了很多。
第二个坑是场景和角色混在一条提示词里写。我一开始习惯写"一个穿校服的少女站在樱花树下微笑,背景是黄昏的校园",结果AI经常把背景里的樱花画成前景,人物被遮挡。后来我学乖了,提示词结构固定成:主体描述加动作加表情,然后单独一句写场景和光线,用逗号隔开但分成两个语义块,出图干净了不少。
第三个问题其实最隐蔽,就是镜头语言的术语AI根本听不懂。你写"荷兰角仰拍,浅景深,85mm镜头感",它大概率忽略后半句,出来的跟正常平视没区别。我现在的做法是只保留AI真正能理解的视觉描述词,把那些专业术语全砍掉:
- 景别直接写英文"close-up""medium shot""wide shot",别写中文,识别率高很多
- 光线用"golden hour""backlit""soft diffused light"这类词,出图氛围稳定性明显比中文描述好
- 镜头运动基本别指望AI做,留到剪辑里用缩放和位移去模拟,别在提示词里白占字数
角色一致性这一步我卡了最久
做漫剧最头疼的就是同一角色跨镜头不能变脸。我试了大概有二十来次才摸出个相对靠谱的路子。核心思路是:给角色建一张"身份证",把最核心的三到四个视觉特征用固定英文短语锁死,每个分镜提示词里原封不动地贴进去,一个字都别改。
我那个女主的身份证长这样:a 22-year-old East Asian woman, short black hair with bangs, round silver-framed glasses, white lab coat。就这五个短语,从第一帧到最后一帧一个字不动。背景、光线、动作随便变,但这五个短语是底线。有一次我手欠把 short black hair 改成了 black hair tied back,出来直接换了个人,白跑三轮,再也不敢动了。后来我干脆把这段英文存成文本片段,每次复制粘贴,不给自己留手改的空间。
说到ai短剧漫剧制作教程里很少提的一点:角色一致性不只是脸的问题,体态比例、服装褶皱的走向也会影响观众对"是不是同一个人"的判断。我后来发现,固定一个基础姿态(比如 standing, facing slightly left)比固定一堆面部细节更管用,因为AI在身体结构上的漂移比面部更严重。这个经验在特种猫社区里也有人分享过,我拿自己的角色验证了一下,确实如此,身体姿态的锚定效果比多写两个五官形容词强得多。
成片拼接和节奏感
分镜图全跑完之后,拼成片其实比想象中更考节奏。我用的剪辑逻辑是:每个镜头的停留时间跟它承载的信息量挂钩,纯表情特写1.2到1.5秒够了,带对话的中景给3到4秒,转场用的远景或者空镜压到0.8秒当呼吸点,别每个镜头都拖,观众会走神。
音乐和音效别最后才加,我在分镜阶段就会标注"这个镜头要配什么音效",比如翻书声、门轴声、脚步声。AI生成的画面本身没有声音,如果你等到剪完才想"这里该配什么",很容易漏掉节奏点。我现在的习惯是写分镜表的时候最后一列就是音效备注。特别是那种三到四句连续对话的段落,如果每句之间都加一个呼吸停顿,整段节奏会拖,不如让台词咬得紧一点,在段落末尾再给一个0.5秒的静默。
还有一个容易忽略的点:ai短剧漫剧制作教程里很少讲转场怎么衔接。我试了几种方法,最稳的是用"匹配剪辑",上一个镜头的结尾构图跟下一个镜头的开头构图在视觉上有一个共同元素,比如上一帧是角色手部的特写,下一帧直接切到另一只手接住东西的画面。硬切加音效比花哨转场管用,别整什么光效粒子那种,观众会觉得廉价,节奏也断了。
跑完这三话大概花了两周,中间废掉的素材比成品的多。如果你也在找ai短剧漫剧制作教程,我建议别光看文字教程,去实际跑几个分镜试试,踩一次坑比看十篇攻略都记得牢。我这些零散的参数和踩坑记录都发在特种猫社区了,有同款问题可以直接去翻,也欢迎回帖交流你跑出来的效果。