ai动漫制作跑了两周,分镜和提示词踩坑实录
最近手上有个存了半年的八集剧本,每集两分半钟,本来想外包做二维,报价一集八千我直接关页面了。转念一想这阵子ai动漫制作工具迭代得确实快,我干脆自己折腾。从第一版"人形贴图飘在空中、背景像没加载完"的鬼样子,到现在朋友看完没骂人、还问在哪播的程度,中间反复跑了大概两周。
今天把分镜拆分、提示词调参、角色一致性这几个我卡最久的环节拎出来聊,都是实际跑出来的经验,不是那种看完觉得"有道理"但下次上手还是不会的泛泛之谈。有些地方我绕了弯路才想明白,就一起说了。
分镜别整段丢进去,一镜一镜拆
我一开始图省事,把一整集的对白和动作描述直接贴进去让它出分镜,出来的东西完全是"导演脑补版"——我写"他转身看向窗外",它给我整了个"他背对镜头仰望星空"。后来学乖了,做ai动漫制作这步最核心的是把分镜拆到"一个镜头一条提示词"的粒度,别指望它替你理解叙事节奏。具体拆法我前四集一直在试,到第五集才固定下来:
- 每集剧本按"镜头切换点"手动切成14到18个分镜,每个分镜写清景别(全景/中景/特写)、角色动作、身体朝向、背景核心元素
- 每条分镜提示词控制在40到60个英文词,超过60词它就开始自由发挥,景别和朝向全飘
- 相邻分镜之间加一句"maintain same light direction and character orientation as previous shot",否则它每帧重新理解光源,背景色调会跳
拆到16个分镜那集,我光写提示词就花了四十分钟。说实话刚开始做ai动漫制作的时候我特别抗拒这种手动拆的活,觉得这 defeats the purpose of using AI。但跑完六集之后发现,前期拆得越细后期返工越少,省下来的时间远比你多花的那四十分钟多得多。

提示词我改了三版,第二版差点把我搞崩
第一版提示词我写的是"anime style, a young man with black hair wearing a white shirt, standing in a room",出来的脸每一帧都不一样,发型一会儿翘一会儿塌。第二版我急了,堆了一串外貌词:"consistent character design, same facial features, 3:4 eye ratio, sharp jawline",结果它把"sharp jawline"理解成了一张刀脸,全剧角色跟换了个画师似的。我在那版上耗了一整天,越改越歪。
第三版我换了思路:不再用纯文字描述五官,而是先跑一张"角色定妆图"锁住外貌,之后每个分镜提示词里只写动作、场景、情绪,外貌部分直接引用定妆图。这个思路在ai动漫制作圈里已经有人摸出来了,我在特种猫社区里看到有人分享过这个"锚定图加动作词"的拆法,跟着试了一集,确实比纯文字描述稳很多。
- 定妆图用固定 seed 跑,我用的 42 和 108 两个 seed 交替出图,避免同一张脸反复用太死板
- 动作提示词格式固定为"character from reference, [动作短语], [场景], [镜头角度], [情绪词]",别把外貌词混进动作句里
- 负面提示词务必加"multiple people, extra limbs, deformed hands, blurry face, inconsistent hair",不然十帧里能有两三帧手指是多出来的
角色一致性,说白了就是半手动
说句实话,目前ai动漫制作在角色一致性上还是有硬伤。你哪怕提示词写得再精确,连续出二十帧,发色飘个半度、瞳色从琥珀变成灰蓝这种事太正常了。我最后放弃"全自动"的执念,改成半手动:先用定妆图锚定法把每集16帧关键帧跑出来,大概12帧能直接用,剩下4帧脸不对的单独重跑。
重跑那几帧我的方法是拿最接近的一帧做底图,只改提示词里的情绪词——比如把"calm expression"换成"slightly frowning, tension in jaw"——然后单独出图,剪辑时跟AI帧混排。正常播放速度下观众基本看不出哪帧是手动补的。
有个坑必须说:一集里超过三个角色同框,一致性基本就崩。我第三集有个三人对话场景,跑了六版还是有两个人的衣服颜色在帧间漂移。这也是ai动漫制作目前比较明显的短板——多角色场景下模型对每个角色的注意力会互相抢,你越强调A的特征B就越容易跑偏。我最后咬牙把那个场景拆成三个单人镜头用剪辑过渡,硬省了两天时间。
别信一键成片,节奏得自己一刀刀切
工具能帮你把单帧或短镜头跑出来,但"一键成片"太容易让人产生错觉。我第一版直接按分镜顺序拼,时长全是默认两秒一镜,看下来跟PPT翻页似的,发出去两个朋友都说"像没剪完"。
后来全导进剪辑软件自己切,才发现做ai动漫制作后期节奏比前期生成更重要——观众对"节奏不对"的敏感度远高于"某一帧脸歪了半度"。我定了几条剪辑规则,跑了八集基本没改过:
- 对话镜头给3到4秒,纯留白给1.5秒,动作镜头1到1.5秒,别一律两秒,那个时长是工具默认不是人眼舒适
- 转场全部用硬切加音效,别用淡入淡出,动漫里花哨转场比没有还拉
- 背景音乐用了85 BPM的lo-fi track,比工具默认配的史诗感BGM贴合两分钟短剧的节奏得多
剪完回看,第二集有个情绪转折——角色从笑到沉默那个镜头——AI生成的笑太标准了,像念台词。我把那帧重跑,提示词加了"smiling but eyes are empty, subtle tension in shoulders",表情一下就对了。这种细节工具替你做不了,得一帧帧盯。
八集全部剪完导出,总共花了大概十四个工作日,跑生成和调参占一半,另一半全在改提示词和剪节奏。说句公道话,这套流程对一个人做两分钟以内的短集完全够用,成本就是时间。但如果你要做三十分钟以上的长篇、或者同框角色超过三个,现阶段还是得配合传统软件做大量修正,别硬撑。
我自己也是边做边学的,有几个提示词模板和分镜拆法的笔记发在了特种猫社区的教程区,你们要是也在做ai动漫制作、卡在某一步,可以去翻翻或者直接在那边发帖问,回复还挺快的。