AI 漫剧导演:用人工智能讲好每一个故事
上周三深夜,一位学员小鹿在群里发了一条消息:“老师,我用 Midjourney 生成了 200 张分镜图,但拼在一起后,主角的脸每张都不一样,剧情根本连不起来。我这‘导演’是不是当不下去了?”
这条消息瞬间炸出了十几个同病相怜的学员。小鹿遇到的问题太典型了——工具用得很溜,但缺乏“导演思维”。AI 漫剧不是把 AI 生成的图片堆叠成 PPT,而是一门需要叙事逻辑、视觉语言和流程管理的综合艺术。今天,我就用两个实战案例,拆解如何从“会用 AI 画图”进化到“用 AI 讲好故事”。
第一章:从“画手”到“导演”——先解决角色一致性
小鹿的困境,根源在于她跳过了“角色设定”这一步。在传统动画中,角色设定表(Character Sheet)是美术部门的圣经。在 AI 漫剧中,这个步骤同样不可或缺,只是工具从铅笔换成了提示词和模型。
核心工具:Midjourney V6.1 + 角色参考参数(–cref)
操作步骤:
1. 建立角色锚点图(Anchor Image) :不要直接生成“正面站立图”,而是生成一张包含角色脸部特写、半身、全身的三视图。提示词模板如下:
character design sheet, female warrior, 25 years old, silver hair, red eyes,
full body front view, side view, back view, head detail close-up,
white background, studio lighting, Pixar style, 4k --ar 16:9 --v 6.1
记住,一定要在提示词里明确“character design sheet”,并要求“white background”,这样生成的图片背景干净,AI 更容易提取角色特征。
2. 提取角色特征码:将生成的设定图上传到 Midjourney,使用 `–cref` 参数(角色参考)搭配 `–cw 100`(权重 100%)。后续所有分镜生成,都以此图作为“定妆照”:
[分镜描述] --cref [设定图URL] --cw 100 --v 6.1
关键参数:`–cw` 控制角色特征的一致性强度。100 表示严格遵循脸型、发型、服装;如果后续需要换装,可调低至 60-70,但脸部特征依然锁定。
3. 批量生成与筛选:不要一张张生成。利用 Midjourney 的 `–repeat`(批量)参数,一次生成 4 张不同动作的分镜,然后从中挑选构图最符合剧情的一张。例如:
warrior drawing sword, low angle shot, dynamic pose --cref [URL] --cw 100 --repeat 4 --v 6.1
实操案例: 小鹿按照这个方法,重新生成了主角“银月”的设定图。她发现,用 `–cref` 后,银月的脸型、标志性的银色刘海,以及右眼下的泪痣,在 30 张分镜中保持了 95% 以上的相似度。之前“换脸”的问题,迎刃而解。
> 讲师笔记:`–cref` 并非万能。当角色戴头盔、面具,或者有夸张表情时,一致性会下降。此时,可以同时使用 `–sref`(风格参考)锁定画风,双管齐下。
第二章:分镜脚本——用“导演思维”替代“拼图思维”
解决了角色一致,下一个大坑是“剧情不连贯”。很多学员把 AI 漫剧理解为“每张图配一段文字”,结果做出来像带图的朋友圈,缺乏电影感。
核心工具:Notion(或飞书文档)+ ChatGPT / Claude 3.5 Sonnet
操作步骤:
1. 用 AI 生成“导演版”分镜表:不要直接让 AI 写“第一章 相遇”。你要给 AI 一个“分镜表模板”,包含:镜头号、景别(远景/中景/近景/特写)、运镜方式(推/拉/摇/移)、画面内容描述、台词、情绪/氛围、时长。然后输入你的故事梗概,让 AI 按此模板输出。
提示词范例(以 Claude 3.5 Sonnet 为例):
你是一位资深漫剧导演。请根据以下故事梗概,生成一份包含 12 个镜头的分镜脚本。
要求:
1. 严格遵守我提供的分镜表模板。
2. 每个镜头必须有明确的“画面内容描述”,且描述中需包含“主角(银月)”的动作和表情。
3. 情绪转折处,必须用“特写”镜头强调。
4. 台词要口语化,符合角色性格。 故事梗概:[你的故事内容]
分镜表模板:
| 镜头号 | 景别 | 运镜 | 画面内容描述 | 台词 | 情绪 | 时长(秒) |
2. 将分镜表转化为“绘图提示词” :这是最关键的一步。将分镜表里的“画面内容描述”翻译成 Midjourney 能理解的语言。例如,分镜表里写“银月愤怒地拔剑,镜头快速推近她的脸”,你的生成提示词应该是:
extreme close-up of female warrior, angry expression, drawing sword,
motion blur on sword, shallow depth of field, dramatic lighting,
--cref [URL] --cw 100 --ar 16:9 --v 6.1
注意:把“镜头快速推近”转化为“extreme close-up”和“shallow depth of field”,这是 AI 能听懂的语言。
3. 批量生成与故事板组装:将 12 个镜头的提示词全部生成完毕后,使用 CapCut(剪映专业版) 或 Premiere Pro 组装。在剪映中,利用“关键帧”功能,为静态图添加“推拉摇移”的运镜效果,模拟摄影机运动。
实操案例: 我带着小鹿做了一个“3 分钟复仇短剧”的实战。我们用 Claude 生成了 24 个镜头的分镜表,然后逐一转化为 Midjourney 提示词。在剪映中,她给“银月拔剑”的特写镜头添加了“缩放”关键帧,从 100% 放大到 120%,配合音效,瞬间有了电影推镜头的压迫感。整个制作时间,从她之前的 3 天,压缩到了 6 小时。
> 讲师笔记:不要迷信“文生视频”工具(如 Sora),目前它们可控性太差。“图生视频”+ 后期剪辑才是 AI 漫剧工业化生产的正确路径。像 Runway Gen-3 或 Luma Dream Machine,可以对单张关键帧进行 2-4 秒的微动效生成,比如“风吹动发丝”,这比直接文生视频稳定得多。
第三章:声音与节奏——赋予画面灵魂
画面和剧情是骨架,声音是血肉。AI 漫剧的“廉价感”往往来源于干巴巴的配音和缺失的音效。
核心工具:ElevenLabs(配音)+ 剪映(音效库)
操作步骤:
1. 角色音色设定:在 ElevenLabs 中,为每个主要角色创建独立的 Voice。不要用默认音色,要使用 Voice Design 功能,通过文字描述来生成音色。例如:“年轻女性,25 岁,声音清冷,带有一丝沙哑,语速偏慢,适合复仇者角色。”
2. 情绪化配音:不要一次性朗读整段台词。在 ElevenLabs 中,利用 Text-to-Speech 的“情绪标签” (如 `
银月,你逃不掉了! 除非,你愿意付出代价……
3. 音效与 BGM:在剪映的“音频-音效”库中,搜索“剑鸣”、“心跳”、“环境风声”等。关键技巧是:音效要有“提前量” 。在动作发生前 2 帧插入音效,视觉冲击力会显著增强。背景音乐选择“史诗叙事”类,并在情绪转折处通过“自动闪避”功能,压低 BGM 音量突出对白。
总结与进阶建议
从“画手”到“导演”,本质上是思维模式的转变。你需要掌握的是角色锚点(–cref)、导演版分镜表、以及“图生视频+剪辑”的工业流程。这三板斧,能帮你稳定产出 80 分以上的 AI 漫剧。
进阶建议:
- 学习“视听语言” :推荐阅读《电影语言的语法》(丹尼艾尔·阿里洪 著),不用全读,重点看“景别”和“剪辑”章节。
常见问题 FAQ
Q1:Midjourney 的 `–cref` 参数在 V5 版本能用吗?
A:`–cref` 是从 V6 版本开始引入的,V5 及以下版本不支持。请确保你的 Midjourney 订阅计划已升级,并在 Discord 中输入 `/settings` 将版本切换为 V6.1 或更高版本。
Q2:如果角色需要换衣服,但脸不能变,怎么做?
A:将 `–cw` 参数从 100 调低至 60-70。`–cw` 控制特征参考的权重,调低后,AI 会更注重脸部特征,而忽略服装和背景细节,从而实现“换装不换脸”。
Q3:生成的图片分辨率不够,放大后模糊怎么办?
A:使用 Midjourney 的 `–upbeta` 或 `–tile` 参数,或者将图片发送到 Bigjpg 或 Upscayl(免费开源)进行 AI 无损放大。建议首次生成时就使用 `–ar 16:9` 并选择高分辨率模式(如 `–v 6.1` 下的默认质量)。
Q4:剪映的关键帧动画,一张图片只能做一种运镜吗?
A:不是。你可以在一张图片上添加多个关键帧,实现“推-拉-摇”的组合效果。例如:先设置缩放 100% 到 110%(推近),再移动图片位置(平移),最后回到 100%(拉远)。但注意,单镜头时长建议控制在 3-5 秒内,避免运镜过于复杂导致观感眩晕。
Q5:ElevenLabs 免费版够用吗?
A:免费版每月有 10,000 字符的额度,约合 10-15 分钟的对白。对于 3 分钟以内的微短剧够用。如果要做长篇,建议升级至 Starter 计划($5/月),并利用“批量生成”功能一次性合成多角色对白,节省时间。



评论(0)