AI 漫画创作全流程:从分镜脚本到成图生成
上周有位学员找到我,说他想用AI做一部10页的短篇漫画,但试了Midjourney和Stable Diffusion后,发现生成的单张图片很漂亮,可一旦放到一起,角色长相不统一、场景风格跳跃、分镜逻辑混乱——完全没法成“漫画”。
这个问题太典型了。AI绘画工具在单图生成上已经足够惊艳,但漫画创作是系统工程:你需要保持角色一致性、控制分镜节奏、统一画面风格,还要让对话框里的台词与画面匹配。今天我就把这套“AI漫画全流程”拆解给你看,从分镜脚本到最终成图,每一步都有具体工具和参数。
一、分镜脚本:AI漫画的“骨架”
很多新手直接跳进AI生图,这是最大的坑。没有分镜脚本,AI就像没剧本的演员——演得好但演不对。
1.1 用GPT-4o生成分镜文本
我习惯先用GPT-4o(版本2024-05-13)生成分镜草稿。不是让它直接写“第1格主角出场”,而是给它一个结构化的提示词模板:
你是一位漫画分镜师。请根据以下故事梗概,生成10格分镜脚本。
每格包含:镜头编号、景别(远景/中景/近景/特写)、画面描述、台词/旁白。故事梗概:[粘贴你的故事]
要求:
- 第1格建立场景
第3格出现冲突
第7格高潮反转
每格描述不超过50字,便于后续翻译为英文提示词
举个例子,我让学员测试一个“地铁奇遇”故事,GPT-4o输出:
| 编号 | 景别 | 画面描述 | 台词 |
|——|——|———-|——|
| 1 | 远景 | 傍晚地铁站台,人群拥挤,主角站在边缘 | 旁白:城市的地铁,每天都在上演擦肩而过 |
| 2 | 中景 | 主角低头看手机,余光瞥见对面站台的女孩 | – |
| 3 | 近景 | 女孩抬头,两人目光交汇,背景虚化 | 主角内心:等等,这张脸…… |
拿到这个表格后,下一步才是AI生图。但注意:GPT-4o生成的描述是中文,不能直接喂给Midjourney,需要做一次“提示词翻译”。
1.2 分镜转提示词的关键技巧
把“傍晚地铁站台,人群拥挤,主角站在边缘”翻译成英文提示词时,不能直译。我总结了一个模板:
[构图关键词] + [主体描述] + [环境细节] + [风格参数] + [灯光氛围]
对应上面第1格:
Wide shot, evening subway platform, crowded commuters, a young man standing at the edge, warm orange streetlights, cinematic lighting, manga style, line art, black and white with gray tones --ar 3:4 --v 6.0
这里的关键��数:
—
二、角色一致性:AI漫画最大的痛点
生成单张图容易,但要让主角在10张图里长得一样,需要一套“角色锚定”方法。
2.1 用Midjourney的“角色参考”功能
Midjourney 6.0新增了`–cref`参数(Character Reference),这是目前最实用的方案。
第一步:生成角色初始形象
先单独生成一张主角定妆照:
young Asian man, short black hair, round glasses, casual hoodie, front view, clean expression, manga style, line art --ar 3:4 --v 6.0
选一张最满意的,下载到本地,命名为`character_base.png`。
第二步:在分镜中引用角色
生成第1格时,上传`character_base.png`作为角色参考:
[原提示词] --cref [图片URL] --cw 50
参数说明:
实测效果:我让学员用这套方法生成同一角色的5个不同分镜,面部识别度从30%提升到85%。失败案例大多是因为`–cw`值过高,导致角色表情僵硬——漫画需要夸张表情,所以特写时我建议`–cw 40`,保留AI的自由度。
2.2 备用方案:Stable Diffusion + ControlNet
如果Midjourney的`–cref`效果不理想(比如侧脸或遮挡),可以用Stable Diffusion WebUI(1.8.0版本)配合ControlNet插件。
安装ControlNet模型:`control_v11f1e_sd15_seer.pth`(IP-Adapter模型,专门处理角色一致性)
操作步骤:
1. 在Stable Diffusion中加载角色图片到ControlNet
2. 选择预处理器:`ip-adapter_face_id_plus`
3. 模型:`control_v11f1e_sd15_seer`
4. 权重:0.8(太高会完全复制原图表情,太低会丢失特征)
然后写提示词时,加上角色名字和特征:
(main character:1.2), young Asian man, short black hair, round glasses, hoodie, [分镜动作描述]
这里的`(main character:1.2)`是权重标记,告诉模型这个角色是主角,需要保持特征。
—
三、成图生成与后期排版:从单图到漫画页
分镜和角色搞定后,最后一步是批量生成和排版。
3.1 批量生成策略
不要一口气生成10张图。我建议分3轮:
第1轮:生成所有分镜的草稿版
用最低分辨率(`–v 6.0`默认512×512),快速验证分镜和角色。这一步可能失败3-5张,没关系,调整提示词后重试。
第2轮:锁定风格,重新生成
确定所有分镜通过后,统一风格参数。比如我常用:
--style raw --s 50 --stylize 250
第3轮:生成高分辨率版
用`–upbeta`或`–turbo`参数快速升分辨率:
[原提示词] --ar 3:4 --v 6.0 --upbeta
`–upbeta`是MJ 6.0的新功能,比手动放大快2倍,画质损失很小。
3.2 用Photoshop(或Canva)排版
生成所有单图后,需要用排版工具组合成漫画页。我推荐Canva(免费版即可),因为它的模板库有现成的漫画布局。
操作步骤:
1. 在Canva中新建项目,尺寸A4(210mm x 297mm)
2. 搜索“漫画布局”模板,选一个3×3或2×4的网格
3. 把AI生成的图片拖入对应格子
4. 添加对话框:Canva左侧菜单“元素”→“形状”→选“气泡”
5. 输入台词,字体选“Comic Sans MS”或“Manga Temple”(免费漫画字体)
关键技巧:AI生成的图片边缘可能不整齐,用Canva的“裁剪”工具统一为3:4比例,然后加2px白色边框,这样排版后更干净。
—
四、实操案例:10页短篇漫画《地铁迷途》
为了让你看到完整流程,我用一个学员的真实案例演示。
案例背景
故事:主角陈默在地铁上遇到一个神秘女孩,女孩每次出现都会让他想起一段丢失的记忆。
分镜脚本(GPT-4o生成,已翻译为英文提示词):
| 格号 | 景别 | 英文提示词 |
|——|——|————|
| 1 | 远景 | Wide shot, subway train arriving, platform crowd, evening light, manga style |
| 2 | 中景 | Medium shot, Chen Mo sitting in train, looking out window, reflection in glass |
| 3 | 近景 | Close-up, girl’s face, mysterious smile, soft light, blurred background |
执行过程
第1步:生成角色定妆照
用提示词生成陈默:
young Chinese man, 28 years old, short black hair, sharp eyes, casual denim jacket, front view, manga style, line art --ar 3:4 --v 6.0
选图后保存为`chenmo_base.png`。
第2步:生成女孩定妆照
young Chinese girl, 22 years old, long black hair, white dress, ethereal vibe, front view, manga style --ar 3:4 --v 6.0
保存为`girl_base.png`。
第3步:生成分镜图
以第3格为例,上传`girl_base.png`:
Close-up, mysterious smile, soft light, blurred background, manga style, line art --cref [girl_base URL] --cw 40 --ar 3:4 --v 6.0
生成4张变体,选一张笑容最自然的。
第4步:排版
在Canva中,用“漫画-悬疑”模板(深色背景+白色气泡),把10张图按分镜顺序排列。注意:第3格和第7格是高潮,放大图片尺寸,占2格宽度。
结果
10页漫画从分镜到成图,总耗时约4小时(包括修改)。学员反馈:角色一致性在8张图中保持良好,2张侧脸图有细微偏差,用Photoshop手动调整了眼睛位置。
—
总结与进阶建议
这套流程的核心是:分镜先行 + 角色锚定 + 批量生成。记住三个关键数字:
进阶建议:
1. 学习漫画分镜理论:推荐《理解漫画》(Scott McCloud),理解“格与格之间的时间跳跃”
2. 尝试ComfyUI工作流:如果Midjourney不够用,ComfyUI(1.5.0版本)可以搭建“角色一致性节点”,用IP-Adapter+ControlNet双保险
3. 积累提示词库:每次成功案例,把提示词、参数、失败原因记录下来,3个月后你就有自己的“漫画提示词手册”
—
常见问题 FAQ
Q1:Midjourney生成的图片总有“AI味”,线条太干净,怎么办?
A:加`–style raw`减少美化,同时在提示词里加`rough sketch, hand-drawn texture`。如果还不满意,生成后导入Photoshop,用“滤镜→纹理→颗粒”加噪点。
Q2:角色在远景中完全认不出来,怎么解决?
A:远景中角色占画面比例小,`–cref`效果会减弱。建议远景时用`–cw 50`(比默认高10),同时提示词里强调角色特征,如`(red scarf:1.3)`——用显眼配饰辅助识别。
Q3:对话框里的文字和画面不匹配,怎么办?
A:这是分镜阶段的问题。在GPT-4o生成分镜时,要求它“台词必须与画面动作对应”。比如“主角惊讶”的画面,台词不能是“今天天气真好”。如果AI生成后不匹配,手动调整对话框位置和文字。
Q4:生成10张图,风格不一致,有的偏写实,有的偏卡通,怎么统一?
A:所有分镜用同一组风格参数。我建议固定`–style raw –s 50 –stylize 250`这组参数。如果某张图跑偏,检查提示词里是否混入了`photorealistic`或`oil painting`这类冲突关键词。
Q5:免费工具有替代方案吗?
A:有。Stable Diffusion WebUI完全免费,但需要显卡(至少6GB显存)。如果电脑配置不够,用Google Colab免费版跑SD XL模型。角色一致性用ControlNet的IP-Adapter,效果接近Midjourney的`–cref`。

评论(0)