AI 漫剧从零到一:角色设定、场景构建与分镜编排

上周三深夜,一位学员在群里发了张截图:他用 Midjourney 生成的漫画人物,手指有七根,背景透视歪得像喝了二两。配文是:“老师,我是不是跟 AI 八字不合?”

我回了一句:“你不是不合,是缺了流程。”

三个月后,他的作品《机械城旧事》在 B 站拿到了 23 万播放。同一台电脑,同一个账号,差别只在于他学会了把“灵感”拆解成“工程”。今天,我就把这条从零到一的完整链路拆给你看——不聊虚的,全是能直接上手的参数和命令。

一、角色设定:别让 AI 猜,给它画“体检表”

很多新手喜欢写“一个帅气的少年”,然后抱怨 AI 画出来像路人甲。问题不在 AI,在于你的描述是“感觉”而非“规格”。

第一步:建立角色特征矩阵

打开你的备忘录,按以下五个维度填写:

| 维度 | 示例(以《机械城旧事》主角阿澈为例) |
|——|——|
| 面部结构 | 下颌线锐利,颧骨偏高,左眼下方有一颗泪痣(位置精确到像素点) |
| 发型/发色 | 银灰色短发,右侧刘海遮住半只眼睛,发尾有 3 处翘起 |
| 服装细节 | 旧军装改造的夹克,左袖口有铆钉,右胸口袋翻盖磨损 |
| 标志性配件 | 挂在脖子上的黄铜怀表,表链长度垂到第二颗纽扣 |
| 色彩标签 | 主色 #4A4A4A(深灰),点缀色 #D4AF37(金属金) |

第二步:用 Midjourney 的“角色一致性”技巧

在 Midjourney V6 中,使用 `–cref` 参数(Character Reference)可以锁定角色特征。具体操作:

/imagine prompt: 阿澈站在雨中,抬头看天空,表情坚毅 --cref https://你的角色参考图链接 --cw 100

`–cw`(Character Weight)范围 0-100,数值越高,角色特征越接近参考图。我建议第一次跑设定图时用 `–cw 80`,保留一些随机性让 AI 发挥,之后再逐步收紧到 `–cw 100`。

第三步:生成“角色三视图”

用这个提示词模板:

/imagine prompt: character design sheet, front view, side view, back view, 阿澈, 银灰色短发, 旧军装夹克, 黄铜怀表, 全身, 白色背景, 动画风格, 高清 --ar 16:9

跑出三视图后,选最满意的一张作为后续所有分镜的 `–cref` 基准图。记住:角色设定阶段花 40 分钟,能省下分镜阶段 4 小时

二、场景构建:用“图层思维”替代“整幅描述”

场景是新手最容易翻车的地方。你写“末��废墟”,AI 给你画一堆���石堆,人物站进去像 PS 抠图。正确做法是分层构建

核心工具:Stable Diffusion + ControlNet(版本 1.1.410)

以《机械城旧事》第 3 话的“地下车站”场景为例:

第一层:结构线稿

用 ControlNet 的 `Canny` 模式,先画一张简单的透视草图(哪怕用 Windows 画图都行),传入 SD:

ControlNet 设置:
  • Preprocessor: Canny
  • Model: control_v11p_sd15_canny
  • Control Weight: 1.0
  • 分辨率: 768x432
  • 第二层:空间填充

    在提示词中加入景深关键词:

    prompt: underground train station, abandoned, rusty pillars, flickering fluorescent lights, wet concrete floor, reflections, deep depth of field, cinematic lighting, wide angle, 8k
    negative prompt: blurry, low quality, cartoon, flat lighting, no reflections
    

    第三层:氛围叠加

    用 `–seed` 固定画面后,再通过图生图(img2img)叠加雨雾效果。把 denoising strength 调到 0.35,这样只改变氛围,不破坏结构。

    关于“景深”的关键参数:在 SD 中,`depth of field` 的效果由 CFG Scale 和采样步数共同决定。我推荐 CFG=7,Sampling steps=30,使用 DPM++ 2M Karras 采样器——这是目前在场景质感上表现最稳定的组合。

    三、分镜编排:从“画面”到“叙事”的最后一公里

    分镜不是把漫画格子填满,而是控制读者的视线流动。这里分享一个我总结的 “三拍法”

    第一拍:定镜位(Shot Type)

    | 景别 | 用途 | 提示词关键词 |
    |——|——|——|
    | 极远景 | 建立环境 | establishing shot, aerial view |
    | 中景 | 动作叙事 | medium shot, waist up |
    | 特写 | 情感爆发 | close-up, eyes, tears |

    第二拍:定视角(Camera Angle)

  • 仰拍(low angle)→ 强调权力感
  • 俯拍(high angle)→ 强调脆弱感
  • 过肩拍(over shoulder)→ 增强对话代入感
  • 第三拍:定节奏(Pacing)

    用“图生图”功能做分镜衔接。比如第 2 格是阿澈转身,第 3 格是他发现怀表停了。把第 2 格的图传入 img2img,提示词改为:

    prompt: 阿澈 looking down at pocket watch, shocked expression, close-up on hand, slight camera shake effect
    denoising strength: 0.5
    

    这样两张图之间就有动作连续性,而不是两张独立的画。

    实操案例:用“关键帧”串联 6 格分镜

    假设第 3 话开场需要 6 格:

    1. 极远景:地下车站全景(–ar 16:9)
    2. 中景:阿澈从阴影走出(–cref 角色图)
    3. 特写:怀表表面裂纹(–ar 1:1,用 img2img 从第 2 格生成)
    4. 过肩拍:前方出现人影(–cref 反派角色图)
    5. 仰拍:阿澈握紧拳头(–ar 4:5,低角度)
    6. 俯拍:地面上的水洼倒映出两人对峙(–ar 16:9,高角度)

    每格生成后,用 Photoshop 的“时间轴”功能快速预览动态效果(把相邻两格的透明度交替变化),就能判断节奏是否卡顿。

    分镜编排示例

    四、进阶技巧:从“单张好看”到“系列统一”

    很多学员做到这步就停了,但真正的分水岭在于系列一致性

    技巧一:使用“风格参考”锁定画风

    在 Midjourney 中,用 `–sref`(Style Reference)参数锁定整体风格:

    /imagine prompt: [你的分镜描述] --sref https://你的风格基准图链接 --sw 100
    

    `–sw`(Style Weight)控制风格强度,建议设为 80-100,这样每一格的色彩倾向、笔触质感、光影处理都会保持一致。

    技巧二:建立“场景资产库”

    把常用的背景(车站、天台、雨巷)单独生成,保存为透明背景 PNG。分镜时用 Photoshop 或 Clip Studio Paint 把角色和背景分开操作,最后合并。这比每格都从零生成快 3 倍,而且背景透视完全统一。

    技巧三:用“负面提示词”防翻车

    在 SD 中,负面提示词至少包含:

    negative prompt: extra fingers, deformed hands, bad anatomy, watermark, text, signature, blurry, low contrast, oversaturated
    

    五、总结与学习建议

    回顾一下,从零到一的完整链路是:

    1. 角色设定:特征矩阵 + Midjourney `–cref` 锁定
    2. 场景构建:ControlNet 分层 + SD 参数微调
    3. 分镜编排:三拍法 + img2img 过渡 + 关键帧串联
    4. 系列统一:`–sref` 风格锁定 + 资产库复用

    给新手的三个建议:

  • 先做 3 页短篇,不要一上来就挑战 30 页连载。短篇能让你完整走完流程,又不至于在中期崩溃。
  • 每次生成都存档,包括提示词、参数、seed 值。建立自己的“配方库”,下次遇到类似场景直接调用。
  • 每周做一次“拆解练习”:找一页你喜欢的漫画,逆向推导它的景别、视角、光线方向,然后用 AI 复刻。这是提升最快的方法。
  • AI漫剧工作流

    常见问题 FAQ

    Q1:为什么我用 `–cref` 后角色脸还是变了?
    A:大概率是 `–cw` 值太低。先检查是否低于 80,其��确认参考图本身是正脸且光线均匀。如果用的是三视图,建议裁出正面那张单独做参考。

    Q2:ControlNet 的 Canny 模式画出来线条很乱怎么办?
    A:把 Canny 的 `Canny Low Threshold` 调到 50,`Canny High Threshold` 调到 150,只保留主要轮廓。另外,草图建议用粗线条画,细碎线条会被 AI 误读为结构。

    Q3:分镜之间人物动作不连贯,像跳帧?
    A:用 img2img 过渡时,`denoising strength` 控制在 0.3-0.5 之间,太低会复制原图,太高会变成新图。另外,提示词里加上 `same pose` 或 `slight movement` 能帮助 AI 理解是“延续”而非“重画”。

    Q4:生成 6 格分镜,每格风格都不一样怎么办?
    A:用 `–sref` 锁定风格,同时把所有分镜的 `–seed` 值设为同一个数字(比如 12345),这样基础噪声一致,画面质感会更统一。

    Q5:一张图里有多个人物,怎么保证他们各自特征稳定?
    A:目前最稳妥的方法是用“分图层”思路:先单独生成每个人物,再在 Photoshop 里合成。如果非要一次生成,把每个人物的特征描述放在提示词的不同段落,用 `::` 分隔,例如:`阿澈:: 银灰短发 旧夹克 :: 反派 黑色风衣 金属面具`。

    最后送你一句话:AI 漫剧不是“让 AI 替你画”,而是“你当导演,AI 当摄影组”。 导演的价值在于决策,不在于握笔。把今天这套流程跑通三遍,你就能从“生成图片”升级为“创作故事”。如果过程中卡住了,欢迎在评论区留言,我会挑典型问题在下期拆解。

    声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。