AI 漫剧从零到一:角色设定、场景构建与分镜编排

上周有位学员小林私信我,他花了整整三天用 Midjourney 生成角色图,结果所有角色表情僵硬、服装细节混乱——女主角的裙摆在第一帧是红色,第三帧变成了蓝色;男主角的剑在特写镜头里消失了。他发来截图时,我一眼就看出问题:没有建立角色一致性系统,也没有用分镜逻辑反推视觉设计

这不是个例。80%的AI漫剧新手都卡在“每张图很惊艳,连起来像拼贴画”的阶段。今天我会用两个完整案例,带你把角色、场景、分镜三个模块串起来,用 ComfyUI + Stable Diffusion 3.5 和 Midjourney v6 完成一套可落地的漫剧工作流。

一、角色设定:用“三锚点法”锁定视觉一致性

许多教程教你把角色描述写进提示词就完事,这恰恰是混乱的根源。AI模型对“一个穿红裙的黑发少女”每次生成都会不同——刘海弧度、瞳孔颜色、衣领褶皱全在随机漂移。

我的做法是“三锚点法”:

1. 锚点一:角色特征卡(硬约束)
在 ComfyUI 中加载 ControlNet 的 IP-Adapter 模块,用一张参考图锁定发型、脸型、服装结构。参数设置:
– 模型:`ip-adapter-faceid-plusv2_sd15.bin`
– 权重:0.8(太高会复制背景,太低会丢失特征)
– 触发时机:第5步开始介入(避免前期构图被过度约束)

2. 锚点二:动态提示词模板(软约束)
将角色特征写成固定前缀,每次生成时只修改动作和表情。例如:

   [角色模板] A young woman with waist-length black hair, red qipao with gold embroidery, jade earrings, pale skin, determined expression, [动作描述],[场景描述],cinematic lighting, 8k, --ar 16:9
   

3. 锚点三:表情库预生成
用 Midjourney v6 的 `–style raw` 参数生成同一角色的 12 种表情(喜、怒、哀、惊、思、疑等),保存为种子图。后续分镜中遇到情绪变化,直接调用对应种子图做图生图,而不是重新写提示词。

实操案例:古风仙侠女主“青璃”

  • 第一步:用 Midjourney v6 生成初始形象图:

`/imagine prompt: Anime style female warrior, long blue hair, white hanfu with cloud patterns, golden eyes, serious expression, full body shot, –ar 3:4 –v 6.0`

  • 第二步:将这张图拖入 ComfyUI 的 Load Image 节点,连接到 IP-Adapter 模块。
  • 第三步:写动作提示词时,保持前缀不变:
  • `[角色模板] 青璃,手持长剑,侧身站立,衣袂飘动,竹林背景,动态模糊,–ar 16:9`

    角色一致性对比:左为无锚点生成的混乱角色,右为三锚点法生成的统一角色

    二、场景构建:从“写提示词”升级到“搭积木”

    很多学员喜欢写“一个华丽的宫殿”,结果生成的是金碧辉煌但空无一物的大厅——没有人物活动空间,没有镜头调度可能。正确做法是:把场景拆解为可复用的功能模块

    场景构建三要素:

    | 模块类型 | 功能 | 生成工具 | 参数要点 |
    |———|——|———|———|
    | 底图层 | 空间结构(房间/街道/自然) | Midjourney v6 | `–no people, furniture` 排除干扰 |
    | 道具层 | 可交互物体(桌椅/武器/法器) | DALL-E 3 | 单独生成,用 `–background transparent` 抠图 |
    | 氛围层 | 光线、天气、粒子特效 | ComfyUI + AnimateDiff | 用 LoRA 控制雨雪/火焰/光晕 |

    实操案例:仙侠世界“天机阁”大殿
    1. 生成底图
    `/imagine prompt: Ancient Chinese palace interior, towering pillars with dragon carvings, jade floor, misty atmosphere, empty, cinematic wide shot, –ar 16:9 –v 6.0`
    2. 生成道具
    `/imagine prompt: Floating orb of blue energy, glowing, surrounded by runes, isolated on white background, –ar 1:1 –v 6.0`
    3. 在 ComfyUI 中合成
    – 用 Image Composite 节点将道具叠加到底图
    – 用 ControlNet Depth 节点保持透视一致
    – 添加 Gaussian Blur 模拟景深

    4. 氛围增强
    加载 AnimateDiff 的 `v3_sd15_adapter.ckpt`,添加飘浮的粒子效果,参数:
    – 运动强度:0.4
    – 粒子密度:0.6
    – 颜色:`#87CEEB`(天蓝色)

    天机阁场景构建流程:底图→道具叠加→氛围光效

    三、分镜编排:用“动作链”替代“单帧堆砌”

    分镜最大的坑是“想到哪画到哪”。学员小林的另一问题:角色在 A 帧向左看,B 帧向右看,C 帧又回到左边——镜头跳轴导致观众眩晕。

    分镜编排核心原则:180度法则 + 动作连续性

    操作步骤:

    1. 绘制分镜脚本(手绘/文字)
    用 Excalidraw 或 Procreate 画出关键帧草图,标注镜头运动方向。例如一段打斗戏:
    – 帧1:中景,男主从右向左挥剑(镜头在右侧)
    – 帧2:特写,剑刃碰撞火花(镜头保持右侧)
    – 帧3:全景,两人交换位置(镜头切换到左侧)

    2. 用 ComfyUI 的 Batch Processing 批量生成
    – 创建 Workflow:Load Checkpoint(SDXL)→ IP-Adapter(角色锚点)→ KSampler(步数25,CFG 7)→ VAEDecode
    – 在 Prompt 节点中,用 `[frame1], [frame2], [frame3]` 替换动作描述
    – 将 batch_size 设为3,一次性输出连续帧

    3. 后期微调
    用 CapCut 或 Premiere Pro 导入序列帧,检查:
    – 角色位置是否跳跃(用时间轴上的位置跟踪)
    – 光线方向是否一致(用 Lumetri Color 的色温工具)
    – 道具是否消失(逐帧检查,缺失的用 Photoshop 补帧)

    实操案例:3秒打斗片段(12帧)

  • 提示词模板:
  •   [角色模板] 青璃,[动作],
      [场景模板] 天机阁大殿,
      cinematic, motion blur, --ar 16:9 --v 6.0
      
  • 动作列表:
  • `frame1: 拔剑,frame2: 前冲,frame3: 格挡,frame4: 反击…`

  • 用 ComfyUI 的 `Video Helper Suite` 节点,将12帧合成 GIF 预览
  • 打斗分镜序列:从拔剑到格挡的连续动作

    总结与进阶建议

    这套工作流的本质是 “控制变量法”——把角色、场景、动作拆成独立变量,每次只改变一个维度。当你发现角色表情不对,就检查 IP-Adapter 权重;当场景透视扭曲,就调整 ControlNet Depth 的预处理方式。

    进阶建议:
    1. 建立自己的“素材银行”:按角色、场景、道具分类,用 Notion 或 Eagle 管理种子图和参数
    2. 学习 ComfyUI 的 `Logic Nodes`,用条件判断实现“如果角色受伤,自动调用流血特效”
    3. 关注 Stability AI 的官方 Discord,每周有 ComfyUI 工作流竞赛,可以抄作业

    常见问题 FAQ

    Q1:为什么我用 IP-Adapter 后角色脸还是崩?
    A:检查参考图分辨率是否低于 512×512?IP-Adapter 对低质量图会丢失细节。建议用 Topaz Gigapixel 将参考图放大到 1024×1024 再输入。另外权重不要超过 0.9,否则会复制参考图的背景纹理。

    Q2:分镜生成后角色衣服颜色变了怎么办?
    A:在提示词中把衣服颜色从“红色”改为“深红色 (#8B0000)”,用 Hex 色号锁定。同时在 ComfyUI 的 CLIP Text Encode 节点中,开启 `color_fix` 插件(需额外安装)。

    Q3:场景里的人物太多,AI 生成后互相重叠?
    A:用 ControlNet 的 OpenPose 模块先画出人物骨架位置,再生成。具体操作:在 Photoshop 中画几个火柴人,导入 ControlNet 的 Pose 模型,生成时会严格遵循骨架位置。

    Q4:Midjourney v6 和 ComfyUI 怎么配合最省时间?
    A:用 Midjourney 生成关键帧(每5-10帧一张),其余过渡帧用 ComfyUI 的 Frame Interpolation(RIFE 模型)自动补帧。Midjourney 负责“创意”,ComfyUI 负责“量产”。

    Q5:我的显卡只有 8GB VRAM,能跑这套工作流吗?
    A:可以。在 ComfyUI 中开启 `–lowvram` 模式,将 batch_size 设为1,使用 SD 1.5 模型而非 SDXL。角色锚点用 IP-Adapter 的轻量版 `ip-adapter-faceid-plusv2_sd15.bin`(约 300MB)。

    声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。