Prompt Engineering:AIGC 设计师的核心竞争力

上周五深夜,我收到学员小林的微信。他发来一张用 Midjourney 生成的“赛博朋克咖啡馆”图,抱怨说:“老师,我加了‘cyberpunk, coffee shop, neon lights’这些词,结果出来的是满屏霓虹灯管和杂乱金属,根本没法用。”我点开图一看——典型的“关键词堆砌综合症”:元素全在,但构图失衡、光影错误、主体模糊。

这个问题太普遍了。很多设计师以为 Prompt Engineering 就是“多堆几个形容词”,结果生成的内容像快餐——看着热闹,经不起推敲。真正的高手,能把 AI 当成一支训练有素的设计团队:你给的是分镜脚本,而不是购物清单。

今天,我就用两个实操案例,拆解 Prompt Engineering 的核心逻辑。你不需要成为程序员,但需要学会“设计思维+结构化表达”。

一、从“关键词堆砌”到“结构化提示”:一个案例的蜕变

先看一个典型“低效 Prompt”:

低效版
`a beautiful woman in a futuristic city, wearing a red dress, holding a gun, cinematic lighting, 8k, photorealistic`

用 Midjourney V6(参数 `–ar 16:9 –v 6`)生成,你会得到什么?大概率是一张元素齐全但毫无重点的图:人物居中、背景模糊、红裙和枪械抢镜,但光影平铺直叙,像游戏截图而非电影剧照。

问题出在哪?AI 不知道“重点”是什么。它只能平等对待每个词。要解决,就得把 Prompt 从“列表”升级为“分镜脚本”。

结构化版(Midjourney V6)

A close-up shot of a female detective in her 30s, standing in the rain on a neon-lit street, wearing a tattered red dress, holding a smoking pistol at her side. Her face is half-lit by a flickering sign, expression determined yet weary. Cinematic composition, shallow depth of field, blue and red color contrast, film grain, shot on Arri Alexa 65 --ar 9:16 --v 6 --style raw --stylize 250

效果对比

  • 主体明确:用“close-up shot”限定构图,用“female detective in her 30s”给人物身份。
  • 光影逻辑:用“half-lit by a flickering sign”解释光源位置,AI 会计算阴影方向。
  • 情绪锚点:用“expression determined yet weary”定义人物状态,而非空洞的“beautiful”。
  • 技术参数:`–style raw` 减少 AI 的“美化倾向”,`–stylize 250` 平衡创意与保真度。
  • 关键操作步骤
    1. 用“构图 + 主体 + 环境 + 光影 + 色调 + 情绪”六个维度拆解需求。
    2. 在 Midjourney 中,把 `–stylize` 参数从默认 100 调到 200-300,让 AI 理解“风格化”不等于“乱加元素”。
    3. 使用 `–style raw` 模式(V6 专属),适合需要真实感的设计场景。

    结构化提示词示例

    二、SD 进阶:用 ControlNet 和 LoRA 实现“精准控制”

    Midjourney 适合快速出图,但如果你需要精确控制人物姿势、构图或风格一致性,Stable Diffusion(SD)是更好的选择。这里以 Stable Diffusion WebUI 1.7.0 + ControlNet 1.1.4 为例,演示一个“品牌海报”的生成流程。

    需求:为一家咖啡品牌生成海报,主角是穿白色衬衫的年轻男性,坐在窗边喝咖啡,窗外是巴黎街景,要求构图接近经典电影《天使爱美丽》的色调。

    步骤 1:准备参考图
    找一张《天使爱美丽》的剧照(暖黄调、轻微颗粒感),以及一张咖啡店窗边人物的草图(用手机拍或简单画线稿)。ControlNet 需要这两张图作为“引导”。

    步骤 2:编写基础 Prompt

    masterpiece, best quality, a young man in white shirt sitting by a window, drinking coffee, Paris street outside, warm golden hour light, film grain, shallow depth of field, shot on 35mm film, cinematic, 
    Negative prompt: distorted, ugly, blurry, low quality, text, watermark, 
    Steps: 30, Sampler: DPM++ 2M Karras, CFG scale: 7, Size: 768x512, Model: realisticVisionV51_v51VAE
    

    这里注意:`negative prompt` 要写具体——`text, watermark` 防止 AI 生成文字干扰海报;`distorted` 避免人体变形。

    步骤 3:启用 ControlNet

  • 打开 ControlNet 面板,上传剧照图,选择 `Canny` 模型(检测边缘轮廓),控制权重设为 0.8。
  • 上传第二张草图,选择 `OpenPose` 模型(检测人体姿势),控制权重设为 0.6。
  • 关键参数:`Control Mode` 选 `Balanced`(平衡引导与创意),`Pixel Perfect` 勾选(自动匹配分辨率)。
  • 步骤 4:调整 LoRA 微调风格
    如果你想让色调更接近《天使爱美丽》,可以加载一个 `film-grain-lora`(权重 0.4)和 `warm-tones-lora`(权重 0.6)。LoRA 相当于“风格滤镜”,但比滤镜更智能——它只影响颜色和质感,不破坏构图。

    效果:生成的图像中,人物姿势被 OpenPose 控制为“侧身端杯”,窗框被 Canny 控制为“巴黎老建筑线条”,而 LoRA 把整体色调拉向暖黄。整个过程像“导演+摄影+灯光”三方协作。

    Stable Diffusion ControlNet 工作流

    三、Prompt 的“元能力”:如何让你的提示词持续进化

    工具会迭代,但底层能力不会。我发现顶尖设计师都有三个习惯:

    1. 建立“词库-效果映射表”

    每次生成后,记录 Prompt 中每个词对结果的影响。比如:

  • `cinematic lighting` → 产生强明暗对比,但容易让背景过暗
  • `volumetric light` → 产生光束效果,但需要配合 `–style raw` 避免失真
  • `octane render` → 增加塑料感,不适用于自然场景
  • 用 Notion 或 Excel 建一个表,分三列:Prompt 词预期效果实际效果。一个月后,你会拥有一份私人定制的“设计词典”。

    2. 用“A/B 测试”思维迭代

    不要满足于“第一张图”。把 Prompt 拆成变量:

  • 固定部分:构图、主体、分辨率
  • 变量部分:光线、色调、风格词
  • 每次只改一个变量,生成 2-3 张图对比。比如“暖光 vs 冷光”、“胶片颗粒 vs 平滑质感”。这种“控制变量法”能快速找到最优组合。

    3. 学会“反向推理”

    看到一张喜欢的 AI 图,别只感叹“真好看”。去猜它的 Prompt 结构:

  • 构图是什么?(中景?特写?鸟瞰?)
  • 光线来自哪个方向?(左侧光?逆光?)
  • 用了哪些风格词?(cinematic?anime?oil painting?)
  • 然后自己写一个“反向 Prompt”,生成后对比差异。这是最有效的学习方式。

    Prompt 迭代流程图

    常见问题 FAQ

    Q1:为什么我加了“8k, photorealistic”但图片还是模糊?
    A:这两个词在 Midjourney V6 中几乎无效。V6 默认输出就是高分辨率,`8k` 反而可能让 AI 过度锐化。建议用 `–quality 2` 参数(最高质量),或者在 SD 中把 `Steps` 调到 30-40,同时确保 negative prompt 有 `blur, low quality`。

    Q2:ControlNet 的权重怎么调?
    A:经验法则:主体姿势用 0.5-0.7(太强会僵硬),边缘轮廓用 0.7-0.9(太弱会失控)。如果你需要“构图完全一致”,权重拉到 0.9;如果只需要“大概参考”,0.4 就够了。

    Q3:LoRA 和 hypernetwork 有什么区别?
    A:LoRA 更轻量,只影响模型的 10-20% 参数,适合微调风格或角色;hypernetwork 影响更大,但容易过拟合。新手优先用 LoRA,权重从 0.4 开始调。

    Q4:为什么我用负面提示词“ugly, bad”后,人物反而变形?
    A:`ugly` 太宽泛,AI 可能理解��“不要任何不美的东西”,导致过度平滑。建议用具体负面词:`distorted face`、`extra limbs`、`asymmetric eyes`。对于 SD,可以加载 `bad-hands-5` 这类专门修复手部的负面嵌入。

    Q5:我的 Prompt 很长,但效果不好,怎么办?
    A:长 Prompt 容易让 AI “迷失重点”。解决办法:

  • 把最关键的词(主体、构图、光线)放在开头 5 个词内
  • 删除重复或矛盾的词(比如同时写“cinematic lighting”和“flat lighting”)
  • 用 `[word1::word2::0.5]` 语法控制权重(Midjourney 和 SD 都支持)
  • 结语与进阶建议

    Prompt Engineering 不是“魔法咒语”,而是“设计沟通学”。你越能清晰地向 AI 描述“你要什么、不要什么、优先级是什么”,它就越能成为你的延伸。

    三个进阶方向
    1. 工具链整合:学会用 ComfyUI 做节点式工作流,把多个 ControlNet、LoRA、IP-Adapter 串联成“自动化生产线”。
    2. 风格化训练:用 Dreambooth 或 LoRA 训练自己的风格模型,比如“公司品牌色+特定构图”。
    3. 跨模态 Prompt:尝试用音频、视频帧作为输入源(比如用音乐节奏控制画面动态)。

    最后,记住一句话:AI 不会取代设计师,但会用 Prompt 的设计师会取代不会用的。 从今天开始,每次生成后多花 5 分钟记录和复盘,你的 Prompt 能力会在 30 天内质变。

    (全文完)

    声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。