Prompt Engineering:AIGC 设计师的核心竞争力
上周三,一位在电商公司做视觉设计的学员小周,发给我两张图。一张是她用 Midjourney 生成的“北欧风客厅”,花了三个小时,反复修改了二十多次提示词,结果还是“一眼假”——沙发比例失调,窗外景色像贴纸,光影完全不对。另一张是她同事用同样的工具,十分钟搞定,光影自然,材质逼真,甚至能直接放进详情页当主图。
小周问我:“老师,我是不是不适合做 AIGC?为什么我写的提示词总像在跟一个听不懂人话的傻子说话?”
我问了她一个问题:“你写提示词的时候,是在描述‘你想要什么’,还是在描述‘你看到什么’?”
她愣住了。这个问题的答案,就是 Prompt Engineering 的核心——它不是玄学,而是一门有语法、有结构、有调试逻辑的工程学科。 今天,我把这套方法论拆开讲透。
一、为什么你的提示词“不听话”?—— 先理解 Token 与权重
很多设计师把提示词当成“许愿咒语”,以为写得越华丽越好。但实际上,无论 GPT-4o 还是 Midjourney V6,它们都是基于 Token(��元)的概率模型。你输入的每个词,都会被拆解成 Token,模型根据训练数据中的统计规律,预测最可能的组合。
第一个关键认知:模型不是理解你的意图,而是在做“统计续写”。
举个例子。你写“a beautiful living room”,模型大概率会生成一张“普通的好看客厅”——因为训练数据里这个组合出现的频率太高了。但如果你写“a 70sqm Scandinavian living room, floor-to-ceiling windows, pale oak floor, gray linen sofa, morning sunlight casting long shadows, IKEA 2024 catalog style”——每个 Token 都在缩小概率空间,最终锁定到接近你脑海中的画面。
第二个关键认知:权重是隐形的,但可以通过位置和符号控制。
在 Midjourney 中,`::` 双冒号是权重分隔符。比如 `interior design::4 living room::1`,前者的重要性是后者的 4 倍。而在 Stable Diffusion WebUI 中,`(keyword:1.3)` 表示将该词权重提升 30%。这些符号不是装饰,是工程参数。
实操步骤(以 Midjourney V6 为例):
1. 打开 Midjourney,输入 `/imagine prompt:`
2. 基础结构:`[主体] + [环境] + [材质/风格] + [光照] + [构图] + [相机参数] + [负面提示(–no)]`
3. 示例:
a minimalist workspace, white oak desk, iMac 27-inch, small potted monstera, soft diffused window light from left, shot on Sony A7R IV, 35mm lens, f/2.8, shallow depth of field --ar 16:9 --v 6 --no clutter
4. 如果画面太乱,加 `–no clutter`(排除杂物);如果风格不对,加 `–style raw` 降低默认美学干预。
关键参数速查表:
- `–ar 16:9`:宽高比,电商详情页用 3:4
二、从“描述”到“指令”:用结构化提示词复刻真实案例
小周的问题在于,她写的是“我想要一个北欧风客厅,温馨一点,有阳光”——全是形容词和抽象概念。而她的同事写的是“一个 20 平米的客厅,浅色木地板,灰色亚麻沙发,白色墙面,黑色细框落地窗,上午 10 点的阳光从西南方向射入,在地板上形成 1 米长的光影,宜家样板间摄影风格,超写实”。
区别在哪?前者是“感受”,后者是“参数”。
第二个实操案例:用 ChatGPT 生成可落地的设计提案。
很多设计师不知道,ChatGPT 的 GPTs(自定义指令)功能,可以帮你把模糊需求转化成精确提示词。我教小周建了一个“设计提示词编译器”:
��作步骤:
1. 打开 ChatGPT,选择 `Explore GPTs` → `Create a GPT`(需要 Plus 账号)
2. 在 Instructions 中输入以下系统提示词:
You are a prompt engineering compiler for visual designers.
When given a design brief, output a Midjourney prompt with this structure:
[SUBJECT] + [ENVIRONMENT] + [MATERIALS] + [LIGHTING] + [CAMERA] + [STYLE] + [NEGATIVE]
Use concrete nouns and measurable descriptors. Avoid adjectives like 'beautiful', 'nice', 'modern'.
For each prompt, also provide 3 variations: one with higher stylize, one with lower stylize, one with different aspect ratio.
3. 输入需求:“我要一个咖啡品牌的包装设计,北欧风格,环保材质”
4. 它会输出类似:
SUBJECT: matte black coffee bag with minimalist typography, 250g capacity
ENVIRONMENT: standing on a light gray concrete surface, soft shadow
MATERIALS: kraft paper with matte lamination, embossed logo
LIGHTING: softbox at 45-degree angle, color temperature 5000K
CAMERA: shot on Hasselblad H6D, 80mm lens, f/5.6, focus on logo
STYLE: Scandinavian design, IKEA product photography style, high detail
NEGATIVE: --no plastic wrap, glossy reflection, text errors
这个流程的核心价值:把��灵感”转化为“可复现的参数”。 你不再依赖运气,而是依赖一套可调试的流程。
三、进阶:用 ControlNet 和 LoRA 解决“手控不好”的痛点
提示词再精准,也有瓶颈——比如人物手部、复杂透视。这时候需要组合工具。
工具组合:Stable Diffusion WebUI + ControlNet + 手部修复 LoRA
操作步骤:
1. 安装 Stable Diffusion WebUI(推荐使用秋叶整合包 4.5 版本,内置常用插件)
2. 在 Extensions 中安装 `ControlNet` 插件(版本 1.1.4+)
3. 下载手部修复 LoRA 模型(推荐 `hand_lora_v1.0.safetensors`,放至 `models/Lora` 目录)
4. 在文生图界面中:
– 输入主体提示词,如 `1girl, sitting at desk, typing on laptop, cafe, bokeh background`
– 在 ControlNet 区域上传一张手部姿势参考图(可以用 3D 模型摆姿势截图)
– Preprocessor 选择 `openpose_hand`,Model 选择 `control_v11p_sd15_openpose`
– 权重设为 0.8,引导起始 0.1,结束 0.8
5. 在 Lora 区域选择 `hand_lora_v1.0`,权重设为 0.7
6. 生成后,手部细节比纯提示词提升 80% 以上。
为什么有效? ControlNet 通过姿态骨架约束了手的空间位置,LoRA 则微调了手部细节的生成概率。提示词负责“气质”,ControlNet 负责“骨架”,LoRA 负责“皮肤”——三层叠加,才是完整的 AIGC 工作流。
参数细节:
四、总结:从“咒语师”到“提示词工程师”的三个跃迁
小周后来告诉我,她用这套方法重做了那个“北欧风客厅”,一次通过,甲方直接用了。她现在的提示词模板已经存了 200 多条,按场景分类,每次新项目先调模板再微调。
三个跃迁建议:
1. 从“形容词思维”转向“参数思维” —— 把“温馨”拆解成“色温 3500K 的暖光 + 原木材质 + 低饱和度沙发 + 午后斜射光”
2. 建立自己的提示词库 —— 用 Notion 或飞书表格,按行业(电商、室内、产品、人物)分类,记录每次生成的成功率和修改日志
3. 学会组合工具 —— 不要只依赖 Midjourney,Stable Diffusion 的 ControlNet、LoRA、Inpainting 功能,能解决 80% 的细节问题
最后一条建议: 每周花 2 小时做“提示词逆向工程”——找一张优秀的设计图,尝试用提示词复现,然后对比差异,调整参数。这是提升最快的训练方式,没有之一。
—
常见问题 FAQ
Q1:Midjourney V6 和 V5 在提示词写法上有什么区别?
V6 对自然语言的理解大幅提升,不再需要堆砌大量逗号分隔的关键词。V6 更偏向“用完整句子描述场景”,同时 `–stylize` 的默认值从 2500 降到了 100,意味着更忠实于你的描述。如果你还在用 V5 的“关键词堆砌法”,在 V6 中效果会打折。
Q2:为什么我加了 `–no` 参数,画面里还是有我排除的元素?
`–no` 是“降低权重”而非“绝对排除”。比如 `–no text` 只是让文字出现的概率降低,不能保证 100% 没有。如果文字频繁出现,需要在提示词中明确指定 `no typography, no letters, no fonts`,同时将 `–stylize` 调低到 50 以下。
Q3:Stable Diffusion 和 Midjourney 哪个更适合商用?
商用看需求。Midjourney 出图快、美学质量高,但版权条款要求付费用户才能商用,而且可控性弱。Stable Diffusion 完全本地部署,可控性极强(ControlNet、Inpainting 都能做),但需要花时间调参。我的建议:提案阶段用 Midjourney,最终落地用 SD 精修。
Q4:提示词越长越好吗?
不是。超过 80 个 Token 后,模型对早期 Token 的注意力会衰减(类似“注意力机制”的局限性)。我的经验是:核心主体控制在 20 个 Token 内,环境 10 个,材质/风格 10 个,光照 5 个,相机参数 5 个。总长 50-60 个 Token 为最佳。
Q5:如何判断自己的提示词是否“合格”?
一个简单标准:把提示词发给一个不懂设计的朋友,看他能否在脑中形成具体画面。如果他能说出“白色沙发、木地板、窗户在左边、光线偏暖”,说明你的提示词是合格的。如果他说“一个好看的客厅”,那就需要继续细化。

评论(0)