刚接触 AI 绘画的人常有一个错觉:提示词就是"用自然语言描述想要的画面"。于是写一句"一只可爱的猫",出来的图时好时坏。问题出在模型并不会"理解意图",它只是按提示词去匹配训练数据里的视觉模式。想让出图稳定,得把提示词当成一种结构化的描述语言。
一、提示词的四层结构
一个完整的绘画提示词可以拆成四层,按重要程度排列:
- 主体:画面里最重要的东西,要具体到动作和细节。不写"一个女孩",写"穿白色连衣裙的女孩侧身坐在窗台,手里捧着一杯热茶"。
- 环境:时间、地点、光线、氛围。"雨后的江南小巷,黄昏暖光,青石板路反光"。
- 风格:决定画面的艺术语言。"水彩插画""赛博朋克概念艺术""日系动画电影截图"。
- 画质与构图词:"杰作、超精细、8K、浅景深、三分法构图"这类词牵引模型往高质量训练样本靠拢。
四层的顺序有意义:越靠前权重越高(多数模型如此),主体永远放最前。
二、负面提示词:告诉模型不要什么
正向描述之外,负面提示词(negative prompt)同样重要。通用兜底串可以先抄这条:
低画质, 模糊, 变形的手指, 多余的手指, 五官错位, 水印, 文字, 签名, 低分辨率, 过曝
人物图翻车时,八成是负面词里没写"手指"和"五官"相关的排除项。
三、三套可直接套用的模板
产品图:
[产品] 置于 [场景],柔和自然光,浅景深,商业摄影风格,干净背景,高清细节
插画:
[主体动作描述],[环境氛围],[风格如:扁平插画/水彩/像素风],配色以 [主色] 为主,构图简洁
写实人像:
[人物描述与神态],[服装],[场景与光线],85mm 人像镜头,胶片质感,自然肤色
每次只改方括号里的内容,其余结构保持稳定——这就是"稳定出图"的秘密:结构固定,变量可控。
四、迭代方法:一次只改一个变量
出图不满意时,不要整段重写。按这个顺序排查:
- 主体不对 → 改主体描述,写得更具体
- 氛围不对 → 调环境和光线词
- 风格不对 → 换风格词,必要时加上参考艺术家或作品类型
- 细节崩坏 → 加强画质词和负面提示词
一次改一层,你才知道每个词的真实作用,慢慢就建立起自己的"词感"。
五、参数的基本常识
不同平台参数名不同,但逻辑相通:
- 提示词权重:如
(关键词:1.3),加强或减弱某个词的影响力 - CFG Scale:模型"听话"程度,太高画面僵硬,太低自由发挥,7–9 是常用区间
- Seed:固定种子可以在同一构图上微调提示词,做对比实验时必用
- 画幅比例:先想清楚用途(封面 16:9、头像 1:1、海报 2:3),别生成完再裁
六、不同平台的提示词差异
同一套提示词换个平台效果可能差很多,差异主要在三点:
- 自然语言理解:Midjourney、GPT Image 这类新模型能消化长句描述,写成通顺的句子反而更好;早期的 Stable Diffusion 更吃"关键词堆叠",逗号分隔的短语串效果更稳。
- 权重语法:SD 系支持
(词:1.3)这类显式权重,Midjourney 用::分隔加权,语法不通用,迁移提示词时要改写。 - 中文支持:部分国产模型(如即梦、通义万相)对中文提示词的理解明显好于海外模型,写中文意境词("烟雨朦胧""留白")不必翻成英文。
实用的迁移方法:保留四层结构,只按目标平台重写表达形式,出两三张对比图后固定下该平台的最佳写法。
注意事项
- 商用前确认所用模型的授权条款,部分模型禁止商用或要求署名
- 避免直接生成真实名人肖像,多数平台有明确限制且有法律风险
- 建立自己的提示词库:把出图效果好的完整提示词连同参数一起存档
小结
AI 绘画提示词工程的核心是结构化与可复现:四层结构搭骨架,负面提示词兜底,模板保证稳定,单变量迭代做优化。练上五十张图,你会明显感觉到自己从"抽盲盒"变成了"下订单"。
