
很多人写图片生成提示词的方式是堆叠形容词:好看的、精致的、高清的、大师级作品。结果是每次输出都差不多,而且都无法精确控制。问题在于形容词是模糊的审美判断,模型无法把它映射到具体的画面特征上。有效的提示词应该描述可以被看见的东西。
把提示词拆成五层
第一层是主体,要明确是什么、有多少、什么姿态或状态。第二层是环境,包括背景内容和空间关系——是室内还是室外,主体周围有什么,距离和视角如何。第三层是光线,这是最容易被忽略却影响最大的一层:光源方向、光质(硬光还是柔光)、色温、是否有阴影。第四层是材质与细节,描述表面的物理特性。第五层才是风格,包括艺术流派、参考媒介、色调倾向。
把这五层都写清楚,输出的可控性会有肉眼可见的提升。反过来,如果只写前两层,模型会自行补齐后面三层,这就是"每次结果都不同"的来源。
用减法控制画面
多数模型都支持负面提示,但很多人只用它排除"低质量""模糊"这类笼统概念。更有价值的是用它做画面减法:排除不想要的元素、排除特定颜色、排除某些构图倾向。比如你要一张干净的产品图,负面提示里就应该明确写出不要文字、不要水印、不要多余装饰、不要杂乱背景。
负面提示的使用原则是具体而非笼统。写"不要多余的物体"效果有限,写"不要出现人物、不要出现文字、不要出现边框"才真正起作用。
控制一致性比控制质量更难
如果你需要一组风格统一的图,靠反复调整提示词是低效的。更可靠的做法是先生成一张满意的基准图,然后以它为参考做图生图变换,保持主体或构图不变而修改细节。这种方式下,风格一致性由参考图锚定,而不是靠文字描述碰运气。
另一个实用技巧是固定随机种子。在提示词和其他参数完全相同的情况下,固定种子可以复现结果,这样调整某一个变量时,就能清楚地看到这个变量到底改变了什么。这是做参数对比实验的基础方法。
迭代方法
不要期望一次写对。有效的流程是:先用简短提示确定大方向,从多张输出里挑出最接近的一张,观察它与预期的具体差距,然后针对性地补充提示词里的某一层。每次只改一个维度,否则你无法判断是哪处改动起了作用。三轮之内通常就能收敛到可用的结果。