大多数不理想的 AI 图片,问题出在提示词,而不是模型。解决办法是结构化:与其想到什么写什么,不如每次都把五个槽位填满。
公式
主体 + 环境 + 光线 + 风格 + 构图- 主体——画面的核心是什么或者谁,要有具体细节
- 环境——主体在哪里,周围有什么
- 光线——光的质感、方向、色温
- 风格——媒介、美学倾向或年代(摄影、水彩、3D 渲染……)
- 构图——取景、角度、镜头、画幅
不是每条提示词都必须五项俱全,但当出图不理想时,缺的那一项往往就是原因。下面逐项展开,每项都给出可以直接复制进生成页的前后对比。
主体:要具体,别抒情
模型猜不到你脑子里的画面。"一只狗"得到的就是所有狗照片的统计平均值。
产品摄影:
弱:一瓶香水
强:一瓶磨砂玻璃香水,拉丝金瓶盖,瓶身挂着水珠,无标签人像:
弱:一位漂亮的女性
强:一位六十多岁的女性,银发束起,笑纹明显,
穿粗针织高领毛衣"强"版本告诉了模型是哪只狗、哪个瓶子、哪张脸——年龄、材质、质感、状态。"漂亮"这类形容词几乎不起作用,名词和物理细节才是关键。
环境:让主体落在某个地方
不写环境,模型默认给你纯色影棚背景或者一团模糊虚化。
弱:一杯咖啡
强:一杯咖啡放在风化的木窗台上,玻璃窗上雨水流淌,
窗外是虚化的城市街道弱:一个山地车手
强:一个山地车手在尘土飞扬的高山步道上腾空,
脚下是松林,远处天际堆着积雨云注意,环境同时也在定调情绪。雨水、尘土、积雨云传达的氛围,是"有氛围感"三个字永远做不到的。
光线:性价比最高的升级
光线描述是任何提示词里杠杆最高的一笔。写清光源、方向、色温。
弱:一碗拉面,看起来很好吃
强:一碗拉面,左侧柔和窗光,热气被逆光打亮,暖色调弱:一个男人的肖像,有戏剧感
强:一个男人的肖像,背后单一硬质轮廓光,
半张脸沉在阴影里,冷蓝色补光常用词汇:黄金时刻、阴天柔光、霓虹光、烛光、正午硬光、逆光、轮廓光、体积光。
风格:点名媒介和年代
你不指定风格,模型就替你选一个——通常是千篇一律的高光默认风。
插画:
弱:森林里的狐狸,卡通风格
强:森林里的狐狸,扁平矢量插画,限定色板为铁锈橙和深青色,
中世纪现代童书风格,带纸张肌理Logo:
弱:一个咖啡店的 logo
强:极简线条 logo,咖啡杯与日出融合,单一粗细线条,
单色,居中放在纯白背景上,扁平矢量风格做 Logo 时一定加上扁平、矢量、纯色背景——否则你拿到的是一枚 3D 渲染徽章,而不是能用的标志。
构图:指挥镜头
取景词写起来便宜,效果差异巨大。
弱:一枚国际象棋棋子
强:一枚黑色骑士棋子,极近特写,微距镜头,浅景深,
偏置在画面右侧三分线上其他抓手:广角全景、低角度仰拍、鸟瞰、85mm 人像镜头、对称构图、左侧留白。画幅比例建议在生成器设置里选,不必写进文字。
五个常见错误
- 一条提示词塞两张图。"日出下的城堡,还有夜晚的巨龙大战"会逼模型把两个场景做平均。一条提示词,一个场景。
- 堆砌空洞的质量词。"杰作、最高画质、超高清、8k"在现代模型上收效甚微,换成具体的光线和材质细节。
- **自相矛盾。**前脚写"极简构图",后脚列了十二件道具。想清楚到底要哪个。
- **完全不管构图。**那你每次拿到的都是居中、平视的画面——然后疑惑为什么张张雷同。
- **差一点就推倒重写。**结果已经对了八成,就只改一个变量。整句重写等于把已经生效的部分也扔掉了。
不同模型,不同写法
提示词不是一招通吃,模型间的差异值得了解:
| 模型 | 更吃哪一套 |
|---|---|
| GPT Image 2 | 长篇自然语言描述、多句场景调度,以及需要在画面里渲染文字(招牌、标签、海报)的提示词 |
| Nano Banana 系列 | 对现有图片下编辑类指令——"把天空改成阴天""把外套换成牛仔"。定性描述即可,不需要事无巨细 |
在 Bno AI 上,同一条提示词可以路由到不同模型——去提示词库看看同一个创意在不同模型下怎么写。
负面提示词与迭代
负面提示词列的是你不想要的东西:模糊、多余的手指、水印、文字乱码。保持简短——负面词堆太长,对模型的束缚大于帮助。负面提示词只能做减法,不能做加法。
一套实用的迭代循环:
- 按公式写第一版提示词。
- 找出结果里最大的一个问题。
- 只改对应的那个槽位(情绪不对改光线,观感不对改风格)。
- 重跑、对比、重复。
Bno AI 免费档每天 10 积分,GPT Image 2 的 1K 档一张 2 积分,相当于每天约 5 次免费生成——足够把"每次只验证一个改动"跑上好几轮。需要高强度迭代,Pro 订阅可以解除每日上限。当一张图已经能当首帧用了,还可以送进 AI 视频生成器让它动起来。
FAQ
提示词应该写多长? 长到能填满五个槽位,短到每个词都有存在的理由——通常 20 到 60 个词。再长,模型开始忽略细节,你也搞不清哪些词起了作用。
逗号分隔的关键词列表还有用吗? 有用,但完整句子能表达关键词表达不了的关系("一只猫盯着金鱼" vs "猫,金鱼")。现代模型——尤其是 GPT Image 2——更吃自然语言。
为什么同一条提示词每次出图不一样? 生成是采样过程,不是确定性计算——同一条提示词每次落在模型可能性空间的不同位置。把这当成功能而不是缺陷:先多跑几次,再决定要不要改词。
