AI 图片提示词怎么写?
通用公式、构图、光影与风格关键词指南。提示词不是关键词堆砌,而是把脑中的画面翻译成模型可以执行的视觉指令。
先说结论:清晰比复杂更重要
参考 OpenAI、Google Imagen 和 Adobe Firefly 的官方指南,一条有效的图片 Prompt 不一定很长。它需要清楚说明图片的用途、主体、主体状态、环境和视觉风格;如果构图、光线、文字或某个元素必须固定,再补充具体限制。与其写“高级、惊艳、电影感”,不如写“左侧窗光、柔和阴影、浅景深和低饱和色彩”。
OpenAI Academy 建议先用一到三句清晰描述得到基本画面,再一次只修改一个元素。这样比一次塞入几十个风格词更容易判断是哪一条指令改变了结果。
AI 图片提示词的通用公式
这不是所有模型必须遵守的固定语法,而是一种帮助你组织视觉信息的写作框架。不同模型的权重、参数、负面提示词和参考图机制可能不同。
图片用途
先说明图片要完成什么任务,例如产品主图、杂志封面、社交媒体配图、概念设计或电影分镜。用途会影响留白、主体大小、文字位置和画面比例。
例:电商产品主图,顶部留出品牌标题空间。
主体
明确画面中最重要的人、物体或场景,并补充数量、身份、外观、材质、颜色、服装和年龄等可观察信息。避免只写“漂亮的人”或“高级产品”。
例:一位穿祖母绿色汉服的年轻女性;一只磨砂黑色陶瓷香水瓶。
动作与状态
说明主体正在做什么、处于什么姿态或状态,包括表情、视线、手势、方向以及主体之间的关系。静态图也可以使用 standing、holding、looking 等状态词。
例:手持油纸伞,侧身站立,望向远处;产品悬浮在透明水面上。
环境
交代地点、时间、天气、季节、背景和前景。环境不仅是背景,还决定主体与空间的关系和画面的叙事氛围。
例:清晨的雾岭山溪,松树、岩石和远处的层叠山峰。
构图与视角
选择景别、机位和构图方式。景别控制观看距离,机位控制透视关系,rule of thirds、leading lines 和 negative space 控制画面组织。通常选一到两个主要指令即可。
例:medium shot · three-quarter view · low-angle composition · rule of thirds
光影
按“光源类型 + 方向 + 软硬 + 产生的效果”来写,比单独写 cinematic lighting 更具体。
例:左侧柔和窗光,轻微轮廓光,人物与背景分离,阴影柔和。
色彩
描述主色、辅助色、对比色和整体调色,并让色彩、光线和用途保持一致。
例:低饱和青绿色与暖朱红对比,柔和金色高光。
风格或媒介
把“电影感”等宽泛词拆成具体媒介、质感和视觉特征,例如电影构图、体积雾、浅景深、控制过的调色和细微颗粒。
例:35mm film photography · Chinese ink-wash fantasy · clean line art
细节与限制条件
补充材质、纹理、景深、服装刺绣、产品反光、背景层次等细节;同时明确文字要求、比例、不要出现的元素和编辑边界。细节应服务于主体,不要把所有关键词都塞进去。
例:delicate silk texture, subtle film grain, no text, no watermark, no extra people; change only the background.
完整示例:从一句话到可执行 Prompt
简单描述:“一个穿汉服的女人在山里。”这句话有主题,但缺少环境、动作、构图和光影。可以逐步扩写成:
其中,主体是 emerald-green hanfu 的年轻女性;环境是雾气中的山溪;动作和道具是手持纸伞;构图是中景、三分之四肖像和低角度;光影是晨雾与穿过松树的漫射金光;限制条件是无文字、无水印。


其他模型对比:同一主题、同一套 Prompt
下面的图片用于展示相同主题在不同模型中的视觉差异,不构成严格基准测试。正式比较时还需要固定版本、比例、分辨率、生成数量和生成时间。




正向提示词和负向提示词怎么用?
正向提示词描述你希望画面出现什么:natural skin texture、soft window light、balanced composition。负向提示词描述你希望减少什么:blurry、extra fingers、duplicate subject、watermark。
需要注意,Negative Prompt 不是所有模型都以同样方式支持。Stable Diffusion 类工作流通常有独立字段;Midjourney、ChatGPT、Gemini 等工具可能依赖自然语言限制、参数或自身的图像理解。负面词也不能替代清晰的正向描述。
构图、光影和风格关键词
构图与视角
eye-level shot · low-angle shot · high-angle shot · bird’s-eye view · three-quarter view · rule of thirds · centered composition · leading lines · negative space · foreground framing · layered composition
光影
soft diffused light · hard sunlight · golden hour light · blue hour light · backlighting · rim light · side lighting · Rembrandt lighting · chiaroscuro · volumetric light · window light · dappled sunlight
风格
photorealistic · documentary photography · 35mm film photography · subtle film grain · anime illustration · clean line art · ink wash painting · gongbi details · cinematic composition · controlled color grading
不同模型的 Prompt 不能完全混用
自然语言框架可以通用,但具体规则需要看模型。GPT Image 更适合用清晰的自然语言说明用途、主体和修改范围;Google Imagen 文档强调 subject、context、style 和 meaningful modifiers;Adobe Firefly 使用图片类型、主体、动作、角度、光影、背景、色彩和风格的结构;Midjourney 则有自己的参数和参考图体系;FLUX、Stable Diffusion 等工作流还可能涉及权重、LoRA、ControlNet 和独立 Negative Prompt。
常见错误
- 只写 beautiful、amazing、high quality 等抽象形容词。
- 同时写 close-up portrait、full body、wide shot 等互相冲突的景别。
- 把 photorealistic、flat cartoon、watercolor、3D render 全部堆在一起。
- 一次修改十个变量,最后不知道哪条指令起了作用。
- 把负面提示词当成修复所有问题的工具。
如何测试和优化一条 Prompt?
固定模型、版本、比例、分辨率、参考图和生成次数;一次只修改一个变量;保存结果并记录失败原因。建议保存 model、model_version、prompt、category、aspect_ratio、resolution、cost、generation_time、score、image_url 和 test_date。这样你的网站以后可以形成可复现的模型评测,而不是只展示一张“最好看的图”。
生成参数也应记录在 Prompt 之外:图片比例决定构图空间,分辨率影响细节和成本,生成数量影响筛选机会。常见比例包括 1:1、4:5、3:4、16:9 和 9:16;清晰度可以记录为标准、2K 或 4K;数量则记录单次生成几张。不要只比较最好的一张,还要记录稳定性、失败率和平均生成时间。
参考资料与官方指南
- OpenAI Academy:Creating images with ChatGPT
- Google AI for Developers:Imagen Prompt Guide
- Adobe:Firefly Image Prompting & Controls Guide
- Midjourney 官方文档
- CHI 2022:Design Guidelines for Prompt Engineering Text-to-Image Generative Models
- A Taxonomy of Prompt Modifiers for Text-to-Image Generation
- EMNLP 2024:Words Worth a Thousand Pictures
FAQ
提示词越长越好吗?
不是。信息清晰、具体、彼此不冲突,比长度更重要。
静态图片需要写运镜吗?
静态图片可以使用摄影机位、景别和镜头语言;推拉摇移、跟拍和环绕更适合放到视频生成提示词中。
应该用中文还是英文 Prompt?
取决于模型。中文模型和支持多语言的模型可以直接使用中文;如果某个模型对英文风格词、摄影词支持更稳定,可以保留英文关键词并用自然语言补充上下文。最好用同一意思做小规模对照测试。
继续阅读:查看 GPT Image 2 完整介绍,了解模型优势、官方入口、价格、图片编辑与提示词实测。