图生图教程 · 参考图反推 · 最后更新 2026-09-04
如何通过参考图反推提示词,再用 AI 重新生成图片
当你看到一张喜欢的图片,却不知道怎样写出相似的提示词,可以先让 AI 分析参考图,再把分析结果交给图片模型重新生成。这篇文章记录一次完整的“参考图 → 提示词 → 新图片”实践。
这项功能是怎么工作的?
这里所说的图生图,并不是直接复制原图,而是先理解原图包含的视觉信息。我们把图片拆成主体、场景、构图、光线、风格、色彩、文字和材质等部分,再把这些信息整理成图片模型能够执行的提示词。
这样做的好处是提示词可以继续修改。你可以保留原图的构图和质感,也可以替换人物、环境、颜色或文字,得到一张具有相似视觉逻辑但内容全新的图片。
上传参考图→反向分析→整理提示词→重新生成→对比优化
第一步:用模板反向分析参考图
先把参考图上传到支持看图的 AI,例如 DeepSeek,然后输入下面的模板。模板要求 AI 不只描述“这是什么”,还要说明对象之间的位置、镜头视角、光线方向和材料质感。
请扮演专业的图像分析师和提示词设计师,分析我上传的参考图,并生成一段适合 AI 绘图工具使用的中文图片提示词。
请按照以下维度分析:
1. 主体:说明人物、产品或主要对象的外观、动作、表情、服装和数量。
2. 场景:说明室内或室外环境、背景元素、空间关系和前后景层次。
3. 构图:说明主体位置、画面比例、取景范围、镜头视角和构图方式。
4. 光线:说明主光方向、明暗关系、阴影、反光和整体氛围。
5. 风格:说明是商业摄影、电影剧照、插画、3D 渲染、胶片或其他视觉风格。
6. 色彩:说明主色、辅助色、冷暖倾向、饱和度和对比度。
7. 文字与图形:准确记录画面中的标题、副标题、Logo、按钮、标签和二维码位置。
8. 质感:说明材质、纹理、景深、颗粒、雾气、反射和其他关键细节。
最后将分析结果整合成一段不超过 600 字的中文提示词,使用逗号分隔关键词,并在末尾给出推荐图片比例。不要虚构参考图中不存在的文字。
第二步:从参考图中提取可执行的提示词
下面这张参考图是一幅撕裂报纸与复古海报拼成的人脸。只写“拼贴风人像”无法稳定复现它,因为模型还不知道脸部占比、纸张层次、主色和光线。

参考图:复古撕纸拼贴人像
使用反向分析模板后,AI 会把图片拆解成下面这些可执行的信息。每一项都回答一个具体问题:画什么、在哪里、怎样取景、怎样打光,以及使用什么材料表现。
主体:由多层撕裂报纸和海报碎片拼接而成的人脸特写,表情平静,双眼直视前方,服装不可见,主体数量为一个面部。
场景:类似贴满旧海报的破旧墙面,没有明确室内外环境。前景是撕裂、翘起的纸张碎片,后景是平整的背景海报,纸张与面部交织。
构图与视角:脸部位于画面中央,占据约90%的面积,极近景特写,正面平视,中心对称构图。
光影:均匀的漫反射平光,没有强烈定向主光,阴影主要来自纸张边缘的微小立体投影。
色彩:复古黄、蓝、红为主,米白和黑色为辅,冷暖交错,整体偏暖,高饱和度,高对比。
风格或媒介:混合媒介拼贴艺术、街头艺术、复古海报和插画风格。
细节:清晰的撕裂纤维、多层纸张堆叠、卷边、剥落、粗糙表面和印刷颗粒,呈现平面媒介的立体化效果。
限制条件:不要出现真实可读的现代标题、Logo、按钮或二维码,画面中的字母只作为旧海报残片出现,推荐4:3横向构图。
将反向分析得到的提示词输入 Seedream 5.0,即可重新生成一张延续参考图视觉语言的图片。这里追求的不是像素级复刻,而是尽可能保留原图的主体比例、中心构图、复古配色与撕纸质感。

生成结果:使用反推提示词重新生成的拼贴人像
第三步:用同一套提示词对比不同模型
反向分析解决的是“如何描述图片”,模型对比解决的是“哪个模型更适合这类任务”。为了让比较有意义,模型、比例和生成次数之外的条件应尽量保持一致。这里采用同一套结构化提示词:
图片用途 → 主体 → 动作或状态 → 环境 → 构图与视角 → 光影 → 色彩 → 风格或媒介 → 细节 → 限制条件
这次测试的目标是生成一张面向创作者的 AI 图片工具宣传海报。提示词明确了桌面场景、笔记本位置、左侧留白、品牌文案和 16:9 比例:
图片用途:面向创作者的 AI 图片工具宣传海报,适合网站首页和社交媒体分享。
主体:画面中心是一台打开的笔记本电脑,屏幕显示由文字生成的彩色视觉作品,旁边摆放几张不同风格的打印图片和一支黑色记号笔。
动作或状态:笔记本处于展示状态,打印图片自然散落在桌面上,画面传达正在进行创作的感觉。
环境:简洁的创意工作室桌面,浅灰色背景,桌面上有纸张、色卡和少量设计工具,背景干净并留出排版空间。
构图与视角:横版海报,三分法构图,笔记本位于画面右侧偏下,打印图片形成斜线引导,左侧保留大面积留白用于标题,轻微俯视视角,中近景。
光影:柔和的侧上方自然光,物体边缘有细腻高光,阴影方向统一,屏幕带有轻微玻璃反光。
色彩:米白、浅灰和深黑为基础色,加入蓝紫和珊瑚橙作为视觉强调色,中等饱和度,冷暖平衡。
风格或媒介:高端科技品牌广告,照片级写实,干净的商业产品摄影,细节清晰,带有轻微胶片颗粒。
细节:笔记本金属机身、纸张纤维、桌面细微纹理、屏幕玻璃反光和柔和接触阴影,主体清晰,背景轻微虚化。
限制条件:左上角放置小型品牌文字“LNKLING IMAGE”,左侧主标题为“Create More With AI”,副标题为“Turn ideas into images”,右下角放置“Explore Image”,所有文字清晰可读,层级分明,不添加其他无关文字,16:9 横版。
Seedream 5.0 Pro桌面细节丰富,商业摄影感更强,标题层级清晰。
ChatGPT Image 2构图稳定,左侧留白充分,视觉作品与桌面道具关系自然。
Imagen 3画面更简洁,产品主体突出,但排版和细节处理有所不同。从三组结果中能看出什么?
即使使用完全相同的提示词,不同模型仍会重新理解“高端”“自然散落”和“留白”等描述。有的模型更擅长写实材质,有的更擅长遵循构图,还有的在生成清晰文字时更稳定。因此,模型对比不能只看哪张最漂亮,还要看它是否完成了用途、构图和文字要求。
如何提高反推和再生成的成功率?
- 先检查主体数量、位置、占比和镜头距离,这些因素最直接地决定构图。
- 把抽象风格拆成可观察的特征,例如光源方向、材料、颗粒和色彩对比。
- 参考图中的文字必须单独记录;重要品牌文字生成后仍应人工检查。
- 固定模型、比例和分辨率,一次只调整一到两个变量,才能知道哪项修改真正有效。
- 不要追求像素级复制。反向提示词更适合提取视觉方法,再创作新的内容。
这套方法同样适用于产品图、电影海报、人物摄影、插画和社交媒体封面。只要参考图能够被拆解成清晰的视觉信息,就可以通过提示词继续编辑、复用和跨模型测试。