限时优惠!年度套餐低至 27% 折扣,开启一整年无限创作。

查看套餐 ›
图像指南

图生图 AI 图像生成器:图生图工作流完全指南

Sameer Sohail Aug 21, 2026 阅读需 7 分钟
用以下方式总结:
AI Image Generator From Image: The Complete Guide to Image-to-Image Workflows

上传一张照片,添加 prompt,模型就会构建一张新图像,在改变你所要求内容的同时,保留参考图的构图、姿态、光照或风格。

这就是图生图生成,它解决了文本 prompt 无法解决的问题。仅凭文本无法匹配已经存在的事物,无论是你的产品、你的角色、你的排版,还是你多年打磨出来的某种风格。

要点总结

  • 图生图会从参考图中读取结构和风格,而不是复制它的像素。构图和姿势能可靠地保留下来,细节则不然。
  • 精确的 logo 和小号文字是弱项,因此请打算使用蒙版编辑并进行人工核查,而非指望一段 prompt 搞定。
  • 不同模型各有擅长的任务,这正是把一张参考图跑两三个模型胜过押注单一模型的原因。
  • 较新的编辑器取消了保真度滑块,因此现在需要在 prompt 里明确写出保留要求。
  • 上传你并不拥有权利的参考图本身就是一种风险,与输出最终呈现的样子无关。

什么是图生图 AI 图像生成器?

基于图像的 AI 图像生成器,通常称为 图生图 或 img2img,它接受两个输入而非一个:一张参考图和一段文本 prompt。模型会从参考图中读取色彩、结构、光影和姿态,而不是直接复制像素。然后再根据你的 prompt 生成一张全新的图像。

如果你只用过文生图,两者的差别在掌控力上立刻显现。文字 prompt 可以描述“一位穿红色夹克、四分之三侧面的女性”,却无法重现某个特定的女性、特定的夹克或特定的相机角度。

参考图可以做到。在 OpenArt 上,你可以在填写 prompt 的同时上传照片,输出便会保留你的构图,而风格、氛围或细节随之改变。

图生图与文生图

两种方式都基于相同的底层模型,只是解决的问题不同。

尺寸 图生图 文生图
输入 参考图加文本 prompt 仅文本 prompt
掌控力 高,因为构图和姿态锚定在参考图上 较低,因为模型是根据你的描述来构建的
一致性 在多次生成中保持相同的主体或布局 每次生成都从零开始
适合 产品拍摄、风格迁移、角色创作、照片重塑 概念构思、探索、全新场景

当你还在探索、不确定想要什么时,用文生图。当你手上已有素材——比如产品照片、角色设定图、草图或版式——需要生成忠于原图的版本时,就用图生图。

图生图 AI 的工作原理

扩散模型的处理方式是:先把你的参考图编码成压缩形式,加入可控量的噪点,再用你的 prompt 引导去噪。Hugging Face 官方文档说得很直白:强度值越高,模型就有越大的空间生成与参考图不同的内容。当强度为 1.0 时,参考图「基本会被忽略」。

模型会从你的参考图中提取结构和风格。它能可靠地传递构图、配色、光照方向、姿态和相机角度,但不能可靠传递的是精确的细节。

Photoroom 于 2026 年 7 月对 850 款服饰和配饰产品进行了 3400 次生成测试。表现最佳的模型仅在 29.0% 的生成中通过其产品准确性检查。最常见的失败是 logo 或文字失真,占 20.1%。Photoroom 售卖一项产品还原度服务,因此对这一结论有利益关系。

即使考虑到素材来源,这个教训依然成立。如果你的作品依赖于精确的标签或 logo,请规划好蒙版编辑和人工检查,而不是仅靠 prompt。

从参考图迁移风格

风格迁移之所以奏效,是因为模型会将参考图的画风与内容分开解读。Midjourney 的文档说得很好:风格参考"捕捉现有图像的视觉氛围",即它的色彩、媒介、纹理或光影,但"不会复制物体或人物"。

同样的思路适用于各类工具。参考图提供外观,prompt 提供主体。

要在一批图片中保持统一外观,请把它保存下来,而不是每次都重新上传。OpenArt 的 Brand Kit 会在项目层面存储你的配色、字体和风格参考,OpenArt Characters 则会存储一个人物,你可以在后续图片中标记他。

控制输出保真度

Stable Diffusion 工具带有强度或去噪滑块,可直接设定平衡。计算很简单:把强度乘以推理步数就是实际运行的步数,所以强度 0.8 搭配 50 步会运行 40 步的变化。

简单来说,数值越低,输出越贴近你上传的照片;越高则给模型更大的发挥自由。Stable Diffusion Art 的取值可作大致参考:0.2 左右为轻微改动,0.6 为大幅改动,1.0 为极大改动。网上看到的更精确数字,请当作别人测试出的默认值而非官方指引,自己摸索出适合的即可。

OpenArt 在图生图中通过创意滑块来处理这一点,从贴近原图的细微重塑,到只保留大致构图的大胆再创作,任你选择。

Midjourney 使用图像权重,写作 --iw。其文档列出的取值范围是 0 到 3,V8.1 默认值为 1,V8.2 尚未公布数值。

像 FLUX.1 Kontext 和 GPT Image 2 这样较新的指令式编辑器彻底取消了滑块。你通过在 prompt 中写入保留条款来控制保真度。

如何从参考图生成图片,分步详解

各个平台的流程大致相同。以下是在 OpenArt 上的做法。

  1. 在此处上传你的参考图 AI 图像生成器.
  2. 写你的 prompt。描述你想要的最终图片,而不是编辑参考图的指令。
  3. 选一个模型。GPT Image 2 擅长处理复杂指令和小字体,Nano Banana Pro 适合搭配多张参考图的写实创作,而 Seedream 4.5 是动漫和扁平插画的首选。
  4. 调整创意滑块。数值越低越贴近参考图,越高则给模型更多重新演绎的空间。
  5. 生成、对比多达 8 个变体,并下载你想要的那些。

速度取决于模型。FLUX.1 Kontext 生成一张 1024×1024 的图像需要三到五秒。根据 Replicate 的测算,Nano Banana 平均约为十秒。OpenAI 表示,复杂的 GPT Image 2 prompt 最长可能需要两分钟。

最适合图生图的 AI 模型

没有哪个模型能在所有任务上胜出,这正是把一张参考图跑几个模型的实际理由。在下列模型中,GPT Image 2、Nano Banana Pro 和 Seedream 共用 OpenArt 的积分池,所以比较这三者不必比较各自的订阅。FLUX、Stable Diffusion 和 Midjourney 则各需自己的账户。

  • FLUX(Black Forest Labs)。 在 BFL 自家的 KontextBench 上,FLUX.1 Kontext 在文字编辑和角色保留方面得分最高。它是首个为多轮编辑打造、能在多次改动中保持身份一致的模型。BFL 坦承其局限,并记录了连续六次编辑后可见的画质退化。它现在会引导新项目使用 FLUX.2,后者通过 API 最多可接受 8 张参考图。
  • GPT Image 2(OpenAI)。 每次编辑请求最多可接收 16 张输入图像,并以高还原度处理每一张输入。它在 Artificial Analysis 图像编辑排行榜上以 1256 Elo 位居第三。在学术基准 GEditBench v2 上,GPT Image 1.5 以 1260 分获得最高的指令遵循得分,而 Nano Banana Pro 拿下综合第一。
  • Nano Banana Pro(Google)。 官方名称为 Gemini 3 Pro Image。Google 说明单个 prompt 最多支持 14 张参考输入,其中 6 张可为高还原度,并可对最多五人保持稳定的相似度。它原生输出 4K。
  • Seedream(字节跳动)。 动漫、插画和海报排版的首选。Seedream 5.0 Pro 可融合多达 10 张参考图,而 Seedream 4.5 在 2D 动画风格上表现更强。
  • Stable Diffusion。 若自行运行,它仍是掌控最精细的方案,配有强度滑块和 ControlNet 结构引导,不过官方 SD 3.5 ControlNet 仅涵盖 Canny、Depth 和 Blur,姿态或草图引导则来自社区。
  • Midjourney(V8.2)。 通过图像 prompt 和风格参考实现出色的默认美学效果。它的 Omni Reference 功能仍运行在 V7 上,耗费两倍的 GPU 时间,且不支持 Vary Region、Pan、Zoom Out、Fast Mode 或 Draft Mode。它没有免费版,套餐起价为每月 10 美元。

Replicate 于 2025 年 9 月对上一代模型做过对比测试,发现 FLUX.1 Kontext 和 Nano Banana 在文字编辑中最能保留排版与质感,而 Nano Banana 和 Seedream 在风格迁移上胜过 Kontext。在批量生成花费积分之前,先用你自己的参考图测试一下。

热门用例

只要输出必须与已有的东西相匹配,图生图就能派上用场。

  • 风格迁移。 为你已有的照片套用绘画风格、电影质感或品牌美学。
  • 产品摄影。 把手机随手拍的照片变成放在新表面上的影棚打光成片,同时保持产品的形状不变。
  • 动漫与艺术风格转换。 将人像转换为动漫、插画或漫画风格,同时保留身份和姿态。
  • 角色一致性。 在数十次生成中保持同一张脸、同一套服装和相同比例。
  • 融合参考图。 将多个输入融合成一个输出,Nano Banana Pro 最多可用 14 张,FLUX.2 最多 8 张。
  • 图生视频。 用成品画面作为片段的首帧。

跨输出的角色一致性

身份漂移是参考图工作中最常见的失败模式。同一张脸每次生成都会略有不同,到第十张图时,角色已经悄悄变成了另一个人。

OpenArt 角色 通过把角色变成保存的资产而非每次 prompt 的参考图来应对漂移。用 prompt、参考照片或预设一次构建好角色,然后把同一角色标记到之后的任意图片或视频中,包括在此处的场景 OpenArt Director,多场景视频工具。

这一差异远比任何跑分数据都重要。用参考图,模型每次都得重新推导面部;而用已保存的角色,模型每次都从同一个起点出发。

图生图的 prompt 工程

如今每款编辑器都采用自然语言而非关键词标签。这套规则在 FLUX、GPT Image 和 Gemini 上通用:描述你想要的最终图像,而不是你想做的编辑。

明确说明必须保留什么,并选用精确的动词。Black Forest Labs 在其 prompt 指南中直接指出:「transform」意味着彻底改变,而「change the clothes」或「replace the background」则让你能掌控真正改变的内容。

转换为动漫风格时,请指明目标画风并锁定身份特征:"创作一张 2D 动漫插画,线条干净、赛璐璐上色,保留人物的面部身份、发型、姿势和构图,仅改变渲染风格。"

对于写实风格的重绘,请对取景和背景加上硬性限制。OpenAI 官方的 prompt 指南建议明确列出排除项,包括使用诸如“无额外元素”之类的措辞,以防止模型跑偏。

做产品创作时,Google 公布的模板值得借鉴,无论你用哪个模型。它会指明光照设置、拍摄角度、背景表面,以及必须保持清晰的细节。

当你要替换文字或标志时,请用引号把它引出来。FLUX Kontext 记录的写法是:Replace "[original text]" with "[new text]"。

无需重来即可修正结果

第一次生成往往不是最终结果。当只有一处出错时,重新开始会白白浪费积分。在 OpenArt 上,常见的修改都能在同一画布上完成。

  • 区域编辑。 图像编辑的区域编辑模式让你只选中某一处,仅修改该区域。
  • 填充与移除。 生成式 AI 填充可填补空隙、移除物体或扩展画面。
  • 画面变化。 扩展图像可将画布拓宽至任意宽高比或社交平台预设尺寸。
  • 背景。 AI 抠图工具能给出干净的剪影,AI 背景替换工具则能更换场景。
  • 面部。 AI 面部编辑器可处理表情变化和修饰润色。
  • 放大。 这份 图像放大工具 支持精确、精修或创意模式运行,当皮肤质感至关重要时,Vellum 皮肤增强器可将画质提升至 8K。

所有这些修复都在同一张画布上、用你生成时所用的模型完成。而在 Midjourney 上,局部编辑要先放大后在 Discord 上进行,使用的是较旧的模型版本。

先从基准说起。美国版权局 2025 年 1 月的报告指出,AI 成品"只有在人类作者确定了足够的表达元素时"才能受到保护。这涵盖三种情况:你自己的作品在成品中可见、你对成品进行了创意编排,或你对其进行了创意修改。仅凭 prompt 是不算数的。

实际上这意味着纯靠 prompt 生成的图像不受版权保护,而你自己的编辑与排布才是版权的来源。

平台条款则叠加于此之上,且差异很大。OpenArt 对你的输出不主张任何所有权或版权。符合条件的付费套餐享有商用权,无需支付版税,也无需署名。OpenAI 的消费者与企业条款将输出权利归于你,前提是你对输入拥有权利并遵守了使用政策。Midjourney 则要求年营收超过 100 万美元的公司(或其员工)先购买 Pro 或 Mega 套餐,才能拥有其生成的资产。

参考图工作有两大特有的风险。

上传一张你并不拥有权利的受版权保护照片,无论输出结果如何,本身就可能引发问题。而发布的输出若最终与受保护作品高度相似,即便无人有意为之,也可能招致侵权主张。

这份 IP 安全检查 会在你发布前对输出进行筛查,检测品牌相似度、名人面孔和肖像风险。绿色结果表示未检测到任何问题,警告表示需要有人查看,不安全则表示存在明显的相似性。OpenArt 声明结果仅供参考,因此请把绿色结果视为初筛,而非法律许可。

套餐与积分

OpenArt 运行在一个统一的积分池上,涵盖其图像、视频和音频模型。你可以免费开始,7 天内享有 40 积分且无需绑卡,之后基础图像生成还有每日免费积分额度。

套餐 每月 每月积分
入门版 $14 4,000
Plus $34 12,000
Pro $56 24,000
Wonder $240 106,000

这些价格为按月计费。按年计费可让每个套餐降价,最多省 27%,且所有付费套餐导出时均无水印。基础积分每月重置,15 美元的额外积分包约提供 5000 积分,且可以结转。

品牌套件 如果你为某个品牌做生成,值得设置一番。它会在项目层级保存你的标志、精确的十六进制色值、字体、产品素材、风格参考图和品牌规则,这样无论你选择哪个模型,一批参考图都能保持一致。

快速上手

判断图生图效果最快的方法,就是拿你自己的参考图跑一遍。

  1. 打开 OpenArt 图像生成器并上传你的参考照片。
  2. 写一段描述最终图像的 prompt,并说明哪些部分必须保持不变。
  3. 选择模型,设置创意滑块,即可生成。
  4. 对比各种变体,然后用区域编辑或超分工具修复接近理想的那一张。
  5. 如果同一个角色之后还需再次出现,只需在 Characters 中构建一次,并在未来的 prompt 中标记它。

常见问题

我可以上传哪些文件格式和尺寸作为参考图?

大多数平台都支持常见的网页格式,并各有尺寸上限。Midjourney 接受 .png、.gif、.webp、.jpg 和 .jpeg,最大 10 MB。无论用哪款工具,一张清晰、光线充足、分辨率接近目标的参考图效果最好,因为模型无法还原参考图中原本就没有的细节。

我该如何控制输出与参考图的贴近程度?

这取决于工具。在 Stable Diffusion 工具上,调低强度滑块;在 Midjourney 上,调高 --iw 趋近 3。FLUX Kontext 和 GPT Image 2 没有滑块,请改在 prompt 中写入需保留的内容,例如“同时保持相同的面部特征和发型”。在 OpenArt 上,创意滑块即可实现,你还能在不同设置下生成多达 8 个变体来查看差异范围。

我可以用真人照片作为参考图吗?

只有在获得当事人同意时才可以。OpenAI 的使用政策禁止在未经同意的情况下使用他人肖像(包括写实图像或声音),尤其是那些可能让人分不清真假的方式。纽约州现要求广告商在明知使用合成表演者时须清晰披露。首次违规罚款 1,000 美元,此后每次 5,000 美元。任何涉及真实人物的商业用途,都要从所有相关方获得授权,包括摄影师和模特。

哪个模型最适合图生图?

这取决于任务。在其开发者的基准上,FLUX Kontext 在局部编辑和角色保留方面领先。GPT Image 2 擅长处理复杂的多图指令和小号文字。Nano Banana Pro 在写实作品上领先,且能接收最多的参考图,而 Seedream 是动漫和插画的首选。不同任务的排名会变动,因此不妨把你的参考图放到 OpenArt 上的 GPT Image 2、Nano Banana Pro 和 Seedream 里跑一遍再对比——这三者共用同一套积分。

为什么我产品的 logo 生成出来是错的?

因为模型是重建 logo 而非复制它。Photoroom 的测试发现,logo 和文字变形是最常见的准确度失败。解决办法是不要让 prompt 去做这件事:先生成场景,再用局部编辑单独修复该区域,并在交付前用肉眼检查。

如何避免角色的面部在多次生成之间发生变化?

别再反复上传参考图,把角色保存起来吧。在 OpenArt Characters 中用 prompt、照片或预设一次构建好,然后在之后的每次生成中标记该角色。这样模型每次都从同一起点开始,而不是从新的参考图重新推导面孔。

我能把结果转成视频吗?

可以。一旦你有了满意的静态图,Image to Video 就能让它动起来。OpenArt Director 更进一步,能构建一段跨镜头保持相同角色的多场景视频。先生成静态图再让它动起来,比用一个 prompt 描述整段视频能给你更多控制。

创作无极限

加入数百万创作者的行列,用 OpenArt 生成图像、视频、角色和故事——全都在一个平台上完成。

免费开始使用 →