上传一张照片,添加 prompt,模型就会构建一张新图像,在改变你所要求内容的同时,保留参考图的构图、姿态、光照或风格。
That is image-to-image generation, and it solves the problem text prompts cannot. Text alone cannot match something that already exists, whether that is your product, your character, your layout, or a look you have spent years refining.
要点总结
- 图生图会从参考图中读取结构和风格,而不是复制它的像素。构图和姿势能可靠地保留下来,细节则不然。
- 精确的 logo 和小号文字是弱项,因此请打算使用蒙版编辑并进行人工核查,而非指望一段 prompt 搞定。
- 不同模型各有擅长的任务,这正是把一张参考图跑两三个模型胜过押注单一模型的原因。
- 较新的编辑器取消了保真度滑块,因此现在需要在 prompt 里明确写出保留要求。
- 上传你并不拥有权利的参考图本身就是一种风险,与输出最终呈现的样子无关。
什么是图生图 AI 图像生成器?
基于图像的 AI 图像生成器,通常称为 图生图 或 img2img,它接受两个输入而非一个:一张参考图和一段文本 prompt。模型会从参考图中读取色彩、结构、光影和姿态,而不是直接复制像素。然后再根据你的 prompt 生成一张全新的图像。
如果你只用过文生图,两者的差别在掌控力上立刻显现。文字 prompt 可以描述“一位穿红色夹克、四分之三侧面的女性”,却无法重现某个特定的女性、特定的夹克或特定的相机角度。
参考图可以做到。在 OpenArt 上,你可以在填写 prompt 的同时上传照片,输出便会保留你的构图,而风格、氛围或细节随之改变。
图生图与文生图
两种方式都基于相同的底层模型,只是解决的问题不同。
| 尺寸 | 图生图 | 文生图 |
|---|---|---|
| 输入 | 参考图加文本 prompt | 仅文本 prompt |
| 掌控力 | 高,因为构图和姿态锚定在参考图上 | 较低,因为模型是根据你的描述来构建的 |
| 一致性 | 在多次生成中保持相同的主体或布局 | 每次生成都从零开始 |
| 适合 | 产品拍摄、风格迁移、角色创作、照片重塑 | 概念构思、探索、全新场景 |
当你还在探索、不确定想要什么时,用文生图。当你手上已有素材——比如产品照片、角色设定图、草图或版式——需要生成忠于原图的版本时,就用图生图。
图生图 AI 的工作原理
扩散模型的处理方式是:先把你的参考图编码成压缩形式,加入可控量的噪点,再用你的 prompt 引导去噪。Hugging Face 官方文档说得很直白:强度值越高,模型就有越大的空间生成与参考图不同的内容。当强度为 1.0 时,参考图「基本会被忽略」。
模型会从你的参考图中提取结构和风格。它能可靠地传递构图、配色、光照方向、姿态和相机角度,但不能可靠传递的是精确的细节。
Photoroom 于 2026 年 7 月对 850 款服饰和配饰产品进行了 3400 次生成测试。表现最佳的模型仅在 29.0% 的生成中通过其产品准确性检查。最常见的失败是 logo 或文字失真,占 20.1%。Photoroom 售卖一项产品还原度服务,因此对这一结论有利益关系。
The lesson holds even allowing for the source. If your work depends on an exact label or logo, plan on masked edits and a human check, not prompts alone.
从参考图迁移风格
风格迁移之所以奏效,是因为模型会将参考图的画风与内容分开解读。Midjourney 的文档说得很好:风格参考"捕捉现有图像的视觉氛围",即它的色彩、媒介、纹理或光影,但"不会复制物体或人物"。
同样的思路适用于各类工具。参考图提供外观,prompt 提供主体。
要在一批图片中保持统一外观,请把它保存下来,而不是每次都重新上传。OpenArt 的 Brand Kit 会在项目层面存储你的配色、字体和风格参考,OpenArt Characters 则会存储一个人物,你可以在后续图片中标记他。
控制输出保真度
Stable Diffusion 工具带有强度或去噪滑块,可直接设定平衡。计算很简单:把强度乘以推理步数就是实际运行的步数,所以强度 0.8 搭配 50 步会运行 40 步的变化。
简单来说,数值越低,输出越贴近你上传的照片;越高则给模型更大的发挥自由。Stable Diffusion Art 的取值可作大致参考:0.2 左右为轻微改动,0.6 为大幅改动,1.0 为极大改动。网上看到的更精确数字,请当作别人测试出的默认值而非官方指引,自己摸索出适合的即可。
OpenArt 在图生图中通过创意滑块来处理这一点,从贴近原图的细微重塑,到只保留大致构图的大胆再创作,任你选择。
Midjourney 使用图像权重,写作 --iw。其文档列出的取值范围是 0 到 3,V8.1 默认值为 1,V8.2 尚未公布数值。
像 FLUX.1 Kontext 和 GPT Image 2 这样较新的指令式编辑器彻底取消了滑块。你通过在 prompt 中写入保留条款来控制保真度。
如何从参考图生成图片,分步详解
各个平台的流程大致相同。以下是在 OpenArt 上的做法。
- 在此处上传你的参考图 AI 图像生成器.
- 写你的 prompt。描述你想要的最终图片,而不是编辑参考图的指令。
- 选一个模型。GPT Image 2 擅长处理复杂指令和小字体,Nano Banana Pro 适合搭配多张参考图的写实创作,而 Seedream 4.5 是动漫和扁平插画的首选。
- 调整创意滑块。数值越低越贴近参考图,越高则给模型更多重新演绎的空间。
- 生成、对比多达 8 个变体,并下载你想要的那些。
Speed depends on the model. FLUX.1 Kontext makes a 1024 by 1024 image in three to five seconds. Nano Banana averages about ten seconds on Replicate's measurements. OpenAI says complex GPT Image 2 prompts can take up to two minutes.
最适合图生图的 AI 模型
没有哪个模型能在所有任务上胜出,这正是把一张参考图跑几个模型的实际理由。在下列模型中,GPT Image 2、Nano Banana Pro 和 Seedream 共用 OpenArt 的积分池,所以比较这三者不必比较各自的订阅。FLUX、Stable Diffusion 和 Midjourney 则各需自己的账户。
- FLUX(Black Forest Labs)。 在 BFL 自家的 KontextBench 上,FLUX.1 Kontext 在文字编辑和角色保留方面得分最高。它是首个为多轮编辑打造、能在多次改动中保持身份一致的模型。BFL 坦承其局限,并记录了连续六次编辑后可见的画质退化。它现在会引导新项目使用 FLUX.2,后者通过 API 最多可接受 8 张参考图。
- GPT Image 2(OpenAI)。 每次编辑请求最多可接收 16 张输入图像,并以高还原度处理每一张输入。它在 Artificial Analysis 图像编辑排行榜上以 1256 Elo 位居第三。在学术基准 GEditBench v2 上,GPT Image 1.5 以 1260 分获得最高的指令遵循得分,而 Nano Banana Pro 拿下综合第一。
- Nano Banana Pro(Google)。 官方名称为 Gemini 3 Pro Image。Google 说明单个 prompt 最多支持 14 张参考输入,其中 6 张可为高还原度,并可对最多五人保持稳定的相似度。它原生输出 4K。
- Seedream(字节跳动)。 动漫、插画和海报排版的首选。Seedream 5.0 Pro 可融合多达 10 张参考图,而 Seedream 4.5 在 2D 动画风格上表现更强。
- Stable Diffusion。 若自行运行,它仍是掌控最精细的方案,配有强度滑块和 ControlNet 结构引导,不过官方 SD 3.5 ControlNet 仅涵盖 Canny、Depth 和 Blur,姿态或草图引导则来自社区。
- Midjourney(V8.2)。 Strong default aesthetics through image prompts and style references. Its Omni Reference feature still runs on V7, costs twice the GPU time, and does not work with Vary Region, Pan, Zoom Out, Fast Mode, or Draft Mode. There is no free tier, and plans start at $10 a month.
Replicate 于 2025 年 9 月对上一代模型做过对比测试,发现 FLUX.1 Kontext 和 Nano Banana 在文字编辑中最能保留排版与质感,而 Nano Banana 和 Seedream 在风格迁移上胜过 Kontext。在批量生成花费积分之前,先用你自己的参考图测试一下。
热门用例
只要输出必须与已有的东西相匹配,图生图就能派上用场。
- 风格迁移。 为你已有的照片套用绘画风格、电影质感或品牌美学。
- 产品摄影。 把手机随手拍的照片变成放在新表面上的影棚打光成片,同时保持产品的形状不变。
- 动漫与艺术风格转换。 将人像转换为动漫、插画或漫画风格,同时保留身份和姿态。
- 角色一致性。 在数十次生成中保持同一张脸、同一套服装和相同比例。
- 融合参考图。 将多个输入融合成一个输出,Nano Banana Pro 最多可用 14 张,FLUX.2 最多 8 张。
- 图生视频。 用成品画面作为片段的首帧。
跨输出的角色一致性
身份漂移是参考图工作中最常见的失败模式。同一张脸每次生成都会略有不同,到第十张图时,角色已经悄悄变成了另一个人。
OpenArt 角色 通过把角色变成保存的资产而非每次 prompt 的参考图来应对漂移。用 prompt、参考照片或预设一次构建好角色,然后把同一角色标记到之后的任意图片或视频中,包括在此处的场景 OpenArt Director,多场景视频工具。
这一差异远比任何跑分数据都重要。用参考图,模型每次都得重新推导面部;而用已保存的角色,模型每次都从同一个起点出发。
Prompt engineering for image-to-image
如今每款编辑器都采用自然语言而非关键词标签。这套规则在 FLUX、GPT Image 和 Gemini 上通用:描述你想要的最终图像,而不是你想做的编辑。
明确说明必须保留什么,并选用精确的动词。Black Forest Labs 在其 prompt 指南中直接指出:「transform」意味着彻底改变,而「change the clothes」或「replace the background」则让你能掌控真正改变的内容。
转换为动漫风格时,请指明目标画风并锁定身份特征:"创作一张 2D 动漫插画,线条干净、赛璐璐上色,保留人物的面部身份、发型、姿势和构图,仅改变渲染风格。"
对于写实风格的重绘,请对取景和背景加上硬性限制。OpenAI 官方的 prompt 指南建议明确列出排除项,包括使用诸如“无额外元素”之类的措辞,以防止模型跑偏。
做产品创作时,Google 公布的模板值得借鉴,无论你用哪个模型。它会指明光照设置、拍摄角度、背景表面,以及必须保持清晰的细节。
当你要替换文字或标志时,请用引号把它引出来。FLUX Kontext 记录的写法是:Replace "[original text]" with "[new text]"。
无需重来即可修正结果
第一次生成往往不是最终结果。当只有一处出错时,重新开始会白白浪费积分。在 OpenArt 上,常见的修改都能在同一画布上完成。
- 区域编辑。 图像编辑的区域编辑模式让你只选中某一处,仅修改该区域。
- 填充与移除。 生成式 AI 填充可填补空隙、移除物体或扩展画面。
- 画面变化。 扩展图像可将画布拓宽至任意宽高比或社交平台预设尺寸。
- 背景。 AI 抠图工具能给出干净的剪影,AI 背景替换工具则能更换场景。
- 面部。 AI 面部编辑器可处理表情变化和修饰润色。
- 放大。 这份 图像放大工具 支持精确、精修或创意模式运行,当皮肤质感至关重要时,Vellum 皮肤增强器可将画质提升至 8K。
所有这些修复都在同一张画布上、用你生成时所用的模型完成。而在 Midjourney 上,局部编辑要先放大后在 Discord 上进行,使用的是较旧的模型版本。
商业用途、版权与所有权
Start with the baseline. The U.S. Copyright Office's January 2025 report says AI output can be protected "only where a human author has determined sufficient expressive elements." That covers three cases. Your own work is visible in the output, or you arrange the output creatively, or you modify it creatively. Prompts on their own do not count.
实际上这意味着纯靠 prompt 生成的图像不受版权保护,而你自己的编辑与排布才是版权的来源。
平台条款则叠加于此之上,且差异很大。OpenArt 对你的输出不主张任何所有权或版权。符合条件的付费套餐享有商用权,无需支付版税,也无需署名。OpenAI 的消费者与企业条款将输出权利归于你,前提是你对输入拥有权利并遵守了使用政策。Midjourney 则要求年营收超过 100 万美元的公司(或其员工)先购买 Pro 或 Mega 套餐,才能拥有其生成的资产。
参考图工作有两大特有的风险。
上传一张你并不拥有权利的受版权保护照片,无论输出结果如何,本身就可能引发问题。而发布的输出若最终与受保护作品高度相似,即便无人有意为之,也可能招致侵权主张。
这份 IP 安全检查 会在你发布前对输出进行筛查,检测品牌相似度、名人面孔和肖像风险。绿色结果表示未检测到任何问题,警告表示需要有人查看,不安全则表示存在明显的相似性。OpenArt 声明结果仅供参考,因此请把绿色结果视为初筛,而非法律许可。
套餐与积分
OpenArt 运行在一个统一的积分池上,涵盖其图像、视频和音频模型。你可以免费开始,7 天内享有 40 积分且无需绑卡,之后基础图像生成还有每日免费积分额度。
| 套餐 | 每月 | 每月积分 |
|---|---|---|
| 入门版 | $14 | 4,000 |
| Plus | $34 | 12,000 |
| Pro | $56 | 24,000 |
| Wonder | $240 | 106,000 |
这些价格为按月计费。按年计费可让每个套餐降价,最多省 27%,且所有付费套餐导出时均无水印。基础积分每月重置,15 美元的额外积分包约提供 5000 积分,且可以结转。
品牌套件 如果你为某个品牌做生成,值得设置一番。它会在项目层级保存你的标志、精确的十六进制色值、字体、产品素材、风格参考图和品牌规则,这样无论你选择哪个模型,一批参考图都能保持一致。
快速上手
判断图生图效果最快的方法,就是拿你自己的参考图跑一遍。
- 打开 OpenArt 图像生成器并上传你的参考照片。
- 写一段描述最终图像的 prompt,并说明哪些部分必须保持不变。
- 选择模型,设置创意滑块,即可生成。
- 对比各种变体,然后用区域编辑或超分工具修复接近理想的那一张。
- If the same character has to appear again later, build it once in Characters and tag it in future prompts.
常见问题
我可以上传哪些文件格式和尺寸作为参考图?
大多数平台都支持常见的网页格式,并各有尺寸上限。Midjourney 接受 .png、.gif、.webp、.jpg 和 .jpeg,最大 10 MB。无论用哪款工具,一张清晰、光线充足、分辨率接近目标的参考图效果最好,因为模型无法还原参考图中原本就没有的细节。
我该如何控制输出与参考图的贴近程度?
这取决于工具。在 Stable Diffusion 工具上,调低强度滑块;在 Midjourney 上,调高 --iw 趋近 3。FLUX Kontext 和 GPT Image 2 没有滑块,请改在 prompt 中写入需保留的内容,例如“同时保持相同的面部特征和发型”。在 OpenArt 上,创意滑块即可实现,你还能在不同设置下生成多达 8 个变体来查看差异范围。
我可以用真人照片作为参考图吗?
只有在获得当事人同意时才可以。OpenAI 的使用政策禁止在未经同意的情况下使用他人肖像(包括写实图像或声音),尤其是那些可能让人分不清真假的方式。纽约州现要求广告商在明知使用合成表演者时须清晰披露。首次违规罚款 1,000 美元,此后每次 5,000 美元。任何涉及真实人物的商业用途,都要从所有相关方获得授权,包括摄影师和模特。
哪个模型最适合图生图?
这取决于任务。在其开发者的基准上,FLUX Kontext 在局部编辑和角色保留方面领先。GPT Image 2 擅长处理复杂的多图指令和小号文字。Nano Banana Pro 在写实作品上领先,且能接收最多的参考图,而 Seedream 是动漫和插画的首选。不同任务的排名会变动,因此不妨把你的参考图放到 OpenArt 上的 GPT Image 2、Nano Banana Pro 和 Seedream 里跑一遍再对比——这三者共用同一套积分。
为什么我产品的 logo 生成出来是错的?
因为模型是重建 logo 而非复制它。Photoroom 的测试发现,logo 和文字变形是最常见的准确度失败。解决办法是不要让 prompt 去做这件事:先生成场景,再用局部编辑单独修复该区域,并在交付前用肉眼检查。
如何避免角色的面部在多次生成之间发生变化?
别再反复上传参考图,把角色保存起来吧。在 OpenArt Characters 中用 prompt、照片或预设一次构建好,然后在之后的每次生成中标记该角色。这样模型每次都从同一起点开始,而不是从新的参考图重新推导面孔。
我能把结果转成视频吗?
Yes. Once you have a still you like, Image to Video animates it. OpenArt Director goes further and builds a multi-scene video that keeps the same characters across shots. Generating the still first and animating it second gives you more control than describing the whole video in one prompt.