期間限定オファー!年間プランが最大27%OFF、1年間の無限のクリエイティビティを解き放とう。

プランを見る ›
画像ガイド

画像から作るAI画像ジェネレーター:Image-to-Imageワークフロー完全ガイド

O
Sameer Sohail
Aug 21, 2026 · 読了時間7分
AI Image Generator From Image: The Complete Guide to Image-to-Image Workflows

Upload a photo, add a prompt, and the model builds a new image that keeps your reference's composition, pose, lighting, or style while changing what you asked it to change.

That is image-to-image generation, and it solves the problem text prompts cannot. Text alone cannot match something that already exists, whether that is your product, your character, your layout, or a look you have spent years refining.

要点

  • image-to-imageは参照画像のピクセルをコピーするのではなく、構図とスタイルを読み取ります。構図やポーズは確実に引き継がれますが、細部は引き継がれません。
  • 正確なロゴや小さな文字が弱点なので、promptに頼らず、マスク編集と人の目によるチェックを前提にしましょう。
  • タスクによって得意なモデルは異なります。だからこそ、1つのモデルに絞るより、1枚の参照画像を2〜3のモデルに通す方が優れているのです。
  • 新しいエディターは忠実度スライダーを廃止したため、保持したい要素は明示的な指示としてpromptに書き込むようになりました。
  • 権利を持たない参照画像をアップロードすること自体が、出力の見た目とは別のリスクになります。

画像から生成するAI画像ジェネレーターとは?

画像から画像を生成するAI画像ジェネレーターは、一般的に次のように呼ばれます image-to-image or img2img, takes two inputs instead of one: a reference image and a text prompt. The model reads color, structure, lighting, and pose from the reference instead of copying its pixels. Then it builds a new image, steered by your prompt.

text-to-imageしか使ったことがなければ、その違いはコントロールの効き方にすぐ表れます。テキストのpromptは「赤いジャケットを着た女性、斜め45度アングル」を説明できますが、特定の女性、特定のジャケット、特定のカメラアングルを再現することはできません。

参照画像なら可能です。OpenArtではpromptと一緒に写真をアップロードするので、構図を保ちながらスタイルや雰囲気、ディテールを変えられます。

image-to-image と text-to-image の比較

どちらのアプローチも同じ基盤モデルを使いますが、解決する課題が異なります。

寸法 画像から画像へ テキストから画像へ
入力 Reference image plus a text prompt Text prompt only
制御性 高い。構図とポーズが参照画像に固定されるため 低め。モデルはあなたの説明から構築するため
一貫性 複数の生成にわたって同じ被写体やレイアウトを 生成のたびに一からやり直し
おすすめの用途 商品撮影、スタイル転送、キャラクター制作、写真のリスタイル コンセプト作り、探索、まったく新しいシーン

まだ探索段階で、自分が何を求めているか分からないときはテキストから画像への生成を使いましょう。製品写真、キャラクターシート、スケッチ、レイアウトなど、すでに素材があり、それに忠実なバリエーションが必要なときは画像から画像への生成を使います。

image-to-image AIの仕組み

Diffusion models handle this by encoding your reference into a compressed form, adding a controlled amount of noise, then using your prompt to guide the cleanup. Hugging Face's own docs put it plainly. A higher strength value gives the model more room to make something different from your reference. At a strength of 1.0, the reference is "more or less ignored."

モデルは参照画像から構造とスタイルを抽出します。構図、カラーパレット、ライティングの方向、ポーズ、カメラアングルは確実に引き継ぎます。確実には引き継げないのは、細部の正確なディテールです。

Photoroomは2026年7月、850点のアパレル・アクセサリー製品を3,400回の生成でテストしました。最良のモデルでも製品の正確性チェックを通過したのは生成の29.0%でした。最も多かった失敗はロゴや文字の歪みで20.1%。Photoroomは製品忠実度レイヤーを販売しているため、この結果には利害関係がある点に留意してください。

The lesson holds even allowing for the source. If your work depends on an exact label or logo, plan on masked edits and a human check, not prompts alone.

参照画像からのスタイル転送

スタイル転送が機能するのは、モデルが参照画像のルックをその内容とは別に読み取るからです。Midjourneyのドキュメントが的確に説明しています。スタイル参照は「既存の画像の視覚的な雰囲気を捉える」もので、つまり色、メディア、テクスチャ、ライティングを指します。それは「オブジェクトや人物をコピーするものではありません」。

The same idea applies across tools. Your reference supplies the look and your prompt supplies the subject.

バッチ全体で見た目を統一するには、毎回アップロードし直すのではなく保存しましょう。OpenArtのBrand Kitはカラー・フォント・スタイル参照をプロジェクト単位で保存し、OpenArt Charactersは後の画像にタグ付けできる人物を保存します。

出力の忠実度をコントロールする

Stable Diffusion系のツールには、そのバランスを直接設定できるstrength(デノイジング)スライダーがあります。計算はシンプルです。strengthと推論ステップ数を掛けると、実際に実行されるステップ数がわかります。strength 0.8で50ステップなら、変化のステップは40回になります。

わかりやすく言うと、設定を低くするとアップロードした写真に近い出力になり、高くするとモデルの自由度が増します。Stable Diffusion Artのスケールが目安として便利です。おおよそ0.2でわずかな変化、0.6で大きな変化、1.0で非常に大きな変化になります。ネットで見かけるより細かい数値は、公式ガイダンスというよりは誰かが検証したデフォルト値だと捉え、自分に合った値を見つけましょう。

OpenArtでは、image-to-imageのクリエイティビティスライダーでこれを調整できます。原画に近い控えめなリスタイルから、大まかな構図だけを残す大胆な再解釈まで自在です。

Midjourneyでは image weight を使い、次のように記述します --iwを代わりに使いましょう。ドキュメントではV8.1で0〜3の範囲、デフォルト1と記載されており、V8.2の値はまだ公開されていません。

Newer instruction-based editors like FLUX.1 Kontext and GPT Image 2 dropped the slider altogether. You control fidelity by writing preservation clauses into the prompt.

参照画像から画像を生成する手順

流れはどこでもほぼ同じです。以下はOpenArtでの手順です。

  1. 参照画像をアップロードする場所: AI画像ジェネレーター.
  2. Write your prompt. Describe the final image you want, not instructions for editing the reference.
  3. モデルを選びましょう。GPT Image 2は複雑な指示や小さな文字の処理に優れ、Nano Banana Proは複数の参照を使ったフォトリアルな作業に適しており、Seedream 4.5はアニメやフラットなイラストに最適です。
  4. クリエイティビティのスライダーを設定します。低くすると参照画像に近づき、高くするとモデルが再解釈する余地が広がります。
  5. 最大8パターンを生成・比較し、気に入ったものをダウンロードできます。

Speed depends on the model. FLUX.1 Kontext makes a 1024 by 1024 image in three to five seconds. Nano Banana averages about ten seconds on Replicate's measurements. OpenAI says complex GPT Image 2 prompts can take up to two minutes.

image-to-imageに最適なAIモデル

すべてのタスクで勝つ単一のモデルは存在しません。これが、1枚の参照画像を複数のモデルに通すべき実際的な理由です。以下のモデルのうち、GPT Image 2、Nano Banana Pro、SeedreamはOpenArtの共有クレジットプールで動作するため、この3つを比較してもサブスクリプションを比較することにはなりません。FLUX、Stable Diffusion、Midjourneyはそれぞれ独自のアカウントが必要です。

  • FLUX(Black Forest Labs)。 BFL自身のKontextBenchでは、FLUX.1 Kontextがテキスト編集とキャラクター保持で最高スコアを記録しました。変更をまたいでアイデンティティを維持するマルチターン編集向けに構築された初のモデルです。BFLはその限界について率直で、6回連続の編集後に目に見える劣化が生じることを記録しています。現在は新規プロジェクトに、APIで最大8枚の参照画像を扱えるFLUX.2を推奨しています。
  • GPT Image 2(OpenAI)。 1回の編集リクエストで最大16枚の入力画像を受け付け、すべての入力を高忠実度で処理します。Artificial Analysisの画像編集リーダーボードでは1,256 Eloで3位につけています。学術的なGEditBench v2では、GPT Image 1.5が1,260で指示追従スコアのトップを記録し、Nano Banana Proが総合1位を獲得しました。
  • Nano Banana Pro(Google)。 正式にはGemini 3 Pro Image。Googleは1つのpromptで最大14枚の参照入力(うち6枚は高忠実度)と、最大5人までの一貫した容姿再現をドキュメント化しています。ネイティブ4Kで出力します。
  • Seedream(ByteDance)。 アニメ、イラスト、ポスターレイアウトに最適な選択肢。Seedream 5.0 Proは最大10枚の参照画像をブレンドでき、Seedream 4.5はより強力な2Dアニメーションのスタイリングを備えています。
  • Stable Diffusion。 自前で動かせば依然として最も手動コントロールが効きます。strengthスライダーとControlNetの構造ガイドが使えますが、公式のSD 3.5 ControlNetsが対応するのはCanny、Depth、Blurのみで、ポーズやスケッチのガイドはコミュニティ製です。
  • Midjourney(V8.2)。 Strong default aesthetics through image prompts and style references. Its Omni Reference feature still runs on V7, costs twice the GPU time, and does not work with Vary Region, Pan, Zoom Out, Fast Mode, or Draft Mode. There is no free tier, and plans start at $10 a month.

Replicateは2025年9月、旧世代のモデルで独自の比較を行いました。その結果、テキスト編集ではFLUX.1 KontextとNano Bananaがタイポグラフィと質感を最もよく保ち、スタイル転送ではNano BananaとSeedreamがKontextを上回りました。バッチにクレジットを使う前に、自分の参照画像でテストしましょう。

主な活用例

image-to-imageは、出力が既存の何かに一致しなければならない場面ならどこでも真価を発揮します。

  • スタイル転送。 手持ちの写真に、絵画調、映画のような質感、ブランドの美学を適用します。
  • 商品撮影。 スマホのスナップ写真を、製品の形状はそのままに、新しい面に置いたスタジオ照明のショットに変えます。
  • アニメ・アート変換。 アイデンティティやポーズを保ちつつ、ポートレートをアニメ、イラスト、コミック調に変換します。
  • キャラクターの一貫性。 何十回もの生成にわたって、同じ顔・衣装・プロポーションを維持できます。
  • 参照画像のマージ。 複数の入力を1つの出力にブレンドできます。Nano Banana Proは最大14、FLUX.2は最大8まで対応します。
  • image to video。 完成したフレームをクリップの最初のフレームとして使います。

複数の出力にわたるキャラクターの一貫性

アイデンティティのブレは、参照ベースの制作で最大の失敗要因です。同じ顔でも生成のたびに微妙に違って戻ってきて、10枚目には気づかないうちに別人になってしまいます。

OpenArt Characters deals with drift by making the character a saved asset instead of a per-prompt reference. Build the character once from a prompt, a reference photo, or a preset. Then tag that same character into any later image or video, including scenes in OpenArt Director、マルチシーン動画ツール。

その違いはどんなベンチマーク数値よりも重要です。参照画像はモデルに毎回顔を再構築させるのに対し、保存したキャラクターは毎回同じ出発点を与えます。

Prompt engineering for image-to-image

現行のエディターはすべて、キーワードタグではなく自然言語を使います。FLUX、GPT Image、Geminiのいずれでも同じルールが通用します。加えたい編集ではなく、望む完成画像を説明しましょう。

何を保持すべきかを明確に述べ、正確な動詞を選びましょう。Black Forest Labsはプロンプトガイドで直截にこう指摘しています。「transform」は全体的な変更を意味しますが、「change the clothes(服を変える)」や「replace the background(背景を差し替える)」なら、実際に何が変わるかを制御できます。

アニメ変換では、目指すルックを指定し、アイデンティティを固定しましょう。「クリーンな線画とセルシェーディングの2Dアニメイラストを作成し、人物の顔のアイデンティティ、髪型、ポーズ、構図はそのままに、レンダリングスタイルだけを変更する」

フォトリアルなリスタイルでは、フレーミングと背景に厳密な制限を加えましょう。OpenAI自身のプロンプトガイドでは、「余計な要素なし」といったフレーズを含め、除外事項を明示的に指定してモデルのブレを防ぐことを推奨しています。

商品制作には、Googleが公開しているテンプレートがどのモデルを使う場合でも参考になります。ライティングの構成、カメラアングル、背景の質感、そしてシャープに保つべきディテールを指定しています。

文字やロゴを差し替えるときは、引用符で囲みましょう。FLUX Kontextの公式パターンはこうです。Replace "[original text]" with "[new text]"。

やり直さずに結果を修正する

最初の生成が最終形になることはめったにありません。1か所だけが間違っているのに最初からやり直すのはクレジットの無駄です。OpenArtなら、よくある修正は同じキャンバス上で完結します。

  • 領域編集。 画像編集のエリア編集モードなら、1か所をハイライトして、その部分だけを変更できます。
  • 塗りつぶしと除去。 Generative AI Fillは、隙間を埋めたり、オブジェクトを消したり、フレームを拡張したりします。
  • フレームの変更。 Expand Imageはキャンバスを任意のアスペクト比やSNS向けプリセットに広げます。
  • 背景。 AI Background Removerはきれいな切り抜きを、AI Background Changerはシーンの差し替えを行います。
  • 顔。 AI Face Editorは表情の変更やレタッチを行います。
  • アップスケーリング。 the 画像アップスケーラー 精密、リファイン、クリエイティブの各モードで実行され、肌の質感が重要な場面ではVellum Skin Enhancerが8Kまで対応します。

これらの修正はすべて、生成に使ったモデルのまま同じキャンバス上で行えます。Midjourneyでは、リージョン編集はアップスケール後にDiscordで、古いバージョンのモデルを使って行われます。

Start with the baseline. The U.S. Copyright Office's January 2025 report says AI output can be protected "only where a human author has determined sufficient expressive elements." That covers three cases. Your own work is visible in the output, or you arrange the output creatively, or you modify it creatively. Prompts on their own do not count.

実際のところ、純粋にpromptだけで生成した画像には著作権がなく、あなた自身の編集や構成こそが著作権を生み出すのです。

その上にプラットフォームの利用規約が重なり、内容は大きく異なります。OpenArtはあなたの出力に対して所有権も著作権も主張しません。対象となる有料プランでは商用利用権が付与され、ロイヤリティもクレジット表記も不要です。OpenAIの消費者向け・法人向け規約は、入力の権利を有し利用ポリシーに従っている限り、出力の権利をあなたに帰属させます。Midjourneyでは、年間売上100万ドル超の企業やその従業員が資産を所有するには、ProまたはMegaプランが必要です。

参照画像を使う作業には、特有のリスクが2つあります。

権利を持たない著作物の写真をアップロードすること自体が、出力の見た目にかかわらず問題になり得ます。そして、保護された作品と実質的に似通った出力を公開すれば、たとえ意図していなくても請求を招きます。

the IP セーフティチェック 公開前に出力をスクリーニングし、ブランドとの類似性、著名人の顔、肖像リスクを検出します。緑の結果は何も検出されなかったことを、警告は誰かが確認すべきことを、危険は明確な類似性があることを意味します。OpenArtは結果は参考情報であると明記しているため、緑の結果は法的なクリアランスではなくスクリーニングとして扱ってください。

プランとクレジット

OpenArtは、画像・動画・音声モデルすべてを1つのクレジットプールで賄います。カード不要・7日間で40クレジットの無料スタートが可能で、その後も基本的な画像生成には毎日無料クレジットが付与されます。

プラン 月額 月あたりのクレジット
スターター $14 4,000
Plus $34 12,000
Pro $56 24,000
Wonder $240 106,000

これらの金額は月払いの場合です。年払いにすると各プランが安くなり、最大27%お得になります。すべての有料プランは透かしなしで書き出せます。基本クレジットは毎月リセットされますが、15ドルのExtra Credit Packで追加される約5,000クレジットは繰り越されます。

ブランドキット は、ブランド向けに生成するなら設定しておく価値があります。ロゴ、正確なHEXコード、フォント、商品アセット、スタイル参照、ブランドルールをプロジェクト単位で保存するので、どのモデルを選んでも一連の参照画像が一貫した仕上がりになります。

はじめに

image-to-imageを判断する一番早い方法は、自分の参照画像を実際に通してみることです。

  1. OpenArtの画像ジェネレーターを開き、参照写真をアップロードします。
  2. 完成画像を説明するpromptを書き、変えたくない要素を明示しましょう。
  3. モデルを選び、創造性スライダーを設定して、生成しましょう。
  4. バリエーションを見比べ、惜しい部分はArea Editやアップスケーラーで仕上げましょう。
  5. If the same character has to appear again later, build it once in Characters and tag it in future prompts.

よくある質問

参照画像としてアップロードできるファイル形式やサイズは?

ほとんどのプラットフォームは一般的なウェブ形式を、それぞれのサイズ上限付きで受け付けます。Midjourneyは.png、.gif、.webp、.jpg、.jpegを最大10 MBまで受け付けます。どのツールでも、目標解像度に近い鮮明でよく照らされた参照画像が最良の結果を生みます。モデルは参照画像に元々ないディテールを復元できないからです。

出力を参照画像にどれだけ近づけるかはどうやってコントロールしますか?

ツールによります。Stable Diffusion系ツールでは強度スライダーを下げます。Midjourneyでは --iw を3に近づけます。FLUX KontextとGPT Image 2にはスライダーがありません。代わりに「同じ顔立ちと髪型を保ちながら」のように、保持したい要素をpromptに書き込みます。OpenArtではクリエイティビティのスライダーがそれを担い、異なる設定で最大8つのバリエーションを生成して幅を確認できます。

実在の人物の写真を参照として使えますか?

本人の同意がある場合に限ります。OpenAIの利用ポリシーは、実在か否かを人々に誤認させかねない形で、フォトリアルな画像や音声を含め本人の同意なく肖像を使用することを禁じています。ニューヨーク州では現在、合成パフォーマーを広告で意図的に使用する場合、広告主に明確な開示を求めています。違反の罰金は初回1,000ドル、以降は1件ごとに5,000ドルです。実在の人物を商用利用する際は、モデルだけでなく撮影者も含め、関係者全員から権利を取得しましょう。

image-to-imageに最適なモデルはどれですか?

タスク次第です。FLUX Kontextは開発元のベンチマークで局所編集とキャラクター保持をリードします。GPT Image 2は複雑な複数画像の指示と小さな文字を得意とします。Nano Banana Proはフォトリアルな作業でリードし、最も多くの参照を受け付けます。Seedreamはアニメやイラストにおすすめのモデルです。ランキングはタスクごとに変わるので、OpenArtでGPT Image 2、Nano Banana Pro、Seedreamに参照画像を通して比較しましょう。この3つは同じクレジットから消費されます。

なぜ製品のロゴが間違って出力されるのですか?

Because the model rebuilds the logo instead of copying it. Photoroom's testing found logo and text distortion was the most common accuracy failure. The fix is to stop asking the prompt to do it: generate the scene, then use Area Edit to repair just that region, and check it by eye before anything ships.

生成ごとにキャラクターの顔がぶれるのを防ぐには?

Stop re-uploading a reference and save the character instead. Build it once in OpenArt Characters from a prompt, a photo, or a preset. Then tag that character in every later generation. The model starts from the same place each time instead of re-deriving the face from a fresh reference.

結果を動画にできますか?

Yes. Once you have a still you like, Image to Video animates it. OpenArt Director goes further and builds a multi-scene video that keeps the same characters across shots. Generating the still first and animating it second gives you more control than describing the whole video in one prompt.

制限なく、思いのままに

OpenArtで画像・動画・キャラクター・ストーリーを生成する、数百万人のクリエイターに仲間入りしましょう。すべてが1つのプラットフォームに。

無料で始める →