写真をアップロードしてプロンプトを追加すれば、モデルは参照画像の構図、ポーズ、ライティング、スタイルを保ちつつ、指定した部分だけを変更した新しい画像を構築します。
それが画像から画像への生成であり、テキストプロンプトでは解決できない問題を解消します。テキストだけでは、すでに存在するもの——あなたの商品、キャラクター、レイアウト、あるいは何年もかけて磨き上げた見た目——を再現することはできません。
要点
- image-to-imageは参照画像のピクセルをコピーするのではなく、構図とスタイルを読み取ります。構図やポーズは確実に引き継がれますが、細部は引き継がれません。
- 正確なロゴや小さな文字が弱点なので、promptに頼らず、マスク編集と人の目によるチェックを前提にしましょう。
- タスクによって得意なモデルは異なります。だからこそ、1つのモデルに絞るより、1枚の参照画像を2〜3のモデルに通す方が優れているのです。
- 新しいエディターは忠実度スライダーを廃止したため、保持したい要素は明示的な指示としてpromptに書き込むようになりました。
- 権利を持たない参照画像をアップロードすること自体が、出力の見た目とは別のリスクになります。
画像から生成するAI画像ジェネレーターとは?
画像から画像を生成するAI画像ジェネレーターは、一般的に次のように呼ばれます image-to-image img2img は、1つではなく2つの入力を受け取ります。参照画像とテキストプロンプトです。モデルは参照画像のピクセルをコピーするのではなく、色、構造、ライティング、ポーズを読み取ります。そしてプロンプトに導かれながら、新しい画像を構築します。
text-to-imageしか使ったことがなければ、その違いはコントロールの効き方にすぐ表れます。テキストのpromptは「赤いジャケットを着た女性、斜め45度アングル」を説明できますが、特定の女性、特定のジャケット、特定のカメラアングルを再現することはできません。
参照画像なら可能です。OpenArtではpromptと一緒に写真をアップロードするので、構図を保ちながらスタイルや雰囲気、ディテールを変えられます。
image-to-image と text-to-image の比較
どちらのアプローチも同じ基盤モデルを使いますが、解決する課題が異なります。
| 寸法 | 画像から画像へ | テキストから画像へ |
|---|---|---|
| 入力 | 参照画像とテキストプロンプト | テキストプロンプトのみ |
| 制御性 | 高い。構図とポーズが参照画像に固定されるため | 低め。モデルはあなたの説明から構築するため |
| 一貫性 | 複数の生成にわたって同じ被写体やレイアウトを | 生成のたびに一からやり直し |
| おすすめの用途 | 商品撮影、スタイル転送、キャラクター制作、写真のリスタイル | コンセプト作り、探索、まったく新しいシーン |
まだ探索段階で、自分が何を求めているか分からないときはテキストから画像への生成を使いましょう。製品写真、キャラクターシート、スケッチ、レイアウトなど、すでに素材があり、それに忠実なバリエーションが必要なときは画像から画像への生成を使います。
image-to-image AIの仕組み
拡散モデルは、参照画像を圧縮された形にエンコードし、制御された量のノイズを加え、プロンプトを使ってクリーンアップを導くことでこれを処理します。Hugging Face 公式ドキュメントが端的に説明しています。strength の値が高いほど、モデルは参照画像とは異なるものを作る余地が広がります。strength 1.0 では、参照画像は「ほぼ無視される」ことになります。
モデルは参照画像から構造とスタイルを抽出します。構図、カラーパレット、ライティングの方向、ポーズ、カメラアングルは確実に引き継ぎます。確実には引き継げないのは、細部の正確なディテールです。
Photoroomは2026年7月、850点のアパレル・アクセサリー製品を3,400回の生成でテストしました。最良のモデルでも製品の正確性チェックを通過したのは生成の29.0%でした。最も多かった失敗はロゴや文字の歪みで20.1%。Photoroomは製品忠実度レイヤーを販売しているため、この結果には利害関係がある点に留意してください。
出典を考慮に入れても、この教訓は変わりません。作品が正確なラベルやロゴに依存するなら、プロンプトだけに頼らず、マスク編集と人による確認を計画に組み込みましょう。
参照画像からのスタイル転送
スタイル転送が機能するのは、モデルが参照画像のルックをその内容とは別に読み取るからです。Midjourneyのドキュメントが的確に説明しています。スタイル参照は「既存の画像の視覚的な雰囲気を捉える」もので、つまり色、メディア、テクスチャ、ライティングを指します。それは「オブジェクトや人物をコピーするものではありません」。
同じ考え方がツール全般に当てはまります。参照画像が見た目を、プロンプトが被写体を提供します。
バッチ全体で見た目を統一するには、毎回アップロードし直すのではなく保存しましょう。OpenArtのBrand Kitはカラー・フォント・スタイル参照をプロジェクト単位で保存し、OpenArt Charactersは後の画像にタグ付けできる人物を保存します。
出力の忠実度をコントロールする
Stable Diffusion系のツールには、そのバランスを直接設定できるstrength(デノイジング)スライダーがあります。計算はシンプルです。strengthと推論ステップ数を掛けると、実際に実行されるステップ数がわかります。strength 0.8で50ステップなら、変化のステップは40回になります。
わかりやすく言うと、設定を低くするとアップロードした写真に近い出力になり、高くするとモデルの自由度が増します。Stable Diffusion Artのスケールが目安として便利です。おおよそ0.2でわずかな変化、0.6で大きな変化、1.0で非常に大きな変化になります。ネットで見かけるより細かい数値は、公式ガイダンスというよりは誰かが検証したデフォルト値だと捉え、自分に合った値を見つけましょう。
OpenArtでは、image-to-imageのクリエイティビティスライダーでこれを調整できます。原画に近い控えめなリスタイルから、大まかな構図だけを残す大胆な再解釈まで自在です。
Midjourneyでは image weight を使い、次のように記述します --iwを代わりに使いましょう。ドキュメントではV8.1で0〜3の範囲、デフォルト1と記載されており、V8.2の値はまだ公開されていません。
FLUX.1 Kontext や GPT Image 2 のような新しい指示ベースのエディターは、スライダーを完全に廃止しました。プロンプトに保持句を書き込むことで忠実度を制御します。
参照画像から画像を生成する手順
流れはどこでもほぼ同じです。以下はOpenArtでの手順です。
- 参照画像をアップロードする場所: AI画像ジェネレーター.
- プロンプトを書きます。参照画像を編集する指示ではなく、望む最終画像を描写してください。
- モデルを選びましょう。GPT Image 2は複雑な指示や小さな文字の処理に優れ、Nano Banana Proは複数の参照を使ったフォトリアルな作業に適しており、Seedream 4.5はアニメやフラットなイラストに最適です。
- クリエイティビティのスライダーを設定します。低くすると参照画像に近づき、高くするとモデルが再解釈する余地が広がります。
- 最大8パターンを生成・比較し、気に入ったものをダウンロードできます。
速度はモデルによって異なります。FLUX.1 Kontext は 1024×1024 の画像を3〜5秒で生成します。Nano Banana は Replicate の計測で平均約10秒。OpenAI によれば、複雑な GPT Image 2 のプロンプトは最大2分かかることがあります。
image-to-imageに最適なAIモデル
すべてのタスクで勝つ単一のモデルは存在しません。これが、1枚の参照画像を複数のモデルに通すべき実際的な理由です。以下のモデルのうち、GPT Image 2、Nano Banana Pro、SeedreamはOpenArtの共有クレジットプールで動作するため、この3つを比較してもサブスクリプションを比較することにはなりません。FLUX、Stable Diffusion、Midjourneyはそれぞれ独自のアカウントが必要です。
- FLUX(Black Forest Labs)。 BFL自身のKontextBenchでは、FLUX.1 Kontextがテキスト編集とキャラクター保持で最高スコアを記録しました。変更をまたいでアイデンティティを維持するマルチターン編集向けに構築された初のモデルです。BFLはその限界について率直で、6回連続の編集後に目に見える劣化が生じることを記録しています。現在は新規プロジェクトに、APIで最大8枚の参照画像を扱えるFLUX.2を推奨しています。
- GPT Image 2(OpenAI)。 1回の編集リクエストで最大16枚の入力画像を受け付け、すべての入力を高忠実度で処理します。Artificial Analysisの画像編集リーダーボードでは1,256 Eloで3位につけています。学術的なGEditBench v2では、GPT Image 1.5が1,260で指示追従スコアのトップを記録し、Nano Banana Proが総合1位を獲得しました。
- Nano Banana Pro(Google)。 正式にはGemini 3 Pro Image。Googleは1つのpromptで最大14枚の参照入力(うち6枚は高忠実度)と、最大5人までの一貫した容姿再現をドキュメント化しています。ネイティブ4Kで出力します。
- Seedream(ByteDance)。 アニメ、イラスト、ポスターレイアウトに最適な選択肢。Seedream 5.0 Proは最大10枚の参照画像をブレンドでき、Seedream 4.5はより強力な2Dアニメーションのスタイリングを備えています。
- Stable Diffusion。 自前で動かせば依然として最も手動コントロールが効きます。strengthスライダーとControlNetの構造ガイドが使えますが、公式のSD 3.5 ControlNetsが対応するのはCanny、Depth、Blurのみで、ポーズやスケッチのガイドはコミュニティ製です。
- Midjourney(V8.2)。 画像プロンプトとスタイル参照によって、デフォルトで強力な美しさを実現。Omni Reference 機能は依然として V7 で動作し、GPU 時間が2倍かかり、Vary Region、Pan、Zoom Out、Fast Mode、Draft Mode とは併用できません。無料プランはなく、料金は月額10ドルからです。
Replicateは2025年9月、旧世代のモデルで独自の比較を行いました。その結果、テキスト編集ではFLUX.1 KontextとNano Bananaがタイポグラフィと質感を最もよく保ち、スタイル転送ではNano BananaとSeedreamがKontextを上回りました。バッチにクレジットを使う前に、自分の参照画像でテストしましょう。
主な活用例
image-to-imageは、出力が既存の何かに一致しなければならない場面ならどこでも真価を発揮します。
- スタイル転送。 手持ちの写真に、絵画調、映画のような質感、ブランドの美学を適用します。
- 商品撮影。 スマホのスナップ写真を、製品の形状はそのままに、新しい面に置いたスタジオ照明のショットに変えます。
- アニメ・アート変換。 アイデンティティやポーズを保ちつつ、ポートレートをアニメ、イラスト、コミック調に変換します。
- キャラクターの一貫性。 何十回もの生成にわたって、同じ顔・衣装・プロポーションを維持できます。
- 参照画像のマージ。 複数の入力を1つの出力にブレンドできます。Nano Banana Proは最大14、FLUX.2は最大8まで対応します。
- image to video。 完成したフレームをクリップの最初のフレームとして使います。
複数の出力にわたるキャラクターの一貫性
アイデンティティのブレは、参照ベースの制作で最大の失敗要因です。同じ顔でも生成のたびに微妙に違って戻ってきて、10枚目には気づかないうちに別人になってしまいます。
OpenArt Characters キャラクターをプロンプトごとの参照ではなく保存済みのアセットにすることで、ブレの問題に対処します。プロンプト、参照写真、またはプリセットから一度キャラクターを作成すれば、以降のあらゆる画像や動画に同じキャラクターをタグ付けできます。次のようなシーンも含めて。 OpenArt Director、マルチシーン動画ツール。
その違いはどんなベンチマーク数値よりも重要です。参照画像はモデルに毎回顔を再構築させるのに対し、保存したキャラクターは毎回同じ出発点を与えます。
画像から画像へのプロンプトエンジニアリング
現行のエディターはすべて、キーワードタグではなく自然言語を使います。FLUX、GPT Image、Geminiのいずれでも同じルールが通用します。加えたい編集ではなく、望む完成画像を説明しましょう。
何を保持すべきかを明確に述べ、正確な動詞を選びましょう。Black Forest Labsはプロンプトガイドで直截にこう指摘しています。「transform」は全体的な変更を意味しますが、「change the clothes(服を変える)」や「replace the background(背景を差し替える)」なら、実際に何が変わるかを制御できます。
アニメ変換では、目指すルックを指定し、アイデンティティを固定しましょう。「クリーンな線画とセルシェーディングの2Dアニメイラストを作成し、人物の顔のアイデンティティ、髪型、ポーズ、構図はそのままに、レンダリングスタイルだけを変更する」
フォトリアルなリスタイルでは、フレーミングと背景に厳密な制限を加えましょう。OpenAI自身のプロンプトガイドでは、「余計な要素なし」といったフレーズを含め、除外事項を明示的に指定してモデルのブレを防ぐことを推奨しています。
商品制作には、Googleが公開しているテンプレートがどのモデルを使う場合でも参考になります。ライティングの構成、カメラアングル、背景の質感、そしてシャープに保つべきディテールを指定しています。
文字やロゴを差し替えるときは、引用符で囲みましょう。FLUX Kontextの公式パターンはこうです。Replace "[original text]" with "[new text]"。
やり直さずに結果を修正する
最初の生成が最終形になることはめったにありません。1か所だけが間違っているのに最初からやり直すのはクレジットの無駄です。OpenArtなら、よくある修正は同じキャンバス上で完結します。
- 領域編集。 画像編集のエリア編集モードなら、1か所をハイライトして、その部分だけを変更できます。
- 塗りつぶしと除去。 Generative AI Fillは、隙間を埋めたり、オブジェクトを消したり、フレームを拡張したりします。
- フレームの変更。 Expand Imageはキャンバスを任意のアスペクト比やSNS向けプリセットに広げます。
- 背景。 AI Background Removerはきれいな切り抜きを、AI Background Changerはシーンの差し替えを行います。
- 顔。 AI Face Editorは表情の変更やレタッチを行います。
- アップスケーリング。 the 画像アップスケーラー 精密、リファイン、クリエイティブの各モードで実行され、肌の質感が重要な場面ではVellum Skin Enhancerが8Kまで対応します。
これらの修正はすべて、生成に使ったモデルのまま同じキャンバス上で行えます。Midjourneyでは、リージョン編集はアップスケール後にDiscordで、古いバージョンのモデルを使って行われます。
商用利用、著作権、所有権
まず基本から。米国著作権局の2025年1月の報告書によれば、AI の出力が保護されるのは「人間の作者が十分な表現的要素を決定した場合のみ」です。これは3つのケースをカバーします。あなた自身の作品が出力に見て取れる場合、出力を創造的に配置する場合、または創造的に改変する場合です。プロンプトそのものは含まれません。
実際のところ、純粋にpromptだけで生成した画像には著作権がなく、あなた自身の編集や構成こそが著作権を生み出すのです。
その上にプラットフォームの利用規約が重なり、内容は大きく異なります。OpenArtはあなたの出力に対して所有権も著作権も主張しません。対象となる有料プランでは商用利用権が付与され、ロイヤリティもクレジット表記も不要です。OpenAIの消費者向け・法人向け規約は、入力の権利を有し利用ポリシーに従っている限り、出力の権利をあなたに帰属させます。Midjourneyでは、年間売上100万ドル超の企業やその従業員が資産を所有するには、ProまたはMegaプランが必要です。
参照画像を使う作業には、特有のリスクが2つあります。
権利を持たない著作物の写真をアップロードすること自体が、出力の見た目にかかわらず問題になり得ます。そして、保護された作品と実質的に似通った出力を公開すれば、たとえ意図していなくても請求を招きます。
the IP セーフティチェック 公開前に出力をスクリーニングし、ブランドとの類似性、著名人の顔、肖像リスクを検出します。緑の結果は何も検出されなかったことを、警告は誰かが確認すべきことを、危険は明確な類似性があることを意味します。OpenArtは結果は参考情報であると明記しているため、緑の結果は法的なクリアランスではなくスクリーニングとして扱ってください。
プランとクレジット
OpenArtは、画像・動画・音声モデルすべてを1つのクレジットプールで賄います。カード不要・7日間で40クレジットの無料スタートが可能で、その後も基本的な画像生成には毎日無料クレジットが付与されます。
| プラン | 月額 | 月あたりのクレジット |
|---|---|---|
| スターター | $14 | 4,000 |
| Plus | $34 | 12,000 |
| Pro | $56 | 24,000 |
| Wonder | $240 | 106,000 |
これらの金額は月払いの場合です。年払いにすると各プランが安くなり、最大27%お得になります。すべての有料プランは透かしなしで書き出せます。基本クレジットは毎月リセットされますが、15ドルのExtra Credit Packで追加される約5,000クレジットは繰り越されます。
ブランドキット は、ブランド向けに生成するなら設定しておく価値があります。ロゴ、正確なHEXコード、フォント、商品アセット、スタイル参照、ブランドルールをプロジェクト単位で保存するので、どのモデルを選んでも一連の参照画像が一貫した仕上がりになります。
はじめに
image-to-imageを判断する一番早い方法は、自分の参照画像を実際に通してみることです。
- OpenArtの画像ジェネレーターを開き、参照写真をアップロードします。
- 完成画像を説明するpromptを書き、変えたくない要素を明示しましょう。
- モデルを選び、創造性スライダーを設定して、生成しましょう。
- バリエーションを見比べ、惜しい部分はArea Editやアップスケーラーで仕上げましょう。
- 同じキャラクターを後で再び登場させる必要があるなら、Characters で一度作成し、今後のプロンプトでタグ付けしましょう。
よくある質問
参照画像としてアップロードできるファイル形式やサイズは?
ほとんどのプラットフォームは一般的なウェブ形式を、それぞれのサイズ上限付きで受け付けます。Midjourneyは.png、.gif、.webp、.jpg、.jpegを最大10 MBまで受け付けます。どのツールでも、目標解像度に近い鮮明でよく照らされた参照画像が最良の結果を生みます。モデルは参照画像に元々ないディテールを復元できないからです。
出力を参照画像にどれだけ近づけるかはどうやってコントロールしますか?
ツールによります。Stable Diffusion系ツールでは強度スライダーを下げます。Midjourneyでは --iw を3に近づけます。FLUX KontextとGPT Image 2にはスライダーがありません。代わりに「同じ顔立ちと髪型を保ちながら」のように、保持したい要素をpromptに書き込みます。OpenArtではクリエイティビティのスライダーがそれを担い、異なる設定で最大8つのバリエーションを生成して幅を確認できます。
実在の人物の写真を参照として使えますか?
本人の同意がある場合に限ります。OpenAIの利用ポリシーは、実在か否かを人々に誤認させかねない形で、フォトリアルな画像や音声を含め本人の同意なく肖像を使用することを禁じています。ニューヨーク州では現在、合成パフォーマーを広告で意図的に使用する場合、広告主に明確な開示を求めています。違反の罰金は初回1,000ドル、以降は1件ごとに5,000ドルです。実在の人物を商用利用する際は、モデルだけでなく撮影者も含め、関係者全員から権利を取得しましょう。
image-to-imageに最適なモデルはどれですか?
タスク次第です。FLUX Kontextは開発元のベンチマークで局所編集とキャラクター保持をリードします。GPT Image 2は複雑な複数画像の指示と小さな文字を得意とします。Nano Banana Proはフォトリアルな作業でリードし、最も多くの参照を受け付けます。Seedreamはアニメやイラストにおすすめのモデルです。ランキングはタスクごとに変わるので、OpenArtでGPT Image 2、Nano Banana Pro、Seedreamに参照画像を通して比較しましょう。この3つは同じクレジットから消費されます。
なぜ製品のロゴが間違って出力されるのですか?
モデルはロゴをコピーするのではなく再構築するためです。Photoroom のテストでは、ロゴやテキストの歪みが最も一般的な精度の失敗でした。解決策は、プロンプトにそれをやらせようとしないこと。シーンを生成したうえで、エリア編集でその部分だけを修復し、公開前に必ず目視で確認しましょう。
生成ごとにキャラクターの顔がぶれるのを防ぐには?
参照画像を何度もアップロードするのはやめて、キャラクターを保存しましょう。OpenArt Characters でプロンプト、写真、またはプリセットから一度だけ作成すれば、それ以降の生成すべてでそのキャラクターをタグ付けできます。モデルは毎回新しい参照から顔を導き直すのではなく、常に同じ起点から始めます。
結果を動画にできますか?
はい。気に入った静止画ができたら、Image to Video でそれをアニメーション化できます。OpenArt Director はさらに一歩進んで、複数のショットで同じキャラクターを保ったマルチシーンの動画を作成します。まず静止画を生成してからアニメーション化する方が、動画全体を1つのプロンプトで説明するよりも細かくコントロールできます。