GoogleのGemini 2.0 Flash Image、ここではNano Banana 2として知られていますが、これはより高速で低価格、そして当社のコラボレーターであるBrianによれば 点火の連祷、「リブレットが格段に上手くなった」。BrianにOpenArtで実際に試してもらい、その発見をまとめてもらいました。その結果が、コツやプロンプト、そして驚くほど多いApplebee'sへの言及が詰まった12分のチュートリアルです。以下がその全内容です。
NB2 vs. Nano Banana Pro:本音の比較

バナナの裏側には今、動的な思考エンジンが備わっています。複雑なプロンプトを推論し、幻覚(ハルシネーション)ではなくウェブから実際の情報を引き出し、画像入力を分析して生成をまたいだキャラクターの一貫性を保ちます。これこそがNB2が前世代と本質的に異なる点です。単なる速度とコストの改善ではなく、まったく新しい能力のカテゴリーなのです。
ヒント1:編集画面の中で編集しない
Brianの最初のヒントは、最も即実践できるものでもあります。編集インターフェースを一切使わないこと。代わりに、ベース画像をビジュアル参照ウィンドウに直接ドラッグし、プロンプトを次のように組み立てましょう:
「プロンプトに沿って画像1を編集して。[ここに編集内容を記入]」
OpenArt では、このアプローチによって NB2 が画像へ直接アクセスでき、一貫してよりクリーンで精密な編集が可能になります。Brian は生成前に解像度を 4K に上げることも勧めています。これはアップスケールとは別物ですが、テキスト、ネームタグ、小道具といった細部において、モデルが扱えるピクセルの余地が格段に広がります。緻密なディテールワークを求めるプロンプトでは、これがとりわけ重要になります。
ヒント 2:キャラクターシートのプロンプト
これはコメント欄で最もリクエストの多かった項目です。Brianは動画公開後にプロンプト全文をピン留めしました。こちらがそれです:

このpromptを使う際に留意すべき点が2つあります。まず、参照画像には必ず手動でタグを付けてください。使用するのは @image1 — これがなければプロンプトは機能しません。次に、NB2は同じシーンにタグ付けされたキャラクターシートを最大5枚まで受け付けられます。この点はBrianが動画の後半で負荷テストを行い、実に印象的な結果を出しています。NB2とNano Banana Proはどちらもこのプロンプトをうまく処理しますが、NB2は同時に扱えるキャラクター入力が多いという利点があります。
ヒント3: Google検索によるリアルな情報の裏付け
This is where NB2 pulls most clearly ahead of its predecessor. The model can perform a web search when it determines it does not have enough information to complete a task, which opens up a genuinely new category of prompting. Brian tested this by photographing grocery store ingredients and asking NB2 to generate recipe infographics without telling it what the recipe should be. The model had to identify the ingredients from the photos, look up a relevant recipe, and render everything as a visual layout.
ラザニアのテストでは、彼は12枚のリファレンス画像を使いました。OpenArtは最大14枚まで対応します。
結果はおおむね素晴らしいものでしたが、Brianはいくつか気になる点を挙げました:
「出来上がったレシピの多くは材料の分量についての指示が少々あっさりしていて、要は材料を箱や瓶ごと全部ボウルにぶちまけて、重ねて、行き当たりばったりのラザニアを楽しめ、と言わんばかりだった。」
実用的なポイントは、Web連携型のプロンプトが、複数の入力から情報を統合させたい参照重視のタスクでうまく機能するということです。この種のタスクではNB Proよりも明らかに優れており、出力に多少の解釈が必要になることがあっても変わりません。
ヒント4:多言語テキスト生成
NB2は多言語テキスト描画が改善されており、Brianは自分のチーズケーキのインフォグラフィックを日本語に翻訳するよう依頼してテストしました。翻訳は正しく描画されましたが、Brianは正確性を検証する自分の能力に限界があることを正直に認めています。彼は日本語話者にコメントで意見を寄せてほしいと呼びかけています。結論はまだ保留中です。
ヒント5:複雑なシーン編集における空間認識
Brian brought NB2 to Times Square, photographically speaking, and asked it to remove all the LED billboards and signage from a rainy night shot. What makes this test genuinely interesting is the difficulty of what the model has to do: it must remove the signs, extrapolate what the buildings look like underneath them, and recalculate the lighting, since most of the illumination in a wet Times Square shot is reflected bounce light from those very signs. That is a significant amount of spatial and physical reasoning happening in a single generation.
結果は見事なもので、フレーム中央付近に予想どおりの多少の不完全さが見られます。Brianはこのテストに続いて、歩行者を消したり、晴れの日に切り替えたり、さらにシーンを吹雪に変換したりと、追加編集を次々に行いました。最後の吹雪はかなりうまくいったため、彼はもう家を出ずに冬のBロールを生成できると宣言しました。
ヒント6:最大5人の一貫したキャラクターによるマルチキャラクターシーン
動画の中で最も野心的なテストです。Brianは5つの異なるキャラクターシートを生成し、そのすべてをApplebee'sのひとつのダイニングシーンにタグ付けして、キャラクターたちがリブを食べる様子をさまざまなカメラアングルで求めました。ほとんどのキャラクターは生成を重ねても一貫性を保ちました。最も難しかったのはレトロな主婦のキャラクターで、Brianはこれを、リアルに見える人間の顔のわずかな違いに対して私たちの脳が敏感すぎるためだと分析しています。
作業を進める中で、いくつか予想外のことが起きました。プロンプトで指定していないのに、ロボットがFuturamaのベンダーに似せたがる傾向がずっとあったり、一部の出力にはキャラクターシートのアーティファクトが浮かんでいたりしました。しかし、まぎれもないハイライトは、NB2が頼まれてもいないのに5人のキャラクター全員に名前を付けたときでした: Blonde Ambition、Steel Resolve、The Gentle Toad、Mew Pawsome、 と スカルライダー。 Brian の評価:「批判はすべて撤回する。これは史上最高の画像モデルだ」
クイックリファレンス:用途別のおすすめモデル

結論
NB2 は Nano Banana Pro からの大きなアップグレードで、特に画像編集、ウェブに基づくプロンプト、複数キャラクターの一貫性で威力を発揮します。基盤となる思考エンジンにより、前世代では単純に不可能だったことが可能になり、しかもより速く、より低コストで実現します。完璧なツールではありませんが、正真正銘パワフルなツールであり、今すぐ OpenArt で利用できます。
Brianのチュートリアルは全編視聴する価値があります。コメントで一貫して評価されていたのは、洗練された成果物だけでなく、モデルが予想外だったり不完全だったりする結果を出す場面もあえて見せる姿勢でした。この誠実さのおかげで、実際に自分で使うときに何を期待できるか、はるかにリアルなイメージがつかめます。