Wan 3.0はOpenArtで使える最新のAIモデルの1つです AI動画ジェネレーター, and Alibaba published its own prompt formulas the day the model launched. Almost nobody reads them, so we've put together this definitive prompt guide for you.
Wan 3.0 は最大30秒の動画を一度に生成し、リファレンスファイルを20点まで受け付け、映像と同時にオーディオも生成します。このガイドでは、Wanの制作元であるAlibabaが書き記した公式に加え、指定しなければWan 3.0が自動的に決めてしまう3つの要素を解説します。
要点
- まずは被写体、場所、動きから始めましょう。うまくいったら、カメラ・スタイル・音を加えていきます。
- 参照ファイルには@Image1、@Video1、@Audio1のようにラベルを付けて、Wan 3.0がそれぞれの用途を把握できるようにしましょう。
- ショットに番号を振り、[0-6s]のように時間帯を指定しましょう。
- セリフ、効果音、音楽を3つの別々の要素として書きましょう。
- Wan 3.0は音楽やセリフを勝手に追加するので、不要なときは「音楽なし」と指定しましょう。
- Switch Auto Polish off once your prompt is exact, so it does not reword your labels and time ranges.
まず3つから始めて、そこから追加しましょう
Alibabaの基本の型はシンプルです。必要なのは被写体、場所、動き。「A red fox walks across a snowy field at sunrise.」これで3つすべてがそろい、ちゃんとした動画が返ってきます。
Once that works, the fuller formula adds three more: how the shot looks, the style, and the sound. Add them one at a time so you can see what each one changed. You have plenty of room, because a Wan 3.0 prompt can run to 20,000 characters.
すべてのリファレンスに@タグでラベルを付けましょう
Wan 3.0は参照ファイルを最大20個まで扱え、OpenArtがアップロードボックスの上部で数をカウントしてくれます。
Uploading them is only half the job. Wan 3.0 will not guess that picture 3 is the coffee shop and picture 4 is the jacket. You have to say so in the prompt, using the @ label:
@Image1は女性。@Image2はコーヒーショップ。@Audio1は彼女の声。@Image1の女性が@Image2の窓際に座り、コーヒーを注文する。
Alibaba's own examples label every single reference this way. You can also name the same reference more than once in one prompt, which is how you control where it applies.
Start and end frames work the same way. On OpenArt you can set the picture your video opens on and the picture it closes on, and still add reference files next to them. Say in the prompt which picture is the opening frame, which is the closing frame, and what each reference is for.
動画の参照は合計15秒まで、音声の参照はさらに15秒まで使えます。同じ人物を動画のたびに登場させたいなら、一度保存しておきましょう。保存先はこちら OpenArt Characters 毎回元の画像を探し回る代わりに、それらを再利用しましょう。
ショットに番号を振り、それぞれに時間を割り当てましょう
Wan 3.0は最大30秒を一度に生成するので、静止した1枚の画像を説明するのではなく、その時間の中で何が起きるかを伝えましょう。Alibabaの形式は、まず短い要約、次に時間帯付きの番号付きショットです:
迷い猫を見つけた女の子の短い物語。
ショット1 [0-5s]:彼女は雨の中を家へ歩き、玄関先で立ち止まる。
ショット2 [5-12s]:彼女を見上げる、濡れた小さな猫のクローズアップ。
ショット3 [12-20s]:彼女はひざまずき、手を差し出す。
各時間帯に明確な役割を1つ与えましょう。最初の結果でショットが慌ただしく感じたら、その時間帯だけを広げて、ほかはそのままにします。これより多くのショットを含む長いストーリーには、次でシーンごとに組み立てていきましょう: OpenArt Director.
サウンドは3つの要素に分けて書きましょう
Wan 3.0は映像と同時に音も生成するので、言葉で音を形づくれます。Alibabaは音を3つの要素に分けており、それぞれを別々に書くと効果的です。
セリフ。 セリフを書いてから、その言い方を添えましょう。「彼女は『こうなると言ったでしょう』と言う。速く、少しいら立った様子で、アメリカ英語で。」
効果音。 対象、その動作、そして背景音を指定しましょう。「A glass falls off the table and shatters on the wood floor, quiet room.」のように。
音楽。 音楽とスタイルを指定しましょう。「Slow piano under the whole scene.」のように。
Wan 3.0があなたの代わりに決める3つの要素
ここでつまずく人が多いポイントです。何も指定しなくても、Wan 3.0は必ず何かしらの判断を下します。
セリフ。 セリフを書き出せば、Wan 3.0はその言葉をそのまま使います。何も書かなければ、独自のセリフを作り出します。「動画全体でセリフなし」と書けばオフにできます。
音楽。 Wan 3.0は動画の内容に合わせて背景音楽を選びます。オフにするには「no background music」と指定しましょう。
ショット数。 Wan 3.0はショットを切り替えるかどうかを自分で判断します。カットのない一続きの映像がほしいときは「one continuous take」と指定しましょう。
長さとサイズも同じ仕組みです。空欄にしておくと、Wan 3.0が2〜30秒の中から長さを選び、シーンに合ったアスペクト比も決めてくれます。
生成前に4つのコントロールを確認しましょう
On OpenArt, four settings sit around the prompt box and each one changes what your words do.
Auto Polish。 This rewrites your prompt before it runs. That helps when you have typed one loose sentence, but it can also reword the reference labels and time ranges you set on purpose. Switch it off once your prompt is exact.
オーディオ。 これをオンにしておくと、Wan 3.0が映像に合わせて音を生成します。無音のクリップにしたいときはオフに。これが不要な音楽を止める一番早い方法です。
カメラ。 Pick your camera move here instead of typing it, and you get the same move every time without wording it differently in each prompt.
モード。 Standard and Prime set the quality level. Test your prompt on Standard, then move the version you like to Prime.
また、一度に最大8本の動画をキューに入れられます。これは、ある言葉が何をしているかを学ぶ一番の近道です。バージョンごとに1つだけ変え、8本すべて実行して見比べましょう。
画像から始めるなら説明は少なめに
When you upload a starting picture, that picture already settles who is in it, where they are, and how it all looks. Repeating that in the prompt just fights the picture you uploaded.
書くべきは2つだけ。何が動くか、そしてカメラが何をするかです。「She turns toward the window and smiles. Slow push in.」のように。カメラを固定したいときは「fixed shot」と指定してください。指定しないとWan 3.0が勝手にカメラを動かします。
動画を作り直さずに、1か所だけ直しましょう
Wan 3.0は普通の指示で動画を編集できるので、ちょっとした問題のために動画を丸ごと作り直す必要はありません。変えたい部分を指定して、あとはそのままだと伝えましょう。
サングラスを外して。彼女の動きや動画内のその他すべてはそのままにして。
同じ言い回しが、要素の追加、スタイルの変更、光の調整、セリフの差し替えに使えます。
生成を無駄にする4つのミス
- 動画ではなく画像を説明してしまう。 30秒の中で何が変化するかを伝えましょう。
- 参照にラベルを付けないこと。 6つのファイルをアップロードしたら、それぞれが何のためのものかを伝えましょう。
- カメラの動きの重ね合わせ。 はっきりした動き1つは、ぶつかり合う3つの動きに勝ります。
- 頼んでもいない音をオフにし忘れること。 音楽やセリフが勝手に出てくる。
よくある質問
Wan 3.0はいくつの参照素材を使えますか?
Wan 3.0は1本の動画で最大20個の参照ファイルを扱えます。画像10枚、動画クリップ5本、音声クリップ5本です。さらにドキュメントやWebページを1つ追加できるので、キャラクター・商品・ロケーション・声のすべてを同じショットに反映できます。動画の参照は合計15秒まで、音声の参照はさらに15秒まで使えます。
Wan 3.0の動画はどれくらいの長さにできますか?
Any length from 2 to 30 seconds. If you leave the length blank, Wan 3.0 picks a length that suits your prompt.
Wan 3.0は音を生成しますか?
Yes. Wan 3.0 makes voice lines, sound effects, and music at the same time as the picture. Describe the sound you want in the prompt, or switch it off if you want a silent clip.
参照ファイルと開始・終了フレームを同時に使えますか?
Yes. On OpenArt you can set the picture your video starts on, the picture it ends on, and still add reference files alongside them. Label each one in the prompt so Wan 3.0 knows which picture opens the video, which one closes it, and which references carry your character, product, or voice.