Wan 3.0 是 OpenArt 上最新的 AI 模型之一 AI 视频生成器, and Alibaba published its own prompt formulas the day the model launched. Almost nobody reads them, so we've put together this definitive prompt guide for you.
Wan 3.0 一次可生成长达 30 秒的视频,最多接收 20 份参考文件,并在生成画面的同时生成音频。本指南涵盖了 Wan 的制作方阿里巴巴写下的公式,以及你若不指定、Wan 3.0 就会自动为你决定的三样内容。
要点总结
- 先从主体、场景和动作开始。这套跑通后,再加入镜头、风格和声音。
- 用 @Image1、@Video1 或 @Audio1 标注每一个参考文件,让 Wan 3.0 明白每个文件的用途。
- 给镜头编号,并为每个镜头标注一个时间段,例如 [0-6s]。
- 把配音、音效和音乐分成三个独立部分来写。
- 不想要背景音乐时就写上“no background music”,因为 Wan 3.0 会自行添加音乐和配音。
- Switch Auto Polish off once your prompt is exact, so it does not reword your labels and time ranges.
先从三样开始,再逐步添加
阿里巴巴的入门公式很简短。你需要一个主体、一个场景和一个动作。「A red fox walks across a snowy field at sunrise.」三要素齐全,足以生成一段真正的视频。
这一步跑通后,更完整的公式再补充三项:镜头的呈现方式、风格和声音。一次加一项,这样你能看清每一项带来的变化。你有充足的空间,因为一个 Wan 3.0 的 prompt 最长可达 20,000 个字符。
用 @ 标签标注每一份参考素材
Wan 3.0 最多支持 20 个参考文件,OpenArt 会在上传框顶部为你自动计数。
上传它们只完成了一半的工作。Wan 3.0 不会自己猜出图片 3 是咖啡馆、图片 4 是夹克。你必须在 prompt 中用 @ 标签明确说明:
@Image1 是这位女士。@Image2 是咖啡馆。@Audio1 是她的声音。@Image1 里的女士坐在 @Image2 的窗边,点了一杯咖啡。
阿里巴巴自家的示例都是这样标注每一个参考的。你也可以在同一个 prompt 中多次提到同一个参考,以此控制它在哪些地方生效。
首帧和尾帧的用法也一样。在 OpenArt 上,你可以设定视频开头和结尾的画面,同时还能在旁边添加参考文件。在 prompt 中说明哪张是首帧、哪张是尾帧,以及每个参考的用途。
视频参考总时长可达 15 秒,音频参考另可达 15 秒。如果你想在多段视频中保留同一个人物,只需保存一次到 OpenArt 角色 并加以复用,无需每次都费力去找原始图片。
给镜头编号,并为每个镜头标注时间
Wan 3.0 一次可生成长达 30 秒的视频,所以要告诉它这段时间里发生了什么,而不是只描述一个静止画面。阿里巴巴的格式是:先写一段简短概述,再按时间段列出编号镜头:
一个关于女孩收养流浪猫的小故事。
镜头 1 [0-5s]:她冒雨走回家,停在一处门廊下。
镜头 2 [5-12s]:特写一只淋湿的小猫抬头望着她。
镜头 3 [12-20s]:她跪下身,伸出手。
给每个时间段安排一件明确的事。如果第一次生成时某个镜头显得太赶,就把那一个时间段拉长,其余保持不变。若要讲更长的故事、镜头比这更多,请逐场景搭建,在 OpenArt Director.
把声音分成三个独立部分来写
Wan 3.0 会在生成画面的同时生成声音,因此你可以用文字来塑造它。阿里巴巴把声音分为三部分,分别单独描述会更有帮助。
配音台词。 先写出台词,再说明说话的方式。“She says, 'I told you this would happen.' Fast, a little annoyed, American English.”
音效。 点明对象、它做了什么,以及背景声响。「A glass falls off the table and shatters on the wood floor, quiet room.」
音乐。 点明音乐和风格。「Slow piano under the whole scene.」
Wan 3.0 会为你决定的三样内容
这正是很多人栽跟头的地方。就算你什么都不说,Wan 3.0 也依然会替你做出选择。
配音台词。 写出台词内容,Wan 3.0 就会照你的原话呈现。什么都不写,它就会自行编造配音。用“no voice lines in the whole video.”来关闭这一功能。
音乐。 Wan 3.0 会根据视频的内容选择背景音乐。用「no background music」来关闭它。
镜头数量。 Wan 3.0 会自行决定是否在镜头之间切换。用「one continuous take」来要求一个不间断的连续镜头。
时长和画幅的用法也一样。留空的话,Wan 3.0 会选择 2 到 30 秒之间的时长,以及适合你场景的画面比例。
生成前先检查四项控制项
On OpenArt, four settings sit around the prompt box and each one changes what your words do.
Auto Polish。 This rewrites your prompt before it runs. That helps when you have typed one loose sentence, but it can also reword the reference labels and time ranges you set on purpose. Switch it off once your prompt is exact.
音频。 保持开启,Wan 3.0 会在生成画面的同时生成声音。关闭它可得到无声片段,这也是阻止不需要的音乐最快的方式。
镜头。 Pick your camera move here instead of typing it, and you get the same move every time without wording it differently in each prompt.
模式。 Standard 和 Prime 用来设定画质等级。先在 Standard 上测试你的 prompt,再把满意的版本转到 Prime。
你还可以一次排队生成最多 8 段视频。这是了解某个词作用的最快方法:每个版本只改一处,把 8 个都跑一遍,再做对比。
从图片起步时,少说几句
When you upload a starting picture, that picture already settles who is in it, where they are, and how it all looks. Repeating that in the prompt just fights the picture you uploaded.
所以只写两件事:什么在动,以及镜头怎么动。「She turns toward the window and smiles. Slow push in.」如果你想让镜头保持静止,就写「fixed shot」,否则 Wan 3.0 会自行移动镜头。
只修一处,而不是重新生成整段视频
Wan 3.0 可以根据简单的指令编辑视频,因此一个小问题不必让你重做整段视频。指明要改什么,再说其余部分保持不变。
去掉墨镜。她的动作以及视频中的其他一切保持不变。
无论是添加内容、更改风格、修正光线还是替换配音,用的都是同一套写法。
四个浪费生成次数的常见错误
- 只描述一张图片,而非一段视频。 说明这 30 秒里发生了哪些变化。
- 参考图保持无标注状态。 如果你上传了六份文件,就说明每一份的用途。
- 叠加运镜。 一个清晰的动作,胜过三个互相打架的动作。
- 忘了关掉你根本没要求的声音。 音乐和配音会自行出现。
常见问题
Wan 3.0 可以使用多少个参考?
Wan 3.0 单个视频最多支持 20 个参考:10 张图片、5 段视频和 5 段音频。你还可以额外添加一个文档或网页,让角色、产品、场景和声音共同引导同一个镜头。视频参考总时长可达 15 秒,音频参考另可达 15 秒。
Wan 3.0 视频最长能有多长?
时长可为 2 到 30 秒之间的任意值。若留空,Wan 3.0 会根据你的 prompt 选择合适的时长。
Wan 3.0 会生成声音吗?
是的。Wan 3.0 会在生成画面的同时生成配音、音效和音乐。在 prompt 中描述你想要的声音,或者关闭它来生成无声片段。
我可以同时使用参考文件以及首帧和尾帧吗?
是的。在 OpenArt 上,你可以设定视频开头的画面、结尾的画面,同时还能添加参考文件。在 prompt 中标注每一个,让 Wan 3.0 明白哪张画面是开头、哪张是结尾,以及哪些参考承载你的角色、产品或声音。