限时优惠!年度套餐低至 27% 折扣,开启一整年无限创作。

查看套餐 ›
视频指南

Wan 3.0 Prompt 指南——语法、参考与音效

O
Sameer Sohail
Aug 25, 2026 · 阅读时长 7 分钟
Wan 3.0 Prompt Guide - Syntax, References, and Sound

Wan 3.0 是 OpenArt 上最新的 AI 模型之一 AI 视频生成器,而阿里巴巴在模型发布当天就公布了自己的 prompt 公式。几乎没人去读它们,所以我们为你整理了这份权威的 prompt 指南。

Wan 3.0 一次可生成长达 30 秒的视频,最多接收 20 份参考文件,并在生成画面的同时生成音频。本指南涵盖了 Wan 的制作方阿里巴巴写下的公式,以及你若不指定、Wan 3.0 就会自动为你决定的三样内容。

要点总结

  • 先从主体、场景和动作开始。这套跑通后,再加入镜头、风格和声音。
  • 用 @Image1、@Video1 或 @Audio1 标注每一个参考文件,让 Wan 3.0 明白每个文件的用途。
  • 给镜头编号,并为每个镜头标注一个时间段,例如 [0-6s]。
  • 把配音、音效和音乐分成三个独立部分来写。
  • 不想要背景音乐时就写上“no background music”,因为 Wan 3.0 会自行添加音乐和配音。
  • 当你的 prompt 已经精确无误后,请关闭「自动润色」,以免它改动你的标签和时间范围。

先从三样开始,再逐步添加

阿里巴巴的入门公式很简短。你需要一个主体、一个场景和一个动作。「A red fox walks across a snowy field at sunrise.」三要素齐全,足以生成一段真正的视频。

这一步跑通后,更完整的公式再补充三项:镜头的呈现方式、风格和声音。一次加一项,这样你能看清每一项带来的变化。你有充足的空间,因为一个 Wan 3.0 的 prompt 最长可达 20,000 个字符。

用 @ 标签标注每一份参考素材

Wan 3.0 最多支持 20 个参考文件,OpenArt 会在上传框顶部为你自动计数。

上传它们只完成了一半的工作。Wan 3.0 不会自己猜出图片 3 是咖啡馆、图片 4 是夹克。你必须在 prompt 中用 @ 标签明确说明:

@Image1 是这位女士。@Image2 是咖啡馆。@Audio1 是她的声音。@Image1 里的女士坐在 @Image2 的窗边,点了一杯咖啡。

阿里巴巴自家的示例都是这样标注每一个参考的。你也可以在同一个 prompt 中多次提到同一个参考,以此控制它在哪些地方生效。

首帧和尾帧的用法也一样。在 OpenArt 上,你可以设定视频开头和结尾的画面,同时还能在旁边添加参考文件。在 prompt 中说明哪张是首帧、哪张是尾帧,以及每个参考的用途。

视频参考总时长可达 15 秒,音频参考另可达 15 秒。如果你想在多段视频中保留同一个人物,只需保存一次到 OpenArt 角色 并加以复用,无需每次都费力去找原始图片。

给镜头编号,并为每个镜头标注时间

Wan 3.0 一次可生成长达 30 秒的视频,所以要告诉它这段时间里发生了什么,而不是只描述一个静止画面。阿里巴巴的格式是:先写一段简短概述,再按时间段列出编号镜头:

一个关于女孩收养流浪猫的小故事。

镜头 1 [0-5s]:她冒雨走回家,停在一处门廊下。

镜头 2 [5-12s]:特写一只淋湿的小猫抬头望着她。

镜头 3 [12-20s]:她跪下身,伸出手。

给每个时间段安排一件明确的事。如果第一次生成时某个镜头显得太赶,就把那一个时间段拉长,其余保持不变。若要讲更长的故事、镜头比这更多,请逐场景搭建,在 OpenArt Director.

把声音分成三个独立部分来写

Wan 3.0 会在生成画面的同时生成声音,因此你可以用文字来塑造它。阿里巴巴把声音分为三部分,分别单独描述会更有帮助。

配音台词。 先写出台词,再说明说话的方式。“She says, 'I told you this would happen.' Fast, a little annoyed, American English.”

音效。 点明对象、它做了什么,以及背景声响。「A glass falls off the table and shatters on the wood floor, quiet room.」

音乐。 点明音乐和风格。「Slow piano under the whole scene.」

Wan 3.0 会为你决定的三样内容

这正是很多人栽跟头的地方。就算你什么都不说,Wan 3.0 也依然会替你做出选择。

配音台词。 写出台词内容,Wan 3.0 就会照你的原话呈现。什么都不写,它就会自行编造配音。用“no voice lines in the whole video.”来关闭这一功能。

音乐。 Wan 3.0 会根据视频的内容选择背景音乐。用「no background music」来关闭它。

镜头数量。 Wan 3.0 会自行决定是否在镜头之间切换。用「one continuous take」来要求一个不间断的连续镜头。

时长和画幅的用法也一样。留空的话,Wan 3.0 会选择 2 到 30 秒之间的时长,以及适合你场景的画面比例。

生成前先检查四项控制项

在 OpenArt 上,prompt 输入框周围有四项设置,每一项都会改变你的文字所产生的效果。

Auto Polish。 这会在运行前重写你的 prompt。当你只随手写了一句松散的句子时,它很有帮助,但它也可能改动你特意设置的参考标签和时间范围。当你的 prompt 已经精确无误后,请将其关闭。

音频。 保持开启,Wan 3.0 会在生成画面的同时生成声音。关闭它可得到无声片段,这也是阻止不需要的音乐最快的方式。

镜头。 在这里选择你的运镜方式,而不用手动输入,这样每次都能获得相同的运镜效果,无需在每个 prompt 里换着说法描述。

模式。 Standard 和 Prime 用来设定画质等级。先在 Standard 上测试你的 prompt,再把满意的版本转到 Prime。

你还可以一次排队生成最多 8 段视频。这是了解某个词作用的最快方法:每个版本只改一处,把 8 个都跑一遍,再做对比。

从图片起步时,少说几句

当你上传一张起始图片时,这张图片已经确定了画面里有谁、身处何地,以及整体呈现的样子。在 prompt 里重复这些内容,只会与你上传的图片相互冲突。

所以只写两件事:什么在动,以及镜头怎么动。「She turns toward the window and smiles. Slow push in.」如果你想让镜头保持静止,就写「fixed shot」,否则 Wan 3.0 会自行移动镜头。

只修一处,而不是重新生成整段视频

Wan 3.0 可以根据简单的指令编辑视频,因此一个小问题不必让你重做整段视频。指明要改什么,再说其余部分保持不变。

去掉墨镜。她的动作以及视频中的其他一切保持不变。

无论是添加内容、更改风格、修正光线还是替换配音,用的都是同一套写法。

四个浪费生成次数的常见错误

  • 只描述一张图片,而非一段视频。 说明这 30 秒里发生了哪些变化。
  • 参考图保持无标注状态。 如果你上传了六份文件,就说明每一份的用途。
  • 叠加运镜。 一个清晰的动作,胜过三个互相打架的动作。
  • 忘了关掉你根本没要求的声音。 音乐和配音会自行出现。

常见问题

Wan 3.0 可以使用多少个参考?

Wan 3.0 单个视频最多支持 20 个参考:10 张图片、5 段视频和 5 段音频。你还可以额外添加一个文档或网页,让角色、产品、场景和声音共同引导同一个镜头。视频参考总时长可达 15 秒,音频参考另可达 15 秒。

Wan 3.0 视频最长能有多长?

时长可为 2 到 30 秒之间的任意值。若留空,Wan 3.0 会根据你的 prompt 选择合适的时长。

Wan 3.0 会生成声音吗?

是的。Wan 3.0 会在生成画面的同时生成配音、音效和音乐。在 prompt 中描述你想要的声音,或者关闭它来生成无声片段。

我可以同时使用参考文件以及首帧和尾帧吗?

是的。在 OpenArt 上,你可以设定视频开头的画面、结尾的画面,同时还能添加参考文件。在 prompt 中标注每一个,让 Wan 3.0 明白哪张画面是开头、哪张是结尾,以及哪些参考承载你的角色、产品或声音。

创作无极限

加入数百万创作者的行列,用 OpenArt 生成图像、视频、角色和故事——全都在一个平台上完成。

免费开始使用 →