テキストか画像かを選ぶ
プロンプトから始めるなら「テキストから動画」、開始フレーム、開始・終了フレーム、参照画像をアップロードするなら「画像から動画」を選びます。
最長30秒のワンカットを、音声まで一度に生成
Wan 3.0 は、アリババの通義万相(Tongyi Wan)チームによる最新の動画モデルです。テキストプロンプト、開始フレーム(終了フレームは任意)、または最大9枚の参照画像から始め、2〜30秒の長さと480p・720p・1080pの解像度を選べます。音声は映像と同時に生成され、消費クレジットは送信前に表示されます。
4ステップで Wan 3.0 動画を作成
プロンプトから始めるなら「テキストから動画」、開始フレーム、開始・終了フレーム、参照画像をアップロードするなら「画像から動画」を選びます。
被写体、動き、カメラワーク、舞台、雰囲気、聞かせたいセリフや音を記述します。
2〜30秒、480p/720p/1080p、アスペクト比を選びます。設定を変えるたびに、消費クレジットの見積もりが更新されます。
送信後、Wan 3.0 のレンダリングを数分待ちます。クリップを最後まで確認してから、ダウンロードするかプロンプトを調整しましょう。
より長いワンカット、ネイティブ音声、3つの始め方
Wan 3.0 は2〜30秒の連続したクリップを一度に生成します。Wan 2.7 の上限15秒の2倍なので、短い断片をつなぎ合わせなくても、シーンの導入から展開、結末までを描けます。
セリフ、環境音、効果音が映像と一緒に生成されるため、無音ではなく音の付いたクリップが仕上がります。音声はデフォルトでオンで、オフにしても消費クレジットは変わりません。
プロンプトだけで一から作成するほか、1枚の画像を開始フレームとして動かしたり、2枚の画像で開始フレームと終了フレームを固定し、その間の動きを Wan 3.0 に補完させたりできます。
「画像の用途」を「参照画像」に切り替えると、最大9枚の画像でキャラクター、商品、衣装、ロケーションを指定できます。プロンプトでは @image1、@image2 のように各画像を指定します。
アリババは Wan 3.0 をリアリズム重視で開発しました。従来の Wan より表情や微表情が豊かになり、カット全体で被写体が安定し、画面内の文字もより鮮明に描写されます。
手早い試作には480p、日常のコンテンツには720p、最終納品には1080pがおすすめです。16:9、9:16、1:1、4:3、3:4、アダプティブから構図を選べます。出力は30 fpsのMP4です。
Wan 3.0 動画をオンラインで作る方法
このページの Wan 3.0 生成ツールは、アリババの wan3.0-video モデルをブラウザ上で実行します。インストールも、API キーやクラウドコンソールも不要です。以下の手順で、アイデアや1枚の静止画を完成したクリップに仕上げましょう。
このページ上部のプレイグラウンドを使います。Wan 3.0 はすでに選択されています。生成する準備ができたらログインしてください。Wan 3.0 の利用には有料プランまたは購入したクレジットが必要です。
プロンプトのみで生成する場合は「テキストから動画」のままで OK です。「画像から動画」では、「画像の用途」を「開始/終了フレーム」(1枚目がクリップの冒頭、任意の2枚目が結末)または「参照画像」(最大9枚)に設定します。
シーンを短いショットリストのように書きましょう。画面に誰がいて、何をして、カメラがどう動き、何が聞こえるか。参照画像を使う場合は @image1、@image2 と指定して、モデルがどの画像かを区別できるようにします。
2〜30秒を選び、480p、720p、1080p から解像度を選びます。Reels や TikTok には9:16、YouTube には16:9、フィードには1:1、構図をモデルに任せるならアダプティブを選びます。
送信して Wan 3.0 のレンダリングを待ちます。長いクリップや高解像度ほど時間がかかります。顔、手、文字、音声の同期を確認し、ダウンロードするか、一度に1点ずつ調整して再生成しましょう。
480pの1秒あたりのコストは1080pの約4分の1です。短い480pの試作で動きとタイミングを固めてから、うまくいったプロンプトをフル解像度で生成し直しましょう。
30秒のクリップには1つの展開だけでは足りません。導入、アクション、転換、結末の順にシーンを記述し、全編を通してモデルが描く内容を用意しましょう。
最後のポーズや商品カットが重要なときは、それを終了フレームとしてアップロードします。Wan 3.0 はその画像にぴたりと着地するよう動きを組み立てます。
音声は映像と同時に生成されるので、音を具体的に指定しましょう。かぎ括弧で囲んだセリフ、窓を打つ雨、観客の歓声など。具体的な指示ほど説得力のある音になります。
あらゆるクリエイターのための長尺ワンカット AI 動画
一貫したキャラクター、セリフ、音で30秒のワンシーンを丸ごと演出。ショートドラマ、ストーリーのティザー、キャラクターのテストに最適です。
商品写真を動きのあるショーケースに変え、メインカットを終了フレームとして固定。公開前にラベルや形状を確認できます。
TikTok、Reels、Shorts 向けの9:16縦型クリップを音声付きで制作。480pで素早く試してから最終版をレンダリングできます。
コンセプト、プロセス、場所をナレーション付きのクリップで可視化し、授業、オンボーディング、プレゼンテーションに活用できます。
Wan 3.0 動画生成ツールのすべて
Wan 3.0(wan3.0-video)は、アリババの通義ラボ(Tongyi Lab)による最新の動画モデルで、2026年8月6日にパブリックベータとして公開されました。1つのエンジンでテキストから動画、開始/終了フレームを使った画像から動画、参照画像によるガイド生成をこなすオールインワンモデルで、最長30秒のクリップを音声と同時に生成できます。
テキストプロンプトからの生成、開始フレームのアニメーション化、開始フレームと終了フレームの両方の指定、最大9枚の参照画像による動画のガイドが可能です。Wan 3.0 はアリババの API 経由で参照動画、音声、ドキュメント、Web ページも読み込めますが、これらの入力はこのページではまだ利用できません。
2〜30秒の任意の整数秒で、解像度は480p、720p、1080pから選べ、30 fpsのMP4で出力されます。Wan 3.0 には4Kの設定はなく、4K出力をうたう情報は正確ではありません。
Wan 3.0 は出力1秒あたりの料金で、480pは約2.74クレジット、720pは5.48クレジット、1080pは10.96クレジットで、動画ごとに切り上げられます。5秒のクリップは480pで14クレジット、720pで28クレジット、1080pで55クレジット、30秒の1080pクリップは329クレジットです。音声のオン/オフで料金は変わらず、正確なコストは生成前に表示されます。
「開始/終了フレーム」では画像をそのままフレームとして使います。1枚目がクリップの冒頭になり、任意の2枚目が結末になります。「参照画像」では最大9枚の画像を、動画内のどこにでも登場しうるキャラクター、物体、場所のガイドとして使います。1回の生成で両方を組み合わせることはできません。
はい。すべての有料プランに商用ライセンスが含まれており、Wan 3.0 で生成した動画を広告、クライアントワーク、SNS、販売する製品に利用できます。無料プランは個人利用のみです。プロンプトや参照画像に含まれる人物、ブランド、音楽、素材の権利処理は、公開前にご自身で行ってください。
はい。音声は映像と一緒に生成され、デフォルトでオンになっているため、セリフ、環境音、効果音が同期した状態で仕上がります。オフにして無音のクリップを作ることもでき、どちらでも消費クレジットは同じです。
いいえ。オープンウェイトで公開された Wan 2.1 や 2.2 とは異なり、Wan 3.0 はクラウド API 経由でのみ提供されるクローズドモデルのため、公式にダウンロードできるウェイトはありません。「Wan 3.0 無料ダウンロード」をうたうものは非公式と考えてください。
設定の確認や正確な消費クレジットの表示は無料で行えます。Wan 3.0 で生成するには有料プランまたは購入したクレジットが必要です。クレジットは送信時に消費され、生成に失敗した場合は自動的に返還されます。
ほとんどのクリップは1〜5分ほどで完成します。長いクリップや1080pではさらに時間がかかるため、まず短い480pの試作で動きを確認してから最終版をレンダリングしましょう。