説明
Wan 2.2は、ビデオ拡散にMixture-of-Experts(MoE)アーキテクチャを初めて導入したオープンソースのビデオ生成モデルです。アリババのTongyi Labによって構築されており、ユーザーはテキストや画像から480Pおよび720Pの解像度で映画的なビデオを作成でき、GitHubから完全なモデルウェイトをダウンロードできます。
このモデルは、ショット言語の深い理解を通じて映画的なビジョンコントロールを強調し、照明、色、構図に対する細かなコントロールを提供し、多様なスタイルに対応します。I2V-A14B画像からビデオへのモデルは、リアルな物理学、自然な動き、非現実的なカメラの動きを減少させた安定したビデオ合成を実現し、高度な動きの理解により、ダンス、パルクール、フィギュアスケートなどの複雑な動きを滑らかに再現します。MoEアーキテクチャは、計算効率を維持しながらモデルの容量を拡大します。
Wan 2.2には、下流のビデオ統合に最適化された画像を生成する強化されたビジュアル作成パイプラインも含まれており、照明、構図、色に関するキュレーションされた美的データで調整されています。以前のバージョンより65.6%多くの画像でトレーニングされており、動き、意味、審美性における一般化を改善しています。完全にオープンソースであるため、開発者やクリエイターはそれをダウンロードして自分で実行でき、グローバルなコミュニティがこのモデルを使って作成した作品を共有しています。
Wan 2.2の主要機能
GitHubから完全なダウンロード可能なウェイトを持つオープンソースモデル
効率的な大容量のためのMixture-of-Experts(MoE)アーキテクチャ
480Pおよび720Pでのテキストからビデオ、画像からビデオの生成
リアルな物理学を持つ安定した合成のためのI2V-A14Bモデル
複雑で流動的な動きのための高度な動きの理解
照明、色、構図に対する映画的コントロール
美的調整を施したビデオ最適化画像生成パイプライン
最適化されたパフォーマンスで24fpsの720p出力
Wan 2.2の使い方は?
モデルをダウンロードする:GitHubからWan 2.2とその完全なウェイトを取得します。
モードを選択する:テキストからビデオまたは画像からビデオ生成を使用します。
入力を提供する:テキストプロンプトを書くか、視覚パイプラインで準備した開始画像を提供します。
映画的コントロールを設定する:希望するスタイルのために照明、色、構図、動きを指定します。
生成する:480Pまたは720Pの映画的クリップを作成します。
Wan 2.2の使用例
- 映画的テキストからビデオ
- 画像からビデオの作成
- 自己ホスト型生成
- 動きの多いコンテンツ







