Wan NSFW
用語集

AI動画用語集

Wan AI動画モデルで出会う技術用語を平易に解説します。関連用語やモデルのリンクをクリックすると詳しく確認できます。

T2V(テキストから動画)
#

テキストプロンプトだけから動画を生成します。

テキストから動画(T2V)は、入力画像を使わず、文章のプロンプトから動画クリップをゼロから合成します。シーン、ポーズ、照明、カメラの動きを記述すると、モデルがその説明から直接動きを描画します。すべてのWan動画モデルがT2Vに対応しています。詳細で具体的なプロンプトほど、品質は大きく向上します。
I2V(画像から動画)
#

静止画像に動きを付けて動画クリップにします。

画像から動画(I2V)は、元画像を視覚的な出発点として動きを生成します。Wan動画モデルでは通常、その画像が先頭フレームになり、新しいワークフローでは先頭と末尾のフレームを指定してクリップの始まりと終わりを導くこともできます。Wan 2.2、Wan 2.5、Wan 2.6、Wan 2.7、Wan 3.0はいずれも、形は異なりますがI2Vワークフローに対応しています。
R2V(参照から動画)
#

1枚以上の参照画像を利用して動画を生成します。

参照から動画(R2V)は、Wan動画モデルが参照画像を視覚的なガイドとして使う生成モードです。参照は被写体、スタイル、構図など、認識可能な状態を維持すべき要素を定め、テキストプロンプトは生成する動き、シーン、照明、カメラ方向を指定します。R2Vはテキストだけに依存しない点でT2Vと異なり、複数出力間の一貫性を重視する場合に使われる点で基本的なI2Vとも異なります。
拡散モデル
#

Wan動画生成を支える中核的なAIアーキテクチャ。

拡散モデルは、ノイズ処理を逆転させる方法を学習してコンテンツを生成します。ランダムノイズから始め、テキストや画像の条件に導かれながら、一貫した画像や動画へ段階的に精緻化します。Wan AIモデルは拡散アーキテクチャを基盤としています。出力の品質と一貫性は、実行するノイズ除去ステップ数とガイダンススケールに大きく左右されます。
CFGスケール(Classifier-Free Guidance)
#

モデルが独自の変化を加える度合いに対し、プロンプトにどれだけ忠実に従うか。

CFG(Classifier-Free Guidance)は、モデルがプロンプトに従う厳密さを制御する数値です。低いCFG(例:3〜5)は創造の自由度を高め、動きを滑らかにしやすい一方、プロンプトから外れる場合があります。高いCFG(例:10〜15)は文言への忠実度を高めますが、過飽和やアーティファクトの多いフレームを生むことがあります。このサイトの多くの生成ツールは妥当な既定値を使うため、明らかなプロンプトのずれや色飛びがある場合だけ調整してください。
ノイズ除去ステップ(サンプリングステップ)
#

最終フレームを生成するまでにモデルが行う精緻化処理の回数。

各ノイズ除去ステップは、ノイズから一貫した結果へ出力を精緻化します。ステップ数が多いほど(例:50)一般に鮮明で詳細になりますが、生成時間は長くなります。少ない場合(例:20)は高速ですが、ややぼやけたり不安定になったりします。NSFW動画生成では通常20〜30ステップが良いバランスです。このサイトの生成ツールはステップ数を自動管理します。
プロンプト
#

モデルが生成する内容を決めるテキスト説明。

プロンプトは、生成してほしい内容をモデルに伝える文章です。動画向けの優れたプロンプトには通常、被写体の説明(外見、ポーズ)、動作や動き、背景と照明、カメラの角度や移動、スタイルの指示が含まれます。Wanモデルは明示的で具体的な説明によく反応します。曖昧なプロンプトは一般的な結果に、具体的なプロンプトは制御された結果につながります。モデル別のヒントはプロンプトガイドを参照してください。
ネガティブプロンプト
#

生成を避ける内容をモデルに伝える言葉。

ネガティブプロンプトは、出力に含めたくないもの(例:「ぼやけ、透かし、余分な手足、歪んだ顔」)を列挙する2つ目のテキスト入力です。モデルはこれらの概念から生成結果を遠ざけます。NSFW動画向けの効果的なネガティブプロンプトには、一般的なアーティファクトの説明を含めます。すべての画面にこの欄があるわけではありませんが、このサイトのWan生成ツールでは詳細設定に用意されています。
被写体の一貫性
#

フレーム、ショット、クリップを通じて被写体が安定する度合い。

被写体の一貫性は、同じ被写体がフレーム、ショット、生成クリップを通じて認識可能な状態を保つかを表します。一貫性が弱いと、動画の進行中に外見が変わる同一性ドリフトが起こります。Wan 2.2は初期の動画シリーズで安定性を改善し、Wan 2.5と2.6がさらに強化しました。I2Vは元画像を使うことで役立ち、R2Vや新しいWan 2.7 / Wan 3.0の参照ワークフローは、より複雑な出力でも参照メディアで一貫性を導けます。
FPS(1秒あたりのフレーム数)
#

1秒ごとに描画される動画フレームの数。

FPSは1秒の動画に表示されるフレーム数です。高いFPSは通常動きを滑らかにしますが、同じ長さでも生成フレーム数が増えます。以前のWan動画仕様では、Wan 2.6が最大15秒、1回あたり約~360フレームを生成するなど、約~24 fpsと記載されることがあります。新しいWan 2.7とWan 3.0動画モデルは30 fpsのMP4出力とされ、Wan 3.0の30秒クリップを30 fpsで生成すると約900フレームになります。
解像度
#

生成された動画出力のピクセル寸法と鮮明度の段階。

解像度は各動画フレームの幅×高さで、ピクセル値または720p、1080pなどの出力段階で表します。高解像度ほど細部を捉えますが、計算量、メモリー、生成時間が増える場合があります。Wan 2.2、Wan 2.5、Wan 2.6は一般にネイティブ1080p動画モデルとされています。Wan 2.7動画は720pと1080p、Wan 3.0は480p、720p、1080pに対応し、1080pが最高段階です。実際の鮮明さは、モデルの描写力、プロンプト品質、元メディア、動きの複雑さにも左右されます。
プロンプト忠実度
#

出力が記述したプロンプトに従う度合い。

プロンプト忠実度は、Wanモデルがプロンプトに書かれたシーン、被写体、動き、カメラ、照明、スタイルにどれだけ従うかを表します。忠実度が高いと、無関係な詳細を加えたり重要な指示を無視したりせず、要求した方向に近い出力になります。Wan 2.2は初期動画シリーズでプロンプト制御を改善し、新しいWan 2.7とWan 3.0はプロンプト拡張や参照メディアも利用して、結果をより明確に導けます。
動きの滑らかさ
#

フレーム間の動きが自然で安定して見える度合い。

動きの滑らかさは、あるフレームから次へ連続して見えるかを表します。特にプロンプトが多くの動作を同時に求めると、動きがぎこちなく、硬く、不安定になることがあります。FPSは影響しますが、プロンプトの明確さ、被写体の一貫性、シーンの複雑さ、モデルの版も重要です。Wan 2.5とWan 2.6は従来モデルより安定性を改善し、Wan 2.7とWan 3.0はより長く制御された動き向けの強力なワークフローを追加します。
アスペクト比
#

生成されるフレームの形状。

アスペクト比は、横長の16:9、縦長の9:16、正方形の1:1など、画像や動画フレームの幅と高さの比率です。フレーミング、構図、ショット内の被写体配置に影響します。Wan 2.6の仕様では9:16、16:9、1:1が一般的で、Wan 2.7とWan 3.0は4:3や3:4などにも対応します。先頭フレームや参照ベースのワークフローでは、手動選択した比率ではなく入力メディアの形状に従う場合があります。
参照メディア
#

モデルの生成内容を導くために使う入力メディア。

参照メディアとは、テキスト以外でWanの生成を導く入力素材です。モデルやワークフローによって、画像、動画、音声、ファイル、Webページのリンクを使用できます。プロンプトだけの場合より、同一性、シーンの方向性、視覚スタイル、動き、音を明確に伝えられます。I2Vは通常元画像から始まり、R2VやWan 3.0の参照ベースのワークフローは、より幅広い入力で複雑な出力を強く制御できます。