Wan NSFW
Glossaire

Glossaire vidéo IA

Définitions accessibles de tous les termes techniques rencontrés avec les modèles vidéo Wan AI. Cliquez sur un terme ou modèle associé pour approfondir.

T2V (texte vers vidéo)
#

Générez une vidéo à partir d'un simple prompt textuel.

Le texte vers vidéo (T2V) transforme un prompt écrit en clip vidéo à partir de zéro, sans image d'entrée. Vous décrivez la scène, la pose, l'éclairage et le mouvement de caméra, puis le modèle génère directement le mouvement à partir de cette description. Tous les modèles vidéo Wan prennent en charge le T2V. Des prompts détaillés et précis améliorent nettement la qualité.
I2V (image vers vidéo)
#

Animez une image fixe pour en faire un clip vidéo.

L'image vers vidéo (I2V) utilise une image source comme point de départ visuel et en génère le mouvement. Dans les modèles vidéo Wan, l'image sert généralement de première image ; les flux récents peuvent aussi contrôler la première et la dernière image afin de guider le début et la fin du clip. Wan 2.2, Wan 2.5, Wan 2.6, Wan 2.7 et Wan 3.0 proposent tous des flux I2V sous différentes formes.
R2V (référence vers vidéo)
#

Générez une vidéo à l'aide d'une ou plusieurs images de référence.

La référence vers vidéo (R2V) est un mode où un modèle vidéo Wan emploie des images de référence comme guide visuel. La référence définit ce qui doit rester reconnaissable, comme le sujet, le style ou la composition, tandis que le prompt indique le mouvement, la scène, l'éclairage et la direction de caméra à générer. Le R2V diffère du T2V car il ne repose pas uniquement sur le texte, et de l'I2V simple car il sert généralement lorsque la cohérence entre plusieurs résultats importe.
Modèle de diffusion
#

L'architecture d'IA centrale de la génération vidéo Wan.

Un modèle de diffusion génère du contenu en apprenant à inverser un processus de bruit : il part d'un bruit aléatoire et l'affine progressivement en une image ou vidéo cohérente, guidé par une condition textuelle ou visuelle. Les modèles Wan AI reposent sur des architectures de diffusion. La qualité et la cohérence dépendent fortement du nombre d'étapes de débruitage et de l'échelle de guidage.
Échelle CFG (guidage sans classifieur)
#

Dans quelle mesure le modèle suit votre prompt plutôt que d'ajouter ses propres variations.

Le CFG (guidage sans classifieur) est un nombre contrôlant la rigueur avec laquelle le modèle suit le prompt. Un CFG faible (p. ex. 3–5) lui laisse plus de liberté et donne souvent un mouvement plus fluide, mais peut s'écarter du prompt. Un CFG élevé (p. ex. 10–15) le rapproche de vos mots, au risque d'images sursaturées ou chargées d'artefacts. Les générateurs de ce site utilisent une valeur raisonnable ; ne l'ajustez qu'en cas de dérive évidente ou de couleurs brûlées.
Étapes de débruitage (étapes d'échantillonnage)
#

Nombre de passes d'affinage effectuées avant de produire l'image finale.

Chaque étape de débruitage affine le bruit pour aboutir à un résultat cohérent. Davantage d'étapes (p. ex. 50) produisent en général des images plus nettes et détaillées, mais allongent la génération. Moins d'étapes (p. ex. 20) sont plus rapides, au risque d'un résultat légèrement flou ou incohérent. Pour la vidéo NSFW, 20–30 étapes offrent généralement un bon équilibre. Le générateur de ce site les gère automatiquement.
Prompt
#

La description textuelle qui détermine ce que génère le modèle.

Un prompt est le texte indiquant au modèle ce qu'il doit générer. Pour une vidéo, un bon prompt comprend généralement la description du sujet (apparence, pose), l'action ou le mouvement, le décor et l'éclairage, l'angle ou le mouvement de caméra et des indications de style. Les modèles Wan répondent bien aux descriptions explicites et concrètes. Un prompt vague donne un résultat générique ; un prompt précis permet de le maîtriser. Consultez le Guide des prompts pour des conseils propres à chaque modèle.
Prompt négatif
#

Mots indiquant au modèle ce qu'il doit éviter de générer.

Un prompt négatif est un second champ de texte où vous listez les éléments indésirables, par exemple « flou, filigrane, membres supplémentaires, visage déformé ». Le modèle éloigne la génération de ces concepts. Les prompts négatifs efficaces pour la vidéo NSFW mentionnent généralement les artefacts courants. Toutes les interfaces ne proposent pas ce champ ; le générateur Wan de ce site le place dans les paramètres avancés.
Cohérence du sujet
#

Stabilité d'un sujet entre les images, les plans et les clips.

La cohérence du sujet indique si le même sujet reste reconnaissable entre images, plans ou clips générés. Une cohérence faible peut provoquer une dérive d'identité et modifier l'apparence au fil de la vidéo. Wan 2.2 a amélioré tôt la stabilité des sujets, puis Wan 2.5 et 2.6 l'ont renforcée. L'I2V aide grâce à une image source, tandis que le R2V et les flux Wan 2.7 / Wan 3.0 peuvent employer des références pour guider des résultats plus complexes.
FPS (images par seconde)
#

Nombre d'images vidéo affichées chaque seconde.

Les FPS mesurent le nombre d'images par seconde de vidéo. Une valeur élevée fluidifie généralement le mouvement, mais implique davantage d'images pour une même durée. Les anciennes spécifications Wan indiquent parfois environ ~24 fps, par exemple Wan 2.6 avec jusqu'à 15 secondes, soit ~360 images par génération. Les modèles vidéo Wan 2.7 et Wan 3.0 récents sont documentés avec une sortie MP4 à 30 fps ; un clip Wan 3.0 de 30 secondes à 30 fps compte environ 900 images.
Résolution
#

Taille en pixels et niveau de netteté de la sortie vidéo générée.

La résolution est la largeur × hauteur de chaque image, exprimée en pixels ou en niveaux comme 720p et 1080p. Une résolution élevée saisit davantage de détails, mais peut demander plus de calcul, de mémoire et de temps. Wan 2.2, Wan 2.5 et Wan 2.6 sont couramment présentés comme des modèles vidéo 1080p natifs. Wan 2.7 vidéo prend en charge 720p et 1080p, tandis que Wan 3.0 propose 480p, 720p et 1080p, son niveau maximal. La netteté perçue dépend aussi du niveau de détail du modèle, du prompt, des médias sources et de la complexité du mouvement.
Respect du prompt
#

Fidélité avec laquelle la sortie suit votre prompt écrit.

Le respect du prompt décrit la façon dont un modèle Wan suit la scène, le sujet, le mouvement, la caméra, l'éclairage et le style demandés. Un bon respect maintient la sortie proche de la direction souhaitée au lieu d'ajouter des détails sans rapport ou d'ignorer des instructions clés. Wan 2.2 a amélioré ce contrôle dans la première gamme vidéo ; les flux Wan 2.7 et Wan 3.0 peuvent aussi étendre le prompt et utiliser des références pour mieux guider le résultat.
Fluidité du mouvement
#

Aspect naturel et stable du mouvement entre les images.

La fluidité indique si le mouvement semble continu d'une image à l'autre. Un mouvement médiocre peut paraître saccadé, raide ou incohérent, surtout si le prompt exige trop d'actions à la fois. Les FPS comptent, mais aussi la clarté du prompt, la cohérence du sujet, la complexité de la scène et la version du modèle. Wan 2.5 et Wan 2.6 ont amélioré la stabilité ; Wan 2.7 et Wan 3.0 ajoutent des flux plus puissants pour des mouvements plus longs et maîtrisés.
Format d'image
#

Forme de l'image générée.

Le format d'image décrit le rapport largeur-hauteur, par exemple 16:9 en paysage, 9:16 en vertical ou 1:1 en carré. Il influence le cadrage, la composition et la place du sujet. Les spécifications de Wan 2.6 utilisent généralement 9:16, 16:9 et 1:1 ; Wan 2.7 et Wan 3.0 proposent aussi 4:3 et 3:4. Dans les flux reposant sur une première image ou une référence, la sortie peut reprendre la forme du média d'entrée plutôt qu'un format choisi manuellement.
Médias de référence
#

Médias d'entrée servant à guider ce que génère le modèle.

Un média de référence est tout contenu d'entrée guidant une génération Wan au-delà du seul texte. Selon le modèle et le flux, il peut s'agir d'images, de vidéos, d'audio, de fichiers ou de liens web. Il aide le modèle à mieux comprendre l'identité, la scène, le style visuel, le mouvement ou le son. L'I2V part généralement d'une image, tandis que le R2V et les flux par référence Wan 3.0 acceptent des médias plus variés pour mieux contrôler les résultats complexes.