KI-Video-Glossar
Verständliche Definitionen aller Fachbegriffe, die dir bei Wan-KI-Videomodellen begegnen. Verwandte Begriffe und Modelllinks führen zu weiteren Informationen.
- T2V (Text-zu-Video) #
- Text-zu-Video (T2V) synthetisiert anhand eines geschriebenen Prompts einen Videoclip von Grund auf, ohne Eingabebild. Du beschreibst Szene, Pose, Beleuchtung und Kamerabewegung; das Modell setzt diese Beschreibung direkt in Bewegung um. Alle Wan-Videomodelle unterstützen T2V. Detaillierte, konkrete Prompts verbessern die Qualität deutlich.
- I2V (Bild-zu-Video) #
- Bild-zu-Video (I2V) nutzt ein Ausgangsbild als visuelle Grundlage und erzeugt daraus Bewegung. Bei Wan-Videomodellen dient das Bild meist als erstes Einzelbild. Neuere Workflows können zusätzlich das erste und letzte Bild vorgeben, um Anfang und Ende des Clips zu steuern. Wan 2.2, Wan 2.5, Wan 2.6, Wan 2.7 und Wan 3.0 unterstützen I2V-Workflows in unterschiedlichen Formen.
- R2V (Referenz-zu-Video) #
- Referenz-zu-Video (R2V) ist ein Generierungsmodus, bei dem ein Wan-Videomodell Referenzbilder als visuelle Orientierung verwendet. Die Referenz legt fest, was erkennbar bleiben soll, etwa Motiv, Stil oder Komposition. Der Textprompt beschreibt Bewegung, Szene, Beleuchtung und Kameraführung. Anders als T2V beruht R2V nicht nur auf Text. Anders als einfaches I2V wird es meist eingesetzt, wenn Konsistenz zwischen mehreren Ergebnissen wichtig ist.
- Diffusionsmodell #
- Ein Diffusionsmodell erzeugt Inhalte, indem es lernt, einen Rauschprozess umzukehren. Es beginnt mit zufälligem Rauschen und verfeinert es unter Führung einer Text- oder Bildbedingung schrittweise zu einem stimmigen Bild oder Video. Wan-KI-Modelle basieren auf Diffusionsarchitekturen. Qualität und Kohärenz hängen stark von der Anzahl der Entrauschungsschritte und der verwendeten Führungsstärke ab.
- CFG-Skala (Classifier-Free Guidance) #
- CFG (Classifier-Free Guidance) ist ein Zahlenwert, der steuert, wie streng das Modell deinem Prompt folgt. Ein niedriger CFG-Wert (z. B. 3–5) lässt mehr kreative Freiheit und erzeugt häufig flüssigere Bewegung, kann aber vom Prompt abweichen. Ein hoher Wert (z. B. 10–15) bindet das Modell enger an deine Worte, kann jedoch übersättigte Bilder oder mehr Artefakte erzeugen. Die meisten Generatoren dieser Website verwenden einen sinnvollen Standardwert. Ändere ihn nur bei deutlichen Prompt-Abweichungen oder übersteuerten Farben.
- Entrauschungsschritte (Sampling-Schritte) #
- Jeder Entrauschungsschritt verfeinert die Ausgabe vom Rauschen hin zu einem stimmigen Ergebnis. Mehr Schritte (z. B. 50) ergeben meist schärfere, detailliertere Bilder, benötigen aber mehr Zeit. Weniger Schritte (z. B. 20) sind schneller, können jedoch etwas unschärfere oder uneinheitliche Ergebnisse liefern. Für NSFW-Videos sind 20–30 Schritte häufig ein guter Kompromiss. Der Generator dieser Website verwaltet die Schrittzahl automatisch.
- Prompt #
- Ein Prompt ist der Text, mit dem du dem Modell mitteilst, was es generieren soll. Ein guter Videoprompt enthält gewöhnlich eine Motivbeschreibung mit Aussehen und Pose, Aktion oder Bewegung, Umgebung und Beleuchtung, Kamerawinkel oder -bewegung sowie Stilhinweise. Wan-Modelle reagieren gut auf eindeutige, konkrete Beschreibungen. Vage Prompts ergeben allgemeine Ergebnisse; präzise Prompts ermöglichen Kontrolle. Modellspezifische Tipps findest du im Prompt-Leitfaden.
- Negativer Prompt #
- Ein negativer Prompt ist ein zweites Textfeld, in dem du unerwünschte Ausgabemerkmale auflistest, etwa „unscharf, Wasserzeichen, zusätzliche Gliedmaßen, verzerrtes Gesicht“. Das Modell lenkt die Generierung von diesen Konzepten weg. Wirksame negative Prompts für NSFW-Videos enthalten häufig Beschreibungen typischer Artefakte. Nicht jede Oberfläche bietet dieses Feld an; beim Wan-Generator dieser Website befindet es sich in den erweiterten Einstellungen.
- Motivkonsistenz #
- Motivkonsistenz beschreibt, ob dasselbe Motiv über Einzelbilder, Einstellungen oder generierte Clips hinweg erkennbar bleibt. Schwache Konsistenz kann zu Identitätsdrift führen: Das Aussehen verändert sich im Verlauf des Videos. Wan 2.2 verbesserte früh die stabile Motivdarstellung, Wan 2.5 und 2.6 bauten darauf auf. I2V hilft durch ein Ausgangsbild. R2V und neuere referenzbasierte Workflows von Wan 2.7 / Wan 3.0 können Referenzmedien nutzen, um auch bei komplexeren Ergebnissen die Konsistenz zu steuern.
- FPS (Bilder pro Sekunde) #
- FPS misst, wie viele Bilder in einer Videosekunde erscheinen. Höhere FPS lassen Bewegung meist flüssiger wirken, bedeuten aber auch mehr generierte Bilder bei gleicher Cliplänge. Ältere Wan-Videospezifikationen nennen etwa 24 fps, beispielsweise Wan 2.6 mit bis zu 15 Sekunden oder ungefähr 360 Bildern pro Generierung. Neuere Wan-2.7- und Wan-3.0-Videomodelle sind mit MP4-Ausgabe bei 30 fps dokumentiert. Ein 30-Sekunden-Clip von Wan 3.0 mit 30 fps umfasst etwa 900 Bilder.
- Auflösung #
- Die Auflösung ist die Breite × Höhe jedes Videobilds, angegeben in Pixeln oder Ausgabestufen wie 720p und 1080p. Höhere Auflösung erfasst feinere Details, kann aber mehr Rechenleistung, Speicher und Generierungszeit benötigen. Wan 2.2, Wan 2.5 und Wan 2.6 werden häufig als native 1080p-Videomodelle beschrieben. Wan 2.7 Video unterstützt 720p und 1080p; Wan 3.0 unterstützt 480p, 720p und 1080p als höchste Stufe. Die wahrgenommene Schärfe hängt außerdem von der Detailleistung des Modells, der Prompt-Qualität, den Ausgangsmedien und der Bewegungskomplexität ab.
- Prompt-Treue #
- Prompt-Treue beschreibt, wie gut ein Wan-Modell die im Prompt genannten Szenen, Motive, Bewegungen, Kameravorgaben, Beleuchtung und Stile umsetzt. Hohe Prompt-Treue bedeutet, dass die Ausgabe deiner Richtung folgt, statt unpassende Details hinzuzufügen oder wichtige Anweisungen zu ignorieren. Wan 2.2 verbesserte die Prompt-Kontrolle in der früheren Videoreihe. Neuere Workflows von Wan 2.7 und Wan 3.0 können zusätzlich Prompt-Erweiterung und Referenzmedien zur klareren Ergebnissteuerung nutzen.
- Bewegungsflüssigkeit #
- Bewegungsflüssigkeit beschreibt, ob eine Bewegung von Bild zu Bild kontinuierlich erscheint. Schwache Bewegung kann zittrig, steif oder inkonsistent wirken, besonders wenn ein Prompt zu viele Aktionen zugleich verlangt. FPS beeinflusst die Flüssigkeit, ist aber nicht der einzige Faktor: Prompt-Klarheit, Motivkonsistenz, Szenenkomplexität und Modellversion sind ebenfalls wichtig. Wan 2.5 und Wan 2.6 verbesserten die Bewegungsstabilität gegenüber älteren Modellen. Wan 2.7 und Wan 3.0 bieten stärkere Videoworkflows für längere und kontrolliertere Bewegungen.
- Seitenverhältnis #
- Das Seitenverhältnis beschreibt das Verhältnis von Breite zu Höhe eines Bilds oder Videobilds, etwa 16:9 für Querformat, 9:16 für Hochformat oder 1:1 für quadratische Ausgaben. Es beeinflusst Bildausschnitt, Komposition und Motivplatzierung. Bei Wan 2.6 sind 9:16, 16:9 und 1:1 üblich; Wan 2.7 und Wan 3.0 unterstützen weitere Optionen wie 4:3 und 3:4. In erstbild- oder referenzbasierten Workflows kann die Ausgabe dem Format der Eingabemedien folgen, statt ein manuell gewähltes Verhältnis zu verwenden.
- Referenzmedien #
- Referenzmedien sind Eingabematerialien, die eine Wan-Generierung über reinen Text hinaus führen. Je nach Modell und Workflow können dies Bilder, Videos, Audio, Dateien oder Webseitenlinks sein. Sie verdeutlichen Identität, Szenenrichtung, visuellen Stil, Bewegung oder Ton besser als ein Prompt allein. I2V beginnt meist mit einem Ausgangsbild; R2V und referenzbasierte Wan-3.0-Workflows können vielfältigere Medien für stärkere Kontrolle komplexer Ergebnisse nutzen.
Ein Video allein aus einem Textprompt erzeugen.
Ein Standbild zu einem Videoclip animieren.
Ein Video mithilfe eines oder mehrerer Referenzbilder erzeugen.
Die grundlegende KI-Architektur hinter der Wan-Videogenerierung.
Wie eng das Modell deinem Prompt folgt oder eigene Variationen ergänzt.
Anzahl der Verfeinerungsdurchläufe bis zum fertigen Bild.
Die Textbeschreibung, die bestimmt, was das Modell erzeugt.
Wörter, die dem Modell sagen, was es nicht erzeugen soll.
Wie stabil ein Motiv über Einzelbilder, Einstellungen und Clips bleibt.
Wie viele Videobilder pro Sekunde gerendert werden.
Die Pixelgröße und Schärfestufe der generierten Videoausgabe.
Wie genau die Ausgabe deinem geschriebenen Prompt folgt.
Wie natürlich und stabil Bewegung über die Einzelbilder hinweg wirkt.
Die Form des generierten Bildausschnitts.
Eingabemedien, die die Generierung des Modells steuern.
