Glossario video IA
Definizioni semplici di ogni termine tecnico incontrato usando i modelli video Wan AI. Fai clic sui termini o modelli correlati per approfondire.
- T2V (testo in video) #
- Il testo in video (T2V) prende un prompt scritto e sintetizza un clip da zero, senza richiedere un'immagine iniziale. Descrivi scena, posa, illuminazione e movimento della videocamera, e il modello crea il movimento direttamente da quella descrizione. Tutti i modelli video Wan supportano T2V. Prompt dettagliati e specifici migliorano notevolmente la qualità.
- I2V (immagine in video) #
- L'immagine in video (I2V) usa un'immagine sorgente come punto di partenza visivo e genera movimento da essa. Nei modelli video Wan, l'immagine funge solitamente da primo fotogramma; i flussi più recenti possono anche controllare primo e ultimo fotogramma per guidare l'inizio e la fine del clip. Wan 2.2, Wan 2.5, Wan 2.6, Wan 2.7 e Wan 3.0 supportano tutti flussi I2V in forme diverse.
- R2V (riferimento in video) #
- Il riferimento in video (R2V) è una modalità in cui un modello video Wan utilizza immagini di riferimento come guida visiva. Il riferimento aiuta a definire ciò che deve rimanere riconoscibile, come soggetto, stile o composizione, mentre il prompt indica movimento, scena, illuminazione e direzione della videocamera da generare. R2V differisce da T2V perché non si basa solo sul testo e da I2V di base perché viene usato soprattutto quando conta la coerenza tra risultati.
- Modello di diffusione #
- Un modello di diffusione genera contenuti imparando a invertire un processo di rumore: parte da rumore casuale e lo perfeziona progressivamente in un'immagine o video coerente, guidato da una condizione testuale o visiva. I modelli Wan AI si basano su architetture di diffusione. Qualità e coerenza dipendono molto dal numero di passaggi di denoising e dalla scala di guida utilizzata.
- Scala CFG (guida senza classificatore) #
- CFG (guida senza classificatore) è un numero che controlla quanto rigorosamente il modello segue il prompt. Un CFG basso (ad es. 3–5) lascia più libertà creativa e tende a produrre movimenti più fluidi, ma può allontanarsi dal prompt. Un CFG alto (ad es. 10–15) forza maggiore aderenza alle parole, ma può creare fotogrammi sovrasaturi o pieni di artefatti. I generatori del sito usano un valore predefinito ragionevole; modificalo solo in caso di evidente deriva o colori bruciati.
- Passaggi di denoising (passaggi di campionamento) #
- Ogni passaggio di denoising perfeziona l'output dal rumore verso un risultato coerente. Più passaggi (ad es. 50) producono in genere fotogrammi più nitidi e dettagliati, ma aumentano il tempo di generazione. Meno passaggi (ad es. 20) sono più rapidi, ma possono lasciare l'output leggermente sfocato o incoerente. Per i video NSFW, 20–30 passaggi offrono solitamente un buon equilibrio. Il generatore del sito gestisce automaticamente il conteggio.
- Prompt #
- Un prompt è il testo con cui indichi al modello cosa generare. Per i video, un buon prompt include solitamente: descrizione del soggetto (aspetto, posa), azione o movimento, ambientazione e illuminazione, angolazione o movimento della videocamera e indicazioni di stile. I modelli Wan rispondono bene a descrizioni esplicite e concrete. Prompt vaghi producono risultati generici; prompt specifici danno risultati controllati. Consulta la Guida ai prompt per consigli specifici per modello.
- Prompt negativo #
- Un prompt negativo è un secondo campo di testo in cui elenchi ciò che non vuoi nell'output, ad esempio "sfocato, filigrana, arti aggiuntivi, volto distorto". Il modello allontana la generazione da questi concetti. I prompt negativi efficaci per i video NSFW includono in genere artefatti comuni. Non tutte le interfacce mostrano questo campo; il generatore Wan del sito lo include nelle impostazioni avanzate.
- Coerenza del soggetto #
- La coerenza del soggetto indica se lo stesso soggetto resta riconoscibile tra fotogrammi, inquadrature o clip generati. Una coerenza debole può causare deriva dell'identità e cambiamenti d'aspetto durante il video. Wan 2.2 ha introdotto un primo miglioramento, poi rafforzato da Wan 2.5 e 2.6. I2V aiuta partendo da un'immagine, mentre R2V e i flussi basati su riferimenti di Wan 2.7 / Wan 3.0 possono guidare la coerenza in risultati più complessi.
- FPS (fotogrammi al secondo) #
- Gli FPS misurano quanti fotogrammi appaiono in un secondo di video. Un valore maggiore rende in genere il movimento più fluido, ma richiede più fotogrammi per la stessa durata. Le vecchie specifiche Wan possono indicare circa ~24 fps, come Wan 2.6 che genera fino a 15 secondi, ossia ~360 fotogrammi per generazione. I più recenti Wan 2.7 e Wan 3.0 sono documentati con output MP4 a 30 fps; un clip Wan 3.0 di 30 secondi a 30 fps contiene circa 900 fotogrammi.
- Risoluzione #
- La risoluzione è la larghezza × altezza di ogni fotogramma, espressa in pixel o livelli come 720p e 1080p. Una risoluzione maggiore cattura più dettagli, ma può richiedere più calcolo, memoria e tempo. Wan 2.2, Wan 2.5 e Wan 2.6 sono comunemente presentati come modelli video nativi 1080p. Wan 2.7 video supporta 720p e 1080p, mentre Wan 3.0 supporta 480p, 720p e 1080p, il livello massimo. La nitidezza percepita dipende anche dalla capacità del modello, dal prompt, dai contenuti sorgente e dalla complessità del movimento.
- Aderenza al prompt #
- L'aderenza al prompt descrive quanto bene un modello Wan segue scena, soggetto, movimento, videocamera, illuminazione e stile richiesti. Un'aderenza forte mantiene l'output vicino alla direzione indicata invece di aggiungere dettagli estranei o ignorare istruzioni importanti. Wan 2.2 ha migliorato il controllo nella prima gamma video; i flussi Wan 2.7 e Wan 3.0 possono anche estendere il prompt e usare riferimenti per guidare meglio il risultato.
- Fluidità del movimento #
- La fluidità descrive se il movimento appare continuo da un fotogramma al successivo. Un movimento debole può sembrare scattoso, rigido o incoerente, soprattutto se il prompt richiede troppe azioni insieme. Gli FPS contano, ma anche chiarezza del prompt, coerenza del soggetto, complessità della scena e versione. Wan 2.5 e 2.6 hanno migliorato la stabilità; Wan 2.7 e 3.0 aggiungono flussi più potenti per movimenti più lunghi e controllati.
- Proporzioni #
- Le proporzioni descrivono il rapporto fra larghezza e altezza di un'immagine o video, ad esempio 16:9 per il formato orizzontale, 9:16 per quello verticale o 1:1 per il quadrato. Influiscono su inquadratura, composizione e posizione del soggetto. Le specifiche di Wan 2.6 usano comunemente 9:16, 16:9 e 1:1; Wan 2.7 e Wan 3.0 supportano anche 4:3 e 3:4. Nei flussi basati sul primo fotogramma o su riferimenti, l'output può seguire la forma del contenuto iniziale invece di una proporzione scelta manualmente.
- Contenuti di riferimento #
- Per contenuti di riferimento si intende qualsiasi materiale di input che guida una generazione Wan oltre il solo testo. A seconda del modello e del flusso, può includere immagini, video, audio, file o link Web. Aiuta il modello a comprendere identità, direzione della scena, stile visivo, movimento o suono più chiaramente di un prompt da solo. I2V parte solitamente da un'immagine, mentre R2V e i flussi Wan 3.0 basati su riferimenti accettano più tipi di contenuti per controllare risultati complessi.
Genera un video utilizzando solo un prompt testuale.
Anima un'immagine fissa trasformandola in un clip video.
Genera un video con l'aiuto di una o più immagini di riferimento.
L'architettura IA fondamentale alla base della generazione video Wan.
Quanto il modello segue il prompt rispetto ad aggiungere variazioni proprie.
Numero di passaggi di perfezionamento eseguiti prima di produrre il fotogramma finale.
La descrizione testuale che determina ciò che il modello genera.
Parole che indicano al modello cosa evitare di generare.
Stabilità di un soggetto tra fotogrammi, inquadrature e clip.
Quanti fotogrammi video vengono visualizzati ogni secondo.
Le dimensioni in pixel e il livello di nitidezza dell'output video generato.
Quanto fedelmente l'output segue il prompt scritto.
Quanto il movimento appare naturale e stabile tra i fotogrammi.
La forma del fotogramma generato.
Contenuti di input usati per guidare ciò che il modello genera.
