Wan NSFW
Glosario

Glosario de vídeo IA

Definiciones claras de cada término técnico que encontrarás al usar modelos de vídeo Wan AI. Haz clic en cualquier término o modelo relacionado para profundizar.

T2V (texto a vídeo)
#

Genera un vídeo únicamente a partir de un prompt de texto.

Texto a vídeo (T2V) toma un prompt escrito y sintetiza un clip desde cero, sin requerir una imagen de entrada. Describes una escena, pose, iluminación y movimiento de cámara, y el modelo representa el movimiento directamente a partir de esa descripción. Todos los modelos de vídeo Wan admiten T2V. La calidad mejora considerablemente con prompts detallados y específicos.
I2V (imagen a vídeo)
#

Anima una imagen fija para convertirla en un clip de vídeo.

Imagen a vídeo (I2V) utiliza una imagen de origen como punto de partida visual y genera movimiento a partir de ella. En los modelos de vídeo Wan, la imagen suele actuar como primer fotograma, y los flujos más recientes también pueden controlar el primer y último fotograma para orientar el inicio y el final del clip. Wan 2.2, Wan 2.5, Wan 2.6, Wan 2.7 y Wan 3.0 admiten flujos I2V de distintas formas.
R2V (referencia a vídeo)
#

Genera un vídeo con ayuda de una o varias imágenes de referencia.

Referencia a vídeo (R2V) es un modo de generación en el que un modelo de vídeo Wan utiliza imágenes de referencia como guía visual. La referencia ayuda a definir qué debe seguir siendo reconocible, como el sujeto, el estilo o la composición, mientras el prompt de texto indica el movimiento, la escena, la iluminación y la dirección de cámara que se deben generar. R2V se diferencia de T2V porque no depende solo del texto, y de I2V básico porque suele usarse cuando importa mantener la consistencia entre resultados.
Modelo de difusión
#

La arquitectura de IA central detrás de la generación de vídeo Wan.

Un modelo de difusión genera contenido aprendiendo a invertir un proceso de ruido: parte de ruido aleatorio y lo refina progresivamente hasta convertirlo en una imagen o vídeo coherente, guiado por una condición de texto o imagen. Los modelos Wan AI se basan en arquitecturas de difusión. La calidad y coherencia del resultado dependen en gran medida del número de pasos de eliminación de ruido y de la escala de guía utilizados.
Escala CFG (guía sin clasificador)
#

Hasta qué punto el modelo sigue el prompt frente a introducir su propia variación.

CFG (guía sin clasificador) es un número que controla con qué rigor sigue el modelo tu prompt. Un CFG bajo (p. ej., 3–5) da más libertad creativa y suele producir movimiento más fluido, aunque puede desviarse del prompt. Un CFG alto (p. ej., 10–15) obliga al modelo a ajustarse más a tus palabras, pero puede generar fotogramas sobresaturados o con artefactos. La mayoría de los generadores de este sitio usan un valor predeterminado razonable; ajústalo solo si observas una deriva clara del prompt o colores quemados.
Pasos de eliminación de ruido (pasos de muestreo)
#

Número de pasadas de refinamiento que realiza el modelo antes de producir el fotograma final.

Cada paso de eliminación de ruido refina la salida desde el ruido hacia un resultado coherente. Más pasos (p. ej., 50) suelen producir fotogramas más nítidos y detallados a costa de más tiempo de generación. Menos pasos (p. ej., 20) son más rápidos, pero pueden dejar la salida algo borrosa o inconsistente. Para generar vídeo NSFW, 20–30 pasos suelen ofrecer un buen equilibrio. El generador de este sitio gestiona automáticamente el número de pasos.
Prompt
#

La descripción de texto que determina lo que genera el modelo.

Un prompt es el texto que escribes para indicar al modelo qué generar. En vídeo, un buen prompt suele incluir: descripción del sujeto (aspecto, pose), acción o movimiento, entorno e iluminación, ángulo o movimiento de cámara e indicaciones de estilo. Los modelos Wan responden bien a descripciones explícitas y concretas. Los prompts vagos producen resultados genéricos; los específicos, resultados controlados. Consulta la Guía de prompts para ver consejos por modelo.
Prompt negativo
#

Palabras que indican al modelo qué debe evitar generar.

Un prompt negativo es una segunda entrada de texto donde enumeras lo que no quieres en el resultado, por ejemplo, "borroso, marca de agua, extremidades adicionales, rostro deformado". El modelo aleja la generación de esos conceptos. Los prompts negativos eficaces para vídeo NSFW suelen incluir descripciones de artefactos comunes. No todas las interfaces muestran este campo; el generador Wan de este sitio lo incluye en los ajustes avanzados.
Consistencia del sujeto
#

La estabilidad de un sujeto entre fotogramas, planos y clips.

La consistencia del sujeto indica si el mismo sujeto sigue siendo reconocible entre fotogramas, planos o clips generados. Una consistencia débil puede provocar deriva de identidad, haciendo que el aspecto cambie durante el vídeo. Wan 2.2 fue una mejora temprana en la estabilidad de sujetos, y Wan 2.5 y 2.6 la reforzaron. I2V ayuda al partir de una imagen, mientras que R2V y los flujos basados en referencias de Wan 2.7 / Wan 3.0 pueden usar medios de referencia para guiar la consistencia en resultados más complejos.
FPS (fotogramas por segundo)
#

Cuántos fotogramas de vídeo se representan por segundo.

Los FPS miden cuántos fotogramas aparecen en un segundo de vídeo. Una tasa mayor suele dar un movimiento más fluido, pero también exige generar más fotogramas para la misma duración. Las especificaciones de modelos Wan antiguos pueden indicar una salida cercana a ~24 fps, como Wan 2.6 generando hasta 15 segundos, o unos ~360 fotogramas por generación. Los modelos de vídeo Wan 2.7 y Wan 3.0 más recientes están documentados con salida MP4 a 30 fps; un clip de Wan 3.0 de 30 segundos a 30 fps contiene unos 900 fotogramas.
Resolución
#

El tamaño en píxeles y el nivel de claridad de la salida de vídeo generada.

La resolución es la anchura × altura de cada fotograma, expresada en píxeles o niveles como 720p y 1080p. Una resolución mayor capta detalles más finos, pero puede requerir más cálculo, memoria y tiempo. Wan 2.2, Wan 2.5 y Wan 2.6 suelen presentarse como modelos de vídeo nativos a 1080p. Wan 2.7 vídeo admite 720p y 1080p, mientras Wan 3.0 admite 480p, 720p y 1080p, siendo 1080p el nivel máximo. La nitidez percibida también depende de la capacidad de detalle del modelo, la calidad del prompt, los medios de origen y la complejidad del movimiento.
Fidelidad al prompt
#

Hasta qué punto la salida sigue tu prompt escrito.

La fidelidad al prompt describe lo bien que un modelo Wan sigue la escena, el sujeto, el movimiento, la cámara, la iluminación y el estilo indicados. Una fidelidad alta mantiene el resultado cerca de la dirección solicitada, sin añadir detalles ajenos ni ignorar instrucciones clave. Wan 2.2 mejoró el control del prompt en la primera gama de vídeo, mientras los flujos más recientes de Wan 2.7 y Wan 3.0 también pueden usar ampliación del prompt y medios de referencia para orientar mejor el resultado.
Fluidez del movimiento
#

La naturalidad y estabilidad del movimiento entre fotogramas.

La fluidez del movimiento describe si este se percibe continuo de un fotograma al siguiente. Un movimiento deficiente puede parecer brusco, rígido o inconsistente, especialmente si el prompt pide demasiadas acciones a la vez. Los FPS influyen, pero no son el único factor: también importan la claridad del prompt, la consistencia del sujeto, la complejidad de la escena y la versión. Wan 2.5 y Wan 2.6 mejoraron la estabilidad respecto a modelos anteriores, mientras Wan 2.7 y Wan 3.0 añaden flujos más potentes para movimientos más largos y controlados.
Relación de aspecto
#

La forma del fotograma generado.

La relación de aspecto describe la proporción entre anchura y altura de una imagen o vídeo, como 16:9 para horizontal, 9:16 para vertical o 1:1 para cuadrado. Afecta al encuadre, la composición y la colocación del sujeto. Las especificaciones de Wan 2.6 suelen usar 9:16, 16:9 y 1:1, mientras Wan 2.7 y Wan 3.0 también admiten opciones como 4:3 y 3:4. En flujos de primer fotograma o basados en referencias, la salida puede adoptar la forma del medio de entrada en vez de una relación seleccionada manualmente.
Medios de referencia
#

Medios de entrada usados para guiar lo que genera el modelo.

Los medios de referencia son cualquier material de entrada que guía una generación Wan más allá del texto. Según el modelo y el flujo, pueden incluir imágenes, vídeos, audio, archivos o enlaces web. Ayudan al modelo a comprender mejor la identidad, la dirección de escena, el estilo visual, el movimiento o el sonido que un prompt por sí solo. I2V suele partir de una imagen, mientras R2V y los flujos basados en referencias de Wan 3.0 pueden usar más tipos de medios para controlar resultados complejos.