Wan NSFW
Glossário

Glossário de vídeo IA

Definições simples de todos os termos técnicos que encontrará ao usar modelos de vídeo Wan AI. Clique em qualquer termo ou modelo relacionado para aprofundar.

T2V (texto para vídeo)
#

Gere um vídeo apenas a partir de um prompt de texto.

Texto para vídeo (T2V) recebe um prompt escrito e sintetiza um clip de raiz, sem precisar de uma imagem de entrada. Descreve a cena, a pose, a iluminação e o movimento da câmara, e o modelo cria o movimento diretamente dessa descrição. Todos os modelos de vídeo Wan suportam T2V. Prompts detalhados e específicos melhoram significativamente a qualidade.
I2V (imagem para vídeo)
#

Anime uma imagem estática para criar um clip de vídeo.

Imagem para vídeo (I2V) usa uma imagem de origem como ponto de partida visual e gera movimento a partir dela. Nos modelos de vídeo Wan, a imagem funciona geralmente como primeiro fotograma; fluxos mais recentes também podem controlar o primeiro e o último fotograma para orientar o início e o fim do clip. Wan 2.2, Wan 2.5, Wan 2.6, Wan 2.7 e Wan 3.0 suportam fluxos I2V de formas diferentes.
R2V (referência para vídeo)
#

Gere um vídeo com a ajuda de uma ou mais imagens de referência.

Referência para vídeo (R2V) é um modo em que um modelo de vídeo Wan usa imagens de referência como orientação visual. A referência ajuda a definir o que deve permanecer reconhecível, como o sujeito, estilo ou composição, enquanto o prompt indica o movimento, cena, iluminação e direção da câmara a gerar. R2V difere de T2V porque não depende apenas de texto, e de I2V básico porque é normalmente usado quando importa a consistência entre resultados.
Modelo de difusão
#

A arquitetura de IA central por trás da geração de vídeo Wan.

Um modelo de difusão gera conteúdo aprendendo a inverter um processo de ruído: começa com ruído aleatório e refina-o progressivamente numa imagem ou vídeo coerente, guiado por uma condição de texto ou imagem. Os modelos Wan AI usam arquiteturas de difusão. A qualidade e coerência dependem muito do número de passos de remoção de ruído e da escala de orientação utilizada.
Escala CFG (orientação sem classificador)
#

Até que ponto o modelo segue o prompt em vez de adicionar variação própria.

CFG (orientação sem classificador) é um número que controla o rigor com que o modelo segue o prompt. Um CFG baixo (por exemplo, 3–5) dá mais liberdade criativa e tende a produzir movimento mais fluido, mas pode afastar-se do prompt. Um CFG alto (por exemplo, 10–15) força maior proximidade às palavras, mas pode criar fotogramas demasiado saturados ou com artefactos. A maioria dos geradores deste site usa um valor predefinido sensato; ajuste-o apenas se notar deriva evidente ou cores estouradas.
Passos de remoção de ruído (passos de amostragem)
#

Número de passagens de refinamento antes de o modelo produzir o fotograma final.

Cada passo de remoção de ruído aproxima a saída de um resultado coerente. Mais passos (por exemplo, 50) produzem geralmente fotogramas mais nítidos e detalhados, mas demoram mais. Menos passos (por exemplo, 20) são mais rápidos, mas podem deixar a saída algo desfocada ou inconsistente. Para vídeo NSFW, 20–30 passos são normalmente um bom equilíbrio. O gerador deste site gere-os automaticamente.
Prompt
#

A descrição textual que determina o que o modelo gera.

Um prompt é o texto que escreve para dizer ao modelo o que deve gerar. Para vídeo, um bom prompt inclui normalmente a descrição do sujeito (aspeto, pose), ação ou movimento, cenário e iluminação, ângulo ou movimento da câmara e indicações de estilo. Os modelos Wan respondem bem a descrições explícitas e concretas. Prompts vagos produzem resultados genéricos; prompts específicos permitem controlo. Consulte o Guia de prompts para sugestões por modelo.
Prompt negativo
#

Palavras que indicam ao modelo o que deve evitar gerar.

Um prompt negativo é uma segunda entrada de texto onde enumera o que não pretende na saída, por exemplo «desfocado, marca de água, membros extra, rosto distorcido». O modelo afasta a geração desses conceitos. Prompts negativos eficazes para vídeo NSFW incluem geralmente artefactos comuns. Nem todas as interfaces mostram este campo; o gerador Wan deste site inclui-o nas definições avançadas.
Consistência do sujeito
#

Estabilidade de um sujeito entre fotogramas, planos e clips.

A consistência do sujeito indica se o mesmo sujeito permanece reconhecível entre fotogramas, planos ou clips gerados. Uma consistência fraca pode provocar deriva da identidade, alterando o aspeto ao longo do vídeo. O Wan 2.2 trouxe uma melhoria inicial, reforçada pelo 2.5 e 2.6. I2V ajuda ao partir de uma imagem, enquanto R2V e os fluxos por referência Wan 2.7 / Wan 3.0 podem usar suportes de referência para orientar resultados mais complexos.
FPS (fotogramas por segundo)
#

Quantos fotogramas de vídeo são apresentados por segundo.

FPS mede quantos fotogramas aparecem num segundo de vídeo. Um valor superior costuma tornar o movimento mais fluido, mas também exige mais fotogramas para a mesma duração. Especificações Wan antigas podem indicar cerca de ~24 fps, como o Wan 2.6 a gerar até 15 segundos, ou ~360 fotogramas por geração. Os novos modelos de vídeo Wan 2.7 e Wan 3.0 estão documentados com saída MP4 a 30 fps; um clip Wan 3.0 de 30 segundos a 30 fps contém cerca de 900 fotogramas.
Resolução
#

O tamanho em píxeis e o nível de nitidez da saída de vídeo gerada.

A resolução é a largura × altura de cada fotograma, expressa em píxeis ou níveis como 720p e 1080p. Uma resolução superior capta mais detalhe, mas pode exigir mais processamento, memória e tempo. Wan 2.2, Wan 2.5 e Wan 2.6 são normalmente apresentados como modelos de vídeo 1080p nativos. O Wan 2.7 vídeo suporta 720p e 1080p, enquanto o Wan 3.0 suporta 480p, 720p e 1080p, sendo 1080p o máximo. A nitidez percebida também depende da capacidade do modelo, do prompt, dos suportes de origem e da complexidade do movimento.
Fidelidade ao prompt
#

O grau de proximidade entre a saída e o prompt escrito.

A fidelidade ao prompt descreve como um modelo Wan segue a cena, o sujeito, o movimento, a câmara, a iluminação e o estilo pedidos. Uma fidelidade forte mantém a saída próxima da direção solicitada, sem acrescentar detalhes alheios nem ignorar instruções essenciais. O Wan 2.2 melhorou o controlo na gama inicial; os fluxos Wan 2.7 e Wan 3.0 também podem ampliar o prompt e usar referências para orientar melhor o resultado.
Fluidez do movimento
#

A naturalidade e estabilidade do movimento entre fotogramas.

A fluidez descreve se o movimento parece contínuo de um fotograma para o seguinte. Movimento fraco pode parecer tremido, rígido ou inconsistente, sobretudo quando o prompt pede demasiadas ações. Os FPS influenciam, mas também a clareza do prompt, a consistência do sujeito, a complexidade da cena e a versão. Wan 2.5 e 2.6 melhoraram a estabilidade; Wan 2.7 e 3.0 acrescentam fluxos mais fortes para movimento mais longo e controlado.
Proporção
#

A forma do fotograma gerado.

A proporção descreve a relação entre largura e altura, como 16:9 para horizontal, 9:16 para vertical ou 1:1 para quadrado. Afeta o enquadramento, a composição e a posição do sujeito. As especificações do Wan 2.6 usam normalmente 9:16, 16:9 e 1:1; Wan 2.7 e Wan 3.0 também suportam 4:3 e 3:4. Em fluxos de primeiro fotograma ou por referência, a saída pode seguir a forma do suporte de entrada em vez de uma proporção escolhida manualmente.
Suportes de referência
#

Suportes de entrada usados para orientar o que o modelo gera.

Suportes de referência são quaisquer materiais de entrada que orientam uma geração Wan além do texto. Conforme o modelo e fluxo, podem incluir imagens, vídeos, áudio, ficheiros ou ligações Web. Ajudam o modelo a compreender melhor identidade, direção da cena, estilo visual, movimento ou som. I2V começa geralmente com uma imagem, enquanto R2V e os fluxos por referência Wan 3.0 podem usar suportes mais variados para controlar resultados complexos.