Glossário de vídeo IA
Definições simples de todos os termos técnicos que encontrará ao usar modelos de vídeo Wan AI. Clique em qualquer termo ou modelo relacionado para aprofundar.
- T2V (texto para vídeo) #
- Texto para vídeo (T2V) recebe um prompt escrito e sintetiza um clip de raiz, sem precisar de uma imagem de entrada. Descreve a cena, a pose, a iluminação e o movimento da câmara, e o modelo cria o movimento diretamente dessa descrição. Todos os modelos de vídeo Wan suportam T2V. Prompts detalhados e específicos melhoram significativamente a qualidade.
- I2V (imagem para vídeo) #
- Imagem para vídeo (I2V) usa uma imagem de origem como ponto de partida visual e gera movimento a partir dela. Nos modelos de vídeo Wan, a imagem funciona geralmente como primeiro fotograma; fluxos mais recentes também podem controlar o primeiro e o último fotograma para orientar o início e o fim do clip. Wan 2.2, Wan 2.5, Wan 2.6, Wan 2.7 e Wan 3.0 suportam fluxos I2V de formas diferentes.
- R2V (referência para vídeo) #
- Referência para vídeo (R2V) é um modo em que um modelo de vídeo Wan usa imagens de referência como orientação visual. A referência ajuda a definir o que deve permanecer reconhecível, como o sujeito, estilo ou composição, enquanto o prompt indica o movimento, cena, iluminação e direção da câmara a gerar. R2V difere de T2V porque não depende apenas de texto, e de I2V básico porque é normalmente usado quando importa a consistência entre resultados.
- Modelo de difusão #
- Um modelo de difusão gera conteúdo aprendendo a inverter um processo de ruído: começa com ruído aleatório e refina-o progressivamente numa imagem ou vídeo coerente, guiado por uma condição de texto ou imagem. Os modelos Wan AI usam arquiteturas de difusão. A qualidade e coerência dependem muito do número de passos de remoção de ruído e da escala de orientação utilizada.
- Escala CFG (orientação sem classificador) #
- CFG (orientação sem classificador) é um número que controla o rigor com que o modelo segue o prompt. Um CFG baixo (por exemplo, 3–5) dá mais liberdade criativa e tende a produzir movimento mais fluido, mas pode afastar-se do prompt. Um CFG alto (por exemplo, 10–15) força maior proximidade às palavras, mas pode criar fotogramas demasiado saturados ou com artefactos. A maioria dos geradores deste site usa um valor predefinido sensato; ajuste-o apenas se notar deriva evidente ou cores estouradas.
- Passos de remoção de ruído (passos de amostragem) #
- Cada passo de remoção de ruído aproxima a saída de um resultado coerente. Mais passos (por exemplo, 50) produzem geralmente fotogramas mais nítidos e detalhados, mas demoram mais. Menos passos (por exemplo, 20) são mais rápidos, mas podem deixar a saída algo desfocada ou inconsistente. Para vídeo NSFW, 20–30 passos são normalmente um bom equilíbrio. O gerador deste site gere-os automaticamente.
- Prompt #
- Um prompt é o texto que escreve para dizer ao modelo o que deve gerar. Para vídeo, um bom prompt inclui normalmente a descrição do sujeito (aspeto, pose), ação ou movimento, cenário e iluminação, ângulo ou movimento da câmara e indicações de estilo. Os modelos Wan respondem bem a descrições explícitas e concretas. Prompts vagos produzem resultados genéricos; prompts específicos permitem controlo. Consulte o Guia de prompts para sugestões por modelo.
- Prompt negativo #
- Um prompt negativo é uma segunda entrada de texto onde enumera o que não pretende na saída, por exemplo «desfocado, marca de água, membros extra, rosto distorcido». O modelo afasta a geração desses conceitos. Prompts negativos eficazes para vídeo NSFW incluem geralmente artefactos comuns. Nem todas as interfaces mostram este campo; o gerador Wan deste site inclui-o nas definições avançadas.
- Consistência do sujeito #
- A consistência do sujeito indica se o mesmo sujeito permanece reconhecível entre fotogramas, planos ou clips gerados. Uma consistência fraca pode provocar deriva da identidade, alterando o aspeto ao longo do vídeo. O Wan 2.2 trouxe uma melhoria inicial, reforçada pelo 2.5 e 2.6. I2V ajuda ao partir de uma imagem, enquanto R2V e os fluxos por referência Wan 2.7 / Wan 3.0 podem usar suportes de referência para orientar resultados mais complexos.
- FPS (fotogramas por segundo) #
- FPS mede quantos fotogramas aparecem num segundo de vídeo. Um valor superior costuma tornar o movimento mais fluido, mas também exige mais fotogramas para a mesma duração. Especificações Wan antigas podem indicar cerca de ~24 fps, como o Wan 2.6 a gerar até 15 segundos, ou ~360 fotogramas por geração. Os novos modelos de vídeo Wan 2.7 e Wan 3.0 estão documentados com saída MP4 a 30 fps; um clip Wan 3.0 de 30 segundos a 30 fps contém cerca de 900 fotogramas.
- Resolução #
- A resolução é a largura × altura de cada fotograma, expressa em píxeis ou níveis como 720p e 1080p. Uma resolução superior capta mais detalhe, mas pode exigir mais processamento, memória e tempo. Wan 2.2, Wan 2.5 e Wan 2.6 são normalmente apresentados como modelos de vídeo 1080p nativos. O Wan 2.7 vídeo suporta 720p e 1080p, enquanto o Wan 3.0 suporta 480p, 720p e 1080p, sendo 1080p o máximo. A nitidez percebida também depende da capacidade do modelo, do prompt, dos suportes de origem e da complexidade do movimento.
- Fidelidade ao prompt #
- A fidelidade ao prompt descreve como um modelo Wan segue a cena, o sujeito, o movimento, a câmara, a iluminação e o estilo pedidos. Uma fidelidade forte mantém a saída próxima da direção solicitada, sem acrescentar detalhes alheios nem ignorar instruções essenciais. O Wan 2.2 melhorou o controlo na gama inicial; os fluxos Wan 2.7 e Wan 3.0 também podem ampliar o prompt e usar referências para orientar melhor o resultado.
- Fluidez do movimento #
- A fluidez descreve se o movimento parece contínuo de um fotograma para o seguinte. Movimento fraco pode parecer tremido, rígido ou inconsistente, sobretudo quando o prompt pede demasiadas ações. Os FPS influenciam, mas também a clareza do prompt, a consistência do sujeito, a complexidade da cena e a versão. Wan 2.5 e 2.6 melhoraram a estabilidade; Wan 2.7 e 3.0 acrescentam fluxos mais fortes para movimento mais longo e controlado.
- Proporção #
- A proporção descreve a relação entre largura e altura, como 16:9 para horizontal, 9:16 para vertical ou 1:1 para quadrado. Afeta o enquadramento, a composição e a posição do sujeito. As especificações do Wan 2.6 usam normalmente 9:16, 16:9 e 1:1; Wan 2.7 e Wan 3.0 também suportam 4:3 e 3:4. Em fluxos de primeiro fotograma ou por referência, a saída pode seguir a forma do suporte de entrada em vez de uma proporção escolhida manualmente.
- Suportes de referência #
- Suportes de referência são quaisquer materiais de entrada que orientam uma geração Wan além do texto. Conforme o modelo e fluxo, podem incluir imagens, vídeos, áudio, ficheiros ou ligações Web. Ajudam o modelo a compreender melhor identidade, direção da cena, estilo visual, movimento ou som. I2V começa geralmente com uma imagem, enquanto R2V e os fluxos por referência Wan 3.0 podem usar suportes mais variados para controlar resultados complexos.
Gere um vídeo apenas a partir de um prompt de texto.
Anime uma imagem estática para criar um clip de vídeo.
Gere um vídeo com a ajuda de uma ou mais imagens de referência.
A arquitetura de IA central por trás da geração de vídeo Wan.
Até que ponto o modelo segue o prompt em vez de adicionar variação própria.
Número de passagens de refinamento antes de o modelo produzir o fotograma final.
A descrição textual que determina o que o modelo gera.
Palavras que indicam ao modelo o que deve evitar gerar.
Estabilidade de um sujeito entre fotogramas, planos e clips.
Quantos fotogramas de vídeo são apresentados por segundo.
O tamanho em píxeis e o nível de nitidez da saída de vídeo gerada.
O grau de proximidade entre a saída e o prompt escrito.
A naturalidade e estabilidade do movimento entre fotogramas.
A forma do fotograma gerado.
Suportes de entrada usados para orientar o que o modelo gera.
