Video generation: Sora, Runway Gen-4, Kling, Veo
- ⬜🔧 ComfyUI engineering: workflow como código(Diffusion Models & Geração Multimodal)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
De imagem para vídeo: a próxima ordem de magnitude
A geração de vídeo é geração de imagem com uma dimensão extra — e essa dimensão muda tudo. Coerência temporal, continuidade de identidade, plausibilidade física, custo computacional crescendo proporcional ao número de frames. Em janeiro de 2024 a OpenAI apresentou o Sora ao mundo com vídeos de 60 segundos que pareciam impossíveis no ano anterior. A indústria correu atrás.
Este módulo cobre: (1) como esses modelos funcionam por dentro (DiT temporal + VAE temporal); (2) quem está no jogo em 2026 (Sora 2, Veo 3, Kling 2.0, Runway Gen-4, Pika, Luma); (3) onde estão os limites práticos e por quê.
O pipeline: VAE temporal + DiT 3D
Spacetime patches: a sacada que escala
ViT (Dosovitskiy et al. 2020) ensinou que imagem pode ser sequência de patches. DiT (Peebles & Xie 2023) aplicou ao diffusion. Sora estendeu para vídeo: patches em espaço-tempo.
Cubelets típicos: 1×2×2 (alta granularidade temporal, mais tokens) ou 2×4×4 (compressão maior, menos tokens). Trade-off óbvio: mais tokens = mais qualidade temporal fina, custo de memória sobe quadrático na attention.
Attention 3D: o gargalo de compute
Se um latente 3D é T\'×H\'×W\' = 32 × 64 × 64 = 131k tokens, attention puro custa O(N²) = 17 bilhões de ops por camada. Inviável. Por isso modelos modernos usam variantes:
| Estratégia | Como | Trade-off |
|---|---|---|
| Full 3D attention | Todos tokens ↔ todos tokens | Qualidade máxima; custo O(N²) proibitivo |
| Factorized (spatial + temporal) | Alterna self-attn espacial e temporal | Custo linear em uma dim; perde interações cruzadas |
| Window attention | Attention em janelas locais 3D | Eficiente; precisa de shifted windows para conectividade |
| Linear / Flash attention | Reformulação algorítmica O(N) | FlashAttention 3 + tricks; padrão prático |
| Sparse 3D | Esparso baseado em routing aprendido | Pesquisa ativa (Mixture-of-Depths-style) |
Os players em 2026
| Modelo | Empresa | Open weights? | Forças | Limites |
|---|---|---|---|---|
| Sora / Sora 2 | OpenAI | ❌ API only | Coerência temporal extrema, prompts longos | Acesso limitado, custo alto |
| Veo 2 / Veo 3 | Google DeepMind | ❌ API (Vertex/Gemini) | Físca plausível, integração Gemini | Filtros agressivos |
| Kling 2.0 / 2.5 | Kuaishou (China) | ❌ API | Excelente em ação dinâmica, baixa latência | Filtros chineses, geo-restrições |
| Runway Gen-4 | Runway ML | ❌ API + app | Ferramentas de edição integradas (motion brush, camera control) | Qualidade ligeiramente abaixo de Sora 2 |
| Pika 2.x | Pika Labs | ❌ API + app | Bom para social/short-form, fácil de usar | Resolução menor |
| Luma Dream Machine / Ray 2 | Luma Labs | ❌ API + app | Image2video forte, prompts curtos OK | Variação de qualidade |
| Hunyuan Video | Tencent | ✅ Open weights (13B) | Maior open-weights até 2025; qualidade competitiva | Roda em 60GB+ VRAM |
| Mochi 1 | Genmo | ✅ Open weights | Open + bom para fine-tune | Limitado em duração |
| LTX-Video | Lightricks | ✅ Open weights | Real-time generation (segundos por segundo de vídeo) | Qualidade menor que modelos grandes |
| CogVideoX 5B | Zhipu AI / Tsinghua | ✅ Open weights | Bom baseline open, suporta image2video | Resolução/duração limitadas |
| Wan 2.1 / 2.5 (Alibaba) | Alibaba Tongyi | ✅ Open weights | Forte concorrente em 2025-26 | Documentação irregular |
Open-weights sério em vídeo é uma realidade nova (Hunyuan Video, Wan, Mochi). Antes de fim-de-2024 só havia AnimateDiff (motion modules sobre SD). Em 2026 a brecha entre open e closed é ~6 meses, não anos.
Image-to-video vs Text-to-video
Uso prático: gerando 10s de vídeo no Hunyuan Video (open)
# Pseudocódigo — diffusers já tem pipeline para vários modelos
from diffusers import HunyuanVideoPipeline
import torch
pipe = HunyuanVideoPipeline.from_pretrained(
"tencent/HunyuanVideo",
torch_dtype=torch.bfloat16,
).to("cuda")
pipe.enable_model_cpu_offload() # 60GB VRAM → 24GB caber
video = pipe(
prompt="a samurai walking through a bamboo forest at dawn, mist, soft sunlight, cinematic",
height=720, width=1280,
num_frames=129, # ~5.4s @ 24fps
num_inference_steps=30,
guidance_scale=6.0,
generator=torch.Generator(device="cuda").manual_seed(42),
).frames[0]
from diffusers.utils import export_to_video
export_to_video(video, "samurai.mp4", fps=24)Custo computacional real: gerar 5s @ 720p em Hunyuan Video toma ~5-8 minutos em H100 (cerca de $0.50-$1 em on-demand pricing). Em consumer 4090 com offload é ~25-40 minutos. Sora 2 / Veo 3 não publicam tempo de inferência mas inferência por API custa ~$0.50-$2 por clipe de 10s.
Por que a atenção completa sobre todos os elementos de espaço e tempo é inviável em geração de vídeo?
Onde quebra: limites reais em 2026
Timeline da explosão de video gen
Decisão: qual usar para qual caso
📋 Você precisa gerar vídeos curtos para marketing/redes sociais com qualidade máxima
Qualidade visual e coerência são o topo do mercado em 2026. Custo $0.50-$2/clipe é aceitável para marketing onde uma peça boa vale muito mais. Veo 3 ganha se você precisa de áudio nativo.
Alt: Runway Gen-4
Alt: Ótimo para edição mas qualidade ligeiramente abaixo
Alt: Kling 2.5
Alt: Excelente, mas geo-restrições e filtros chineses podem bloquear conteúdo
Alt: Hunyuan Video
Alt: Open weights mas exige H100 self-hosted, ops sem brincadeira
📋 Você quer construir um produto que gera vídeo on-demand para usuários, sem depender de OpenAI
Open weights eliminam vendor lock-in. Hunyuan Video tem qualidade próxima a closed-source. LTX-Video é mais rápido (real-time-ish) com qualidade um pouco menor.
Alt: API closed
Alt: Margem fica com OpenAI/Google; risco de mudanças de pricing
Perguntas que sobram
❓ Sora realmente 'entende física'?
❓ Posso treinar um LoRA de personagem para vídeo?
❓ Como gerar vídeos longos (>30s)?
❓ O custo vai cair?
Recursos
Próximo: como integrar tudo isso via APIs em produção. Replicate, fal.ai, RunPod, Modal — preços, latências, fallbacks, rate limits.
Perguntas frequentes
❓ O que ainda limita geração de vídeo?
❓ Vídeo gerado serve para produção comercial?
❓ Como controlar o resultado?
Fixando
Qual é a diferença prática entre gerar a partir de texto e gerar a partir de uma imagem inicial?
O módulo apresenta como polêmica a afirmação de que esses modelos "entendem física". Qual é a posição crítica?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…