Como criar vídeos incríveis de dança K-pop com IA — o tutorial completo do ImagineToVideo
Covers de dança K-pop lotam o TikTok e o YouTube Shorts todos os dias — e, até pouco tempo atrás, fazer um significava aprender a coreografia de verdade, achar um local limpo para gravar e convencer um amigo a segurar a câmera. E se, em vez disso, você pudesse criar sua própria dançarina — uma personagem em estilo 3D com exatamente o visual que você quer — e fazer com que ela executasse uma rotina completa de dança K-pop em cerca de três minutos, por volta de um dólar?
É exatamente isso que este tutorial mostra. No final, você terá o fluxo completo de dois modelos que usamos no ImagineToVideo: ChatGPT (ou GPT Image) para desenhar a personagem e a folha de poses, e depois Seedance 2.0 no ImagineToVideo para dar vida a ela. A técnica é a mesma por trás das folhas de referência de dança K-pop com 16 painéis que vêm circulando no Threads dos criadores coreanos no último mês — essas grades mostram exatamente o que sua personagem deve fazer, quadro a quadro.
Esta é a folha de referência que vamos usar como exemplo ao longo do texto:

E aqui está o resultado final — a mesma personagem, agora dançando de verdade:
<video src="https://cdn.imaginetovideo.com/blog/Korean%20dance%20routine.mp4" controls style="max-width: 480px; width: 100%; display: block; margin: 1.5rem auto;"></video>
Sobre esta série. Esta é a Parte 1 dos Tutoriais de geração de vídeo do ImagineToVideo — uma série prática em que abordamos um caso de uso criativo específico por post, do prompt à renderização final, usando os modelos integrados ao ImagineToVideo. Nos próximos episódios: fotos de produto, animações de retratos de pets, cenas de diálogo cinematográficas com áudio nativo e muito mais.
Por que ChatGPT + Seedance é a combinação certa para vídeos de dança K-pop
O que o ChatGPT e o GPT Image fazem muito bem é consistência de personagem. Dê ao modelo um retrato base e um prompt estruturado, e ele vai renderizar a mesma pessoa em dezesseis poses de dança diferentes sem que o rosto mude. Esse é um problema difícil. Antes de 2024, você resolveria isso com treinamento de LoRA ou pintando à mão no Photoshop. Hoje é uma tacada só.
O que eles não conseguem fazer é animar. A saída é sempre uma grade estática.
O que torna esse fluxo viável em 2026 é a segunda categoria de modelo: referência para vídeo (R2V). Você fornece uma ou mais imagens de referência mais um prompt de movimento, e ele gera um vídeo que respeita a referência. Dois desses estão integrados ao ImagineToVideo:
- Seedance 2.0 — aceita até 9 imagens de referência, gera de 5 a 15 segundos em 720p e custa cerca de US$ 0,85 por um clipe de cinco segundos. É o que recomendamos para vídeos de dança K-pop. É barato o bastante para você iterar até a coreografia ficar boa.
- Kling V3 Omni — aceita até 7 referências, além de áudio nativo e sequenciamento multi-plano, mas custa cerca de US$ 13 por um clipe de cinco segundos. Guarde para a passagem final, quando você quiser música sincronizada com a dança, ou para entregar em 4K de verdade.
O resto deste post segue o caminho do Seedance, com uma seção de upgrade para o Kling perto do fim. Se você quer a versão 4K nativa e cinematográfica deste fluxo, existe um guia separado sobre o Kling 4K Mode.
Passo 1 — Crie sua dançarina no ChatGPT (a folha de 16 painéis)
Abra o ChatGPT (a versão com geração de imagens habilitada, ou use o GPT Image diretamente). Envie um único retrato base da personagem que você quer que dance — uma ilustração limpa em estilo 3D, de frente, funciona melhor. Se você não tiver uma, peça ao ChatGPT para gerar antes: "3D-rendered cartoon portrait of a young woman with curly brown hair, round glasses, white cardigan over a purple dress, teal sneakers, neutral background, Pixar concept-art style."
Depois cole este prompt para a folha de poses de dança:
3D-rendered K-pop dance reference sheet, 4×4 grid layout, 16 panels total.
[CHARACTER] Use the uploaded portrait. Same face, same outfit, same hair across
all sixteen panels — do not redesign the character.
[PANEL STRUCTURE — per cell]
Top-left: bold number badge (1–16) + short pose title in Korean or English
Center: full-body dance pose illustration
Bottom-left: 3–4 line description of the motion
Overlay: directional motion arrows (curved, straight, or rotational)
[CHOREOGRAPHY] Sixteen sequential moves of a K-pop / hip-hop routine: warm-up
pose, rhythm bounce, smooth body wave, footwork start, hip-hop sequence
(panels 5–16), wave moves, popping moves, footwork steps. End on a confident
closing pose.
[STYLE] High-detail 3D-sculpted render, soft studio lighting, subtle shadows,
clean linework, K-pop choreography illustration quality.
[COLOR] Grayscale shading, no color tones.
[NEGATIVE] No background scenery, no extra characters, no color, no logos.
[OUTPUT] At least 1024×1024 final resolution. 2048×2048 if available.
Dois detalhes desse prompt fazem trabalho pesado e não devem ser removidos:
A linha "same face, same outfit". Sem ela, o ChatGPT vai silenciosamente redesenhar o cardigã lá pelo painel 7 porque o prompt menciona "wave move". Diga explicitamente que a personagem é fixa.
A resolução de saída de 1024+. Isso importa no Passo 3. O endpoint R2V do Seedance no ImagineToVideo rejeita imagens de referência menores que 640×640 pixels — ele retorna um erro não recuperável e sua geração nunca começa. A saída padrão de imagem do ChatGPT às vezes fica em torno de 768×768; exigir 1024+ no prompt evita a rejeição.
O que você deve ter agora é uma única grade 4×4 mostrando sua dançarina em dezesseis movimentos sequenciais de uma rotina de K-pop — exatamente como a do início deste post.
Passo 2 — Recorte seus quadros-chave de dança (ou não)
Agora você tem uma única imagem com 16 painéis. Há duas maneiras de entregá-la ao Seedance, e cada uma tem sua utilidade:
Usar a grade inteira como referência única. Melhor quando você quer que a saída capture o estilo da personagem — proporções, paleta de cores, qualidade de renderização — em vez de uma sequência específica de poses. Coloque a grade completa no campo de referência e deixe o modelo decidir quais movimentos enfatizar.
Recortar de um a quatro painéis-chave. Melhor quando você quer uma sequência de dança específica em uma ordem específica. Escolha a pose inicial, a pose final e um ou dois quadros intermediários. Recorte no Photopea, no Figma ou em qualquer editor de navegador (na prática, usamos o Preview do macOS na maior parte do tempo). Cada recorte deve ter no mínimo 640×640 — reexporte em 1024+ para garantir.
Para a rotina de dança deste post, recortamos os painéis 1, 5, 11 e 16 — a pose de aquecimento, a entrada da wave, o meio do hip-hop e o footwork de encerramento. Quatro referências é o ponto ideal nos nossos testes. Com uma referência, o modelo tem liberdade demais; com nove, a saída começa a parecer um flipbook em vez de uma rotina fluida.
Passo 3 — Dê vida a ela no Seedance 2.0
É aqui que a mágica acontece. Abra o gerador Seedance 2.0 (ou a página do Seedance e clique em Try Now).
No painel de referência, envie seus 1 a 4 painéis recortados. A interface mostra miniaturas de cada um conforme são aceitos. Se algum for rejeitado com erro de "pixel count too low", essa referência tem menos de 640×640 — reexporte em resolução maior e envie novamente.
No campo de prompt — que tem limite de 2000 caracteres, mais do que suficiente para a descrição completa de um plano — cole algo estruturado. O padrão que funciona para dança K-pop:
[CHARACTER] {{copy the character description from your ChatGPT sheet}}
[ACTION] A young woman in a white cardigan and purple dress performs a
K-pop / hip-hop dance routine. She starts in a neutral standing pose,
transitions through a smooth body wave, lowers her center of gravity into
hip-hop footwork with crossed legs, and finishes in a confident closing pose.
Smooth, energetic, on-beat motion.
[CAMERA] Static medium shot, eye level, slight handheld micro-movement.
[STYLE] 3D-rendered, cinematic studio lighting, neutral seamless backdrop,
K-pop music video aesthetic.
[DURATION] 5 seconds.
Algumas dicas de ajuste depois de rodar isso dezenas de vezes:
Resolução: fique no 720p. O Seedance oferece 480p e 720p. 480p serve só para a primeira rodada de iteração — nessa escala, o rosto da personagem começa a virar um borrão. 720p é o ponto ideal para conteúdo social curto. Se em algum momento você quiser 4K para um reel de K-pop de destaque, o caminho é acertar a coreografia em 720p no Seedance e depois rodar o prompt já travado no Kling V3 com o toggle de 4K.
Duração: comece com 5 segundos. O Seedance aceita 5, 8, 10, 12 e 15 segundos. Durações maiores custam proporcionalmente mais créditos e dão mais espaço para o modelo desviar. Cinco segundos bastam para validar que a dança está legível; quando estiver, gere de novo com 8 ou 10 segundos usando o mesmo prompt e as mesmas referências para a rotina completa.
Use o Seedance 2.0 Fast para iterar. O ImagineToVideo oferece dois níveis de Seedance: a versão de qualidade e uma versão rápida, 25–40% mais barata e visivelmente mais ágil, com saída praticamente indistinguível em clipes curtos guiados por referência. Fazemos todas as iterações no Fast e só mudamos para o nível de qualidade na renderização final travada que vai para o TikTok ou o YouTube.
Custo total daquele clipe: cerca de US$ 0,85. O Seedance Fast teria reduzido para perto de US$ 0,65. Para comparar, contratar um animador 3D para riggar e animar um ciclo de dança de personagem de cinco segundos começa acima de US$ 400.
→ Crie seu próprio vídeo de dança K-pop com o Seedance 2.0
Passo 4 — Faça upgrade para o Kling V3 Omni quando precisar de música ou 4K
O Seedance é a resposta certa para uns 80% dos projetos de vídeo de dança K-pop. O caso dos 20% em que vale recorrer ao Kling V3 Omni:
- Você precisa de música ou vocais sincronizados com a dança. O Seedance gera vídeo mudo. O Kling V3 Omni gera vídeo e áudio nativo em uma única passagem — incluindo som ambiente, efeitos sonoros e (com o prompt certo) sinais musicais alinhados ao movimento. Se você quer um clipe de K-pop finalizado com a batida já mixada, é Kling.
- Você precisa de uma sequência com vários planos. O Kling V3 Omni suporta até 6 planos de câmera conectados dentro de uma única geração, com identidade de personagem consistente entre os cortes. O Seedance é de plano único. Para um verso de K-pop de 30 segundos com três mudanças de ângulo, você gera tudo de uma vez no Kling em vez de costurar seis saídas do Seedance.
- Você precisa de 4K de verdade. O modo 1080p do Kling mapeia internamente para o modo "pro", que gera 3840×2160 nativo. O Seedance para em 720p. Para broadcast, campanhas de marca ou um vídeo de K-pop de destaque que vai para uma tela maior que um celular, o upgrade compensa.
Comparativo de custo para um clipe de cinco segundos:
| Modelo | Custo ~5s | Melhor para dança K-pop |
|---|---|---|
| Seedance 2.0 Fast ⭐ | ~US$ 0,75 | Iteração, conteúdo social curto, testes descartáveis |
| Seedance 2.0 Quality | ~US$ 0,85 | Renderizações finais travadas para TikTok / Shorts |
| Kling V3 | ~US$ 8,84 | Rotinas com vários planos, entrega em 1080p |
| Kling V3 Omni | ~US$ 13,41 | Múltiplas referências + áudio nativo (clipe de K-pop completo) |
| Kling 4K Mode | ~US$ 25–30 | Broadcast, videoclipes de destaque, cortes para festival |
As linhas em negrito são onde este fluxo vive por padrão. As linhas do Kling são para onde você vai depois que a coreografia estiver travada.
→ Teste o Kling V3 imagem para vídeo (ponto de entrada para o V3 padrão, o V3 Omni e o novo modo 4K)
Como os três modelos se comparam na mesma referência de K-pop
Rodamos exatamente a mesma referência de rotina de dança coreana nos três modelos relevantes do ImagineToVideo. A versão curta:
- Seedance 2.0 Quality manteve melhor a identidade da personagem ao longo dos cinco segundos completos. O rosto continuou sendo o mesmo rosto. A dança ficou legível. É o do vídeo lá em cima.
- Kling V3 Omni produziu uma imagem um pouco mais cinematográfica — melhor iluminação, mais profundidade — mas custou 15× mais por um clipe que, lado a lado, não é 15× melhor para este caso de uso específico. Vale a pena se você precisa das vantagens específicas dele (música sincronizada, vários planos, 4K).
- Kling V3 padrão patinou porque simplesmente não aceita imagens de referência no nível padrão — só entradas de primeiro/último quadro. Para um fluxo de K-pop com várias referências como este, ele está fora de cogitação. Use o V3 Omni.
A conclusão: para o fluxo específico de dança K-pop a partir de uma folha do ChatGPT, o Seedance não é só a opção barata, é a opção certa. O Kling V3 Omni é o upgrade que você aciona quando a entrega exige.
Cinco armadilhas comuns (e como evitá-las)
Depois de rodar esse ciclo umas duzentas vezes para clipes de K-pop e hip-hop, estes são os erros que mais aparecem:
1. Imagem de referência pequena demais. É a rejeição número um. O ImagineToVideo trata o erro de contagem de pixels do R2V do Seedance como não recuperável — seus créditos não são consumidos, mas a geração nunca começa. Solução: reexporte toda referência com no mínimo 1024×1024.
2. Desvio de personagem entre painéis. O ChatGPT vai silenciosamente redesenhar a roupa lá pelo painel 7 se você não travar isso. Sempre inclua "same face, same outfit, same hair, do not redesign" no prompt da folha. Se o desvio persistir, gere o retrato base separadamente primeiro e depois use ele no prompt da folha como referência fixa.
3. Prompt curto demais. Modelos de referência para vídeo leem o prompt como a especificação da coreografia. "Dance" te dá dança genérica. "Hip-hop body wave transitioning into crossed-leg footwork, static medium shot, eye level, neutral backdrop, on-beat" te dá o que você realmente queria. Mire em 100–200 palavras.
4. Tentar acertar de primeira em 4K. Isso desperdiça créditos. Itere em 720p no Seedance até travar a dança e só então faça o upgrade para o Kling 4K Mode na renderização final. Não queime créditos premium validando um prompt que ainda não está pronto.
5. Proporção errada. Se a entrega é 9:16 vertical (TikTok, Reels, Shorts — que é a maior parte do conteúdo de dança K-pop), gere em 9:16 desde o início. O modelo compõe para o quadro; tentar recortar uma geração 16:9 horizontal para vertical no fim quase sempre corta a cabeça ou os pés da dançarina no meio do movimento.
Resumo — seu vídeo de dança K-pop em três passos
- ChatGPT / GPT Image — gere uma folha de referência de dança K-pop com 16 painéis em resolução 1024+, travando explicitamente "same face, same outfit".
- Recorte — escolha de 1 a 4 painéis-chave da dança (início, meios, pose final), cada um com ≥640×640.
- Seedance 2.0 — jogue tudo em /seedance, escreva um prompt de coreografia estruturado de 100–200 palavras e renderize em 720p / 5s. Cerca de US$ 1 e três minutos por clipe.
Faça upgrade para o Kling V3 Omni quando precisar de música sincronizada, rotinas com vários planos ou entrega em 4K de verdade. Fora isso, o Seedance é onde este fluxo de K-pop vive.
→ Comece seu primeiro vídeo de dança K-pop no Seedance 2.0 → Ou vá direto para o Kling V3 imagem para vídeo, com música + 4K
Se a sua entrega final é broadcast ou telão e você quer 3840×2160 nativo desde o início, o guia do Kling 4K Mode percorre esse caminho especificamente — e nossa página do gerador de vídeo 4K com IA é o jeito mais rápido de chegar lá.
O que vem a seguir nesta série
Esta foi a Parte 1 dos Tutoriais de geração de vídeo do ImagineToVideo. Em breve:
- Parte 2 — Animação de retrato de pet: transformando seu cachorro em um curta cinematográfico com uma foto e o Seedance.
- Parte 3 — Fotos de produto: gerando clipes de rotação 3D e detalhes em macro com qualidade de broadcast para e-commerce.
- Parte 4 — Cenas de diálogo cinematográficas com áudio nativo do Kling V3 Omni (lip sync + som de ambiente).
- Parte 5 — Curtas narrativos verticais 9:16: clipes de história prontos para o TikTok, de ponta a ponta, a partir de uma única referência de personagem.
Assine o blog ou volte na próxima semana para o próximo episódio. E, se tiver um caso de uso específico que você quer ver por aqui, fale com a gente.
Agora vá fazer sua dançarina se mexer.



