00 · antes de tudo
Como acessar o Seedance 2.5
| Dreamina |
A porta oficial, no navegador:
dreamina.capcut.com.
É onde o modelo foi aberto ao público e onde estão todos os modos. |
| CapCut |
Web, desktop e celular, em liberação por etapas. Mesma casa da Dreamina — se ainda não
apareceu na sua conta, é rollout, não é você. |
| API |
Para quem vai chamar por código: BytePlus e Volcano Engine, o braço enterprise da
ByteDance. O acesso público à API saiu em julho de 2026. |
| Terceiros |
Sites e estúdios que revendem o modelo. Funcionam, mas quase sempre com teto menor de
referências que a Dreamina. |
A própria Dreamina avisa que disponibilidade depende de conta, região e etapa da
liberação. Antes de procurar tutorial de gambiarra, entra e olha o seu workspace.
01 · a lógica
Por que o template é assim
Prompt de vídeo quase nunca falha por falta de adjetivo. Falha porque a gente jogou seis
imagens no modelo e deixou ele adivinhar o que cada uma era. Aí o rosto da referência vira o
rosto do fundo, a música do vídeo de movimento entra sem ninguém pedir, e a pessoa aparece
duas vezes na mesma cena.
Os nove prompts de exemplo do guia — o courier com o produto, o grou, a florista de 30s, a
luminária no Smart Edit, a extensão do museu, a lanterna em first/last, o unboxing por
keyframes, o storyboard 3×3 e o blockout no Clay Renderer — têm a mesma anatomia. Não é
coincidência de estilo, é o formato que o modelo lê melhor.
1 · Cabeçalho técnico
MODE, MATERIALS e SETTINGS abrem o prompt. Separa
decisão de produção de conteúdo criativo logo na primeira linha — quem lê depois (inclusive
você, daqui a duas semanas) entende o que era pra ser aquele vídeo.
2 · Papel de cada referência
Cada @Image, @Video ou @Audio ganha uma função
estreita e uma cláusula de não-herdar. "define apenas o rosto" e
"não herde pessoas, locais ou música". Sem isso o modelo puxa o pacote inteiro da
referência: fundo, enquadramento, trilha, gente que estava passando atrás.
3 · Direção criativa em um parágrafo
Sujeito, evento, estilo e ideia de câmera. Uma frase. É o único lugar do prompt onde cabe
escrever bonito.
4 · Timeline em estágios
Faixas coladas uma na outra — 0-3s, 3-6s — cada uma com um evento
e um estado final visível. Segundo exato só onde a coisa realmente vira: entrada, saída, troca
de mão, corte de luz.
5 · Continuidade e proibições no fim
Contagem exata de sujeitos ("exatamente um grou"), figurino, direção de tela, luz, áudio. E
a lista do que não pode aparecer. Proibir antes é mais barato que corrigir depois — cada
geração nova é tempo e crédito.
02 · o que evita retrabalho
As cinco regras
- Toda referência tem um papel explícito. Nunca deixe o modelo deduzir o
que a imagem significa.
- Quatro partes, nessa ordem: material e papéis, resumo criativo de uma
frase, o que acontece na tela com timeline, e as regras globais com as exclusões.
- Estágio antes de timestamp. Divida a cena em estados consecutivos.
Timestamp demais faz a ação sair apressada — ou não sair.
- Configuração fora da prosa. Duração, proporção e resolução vão na
interface ou na API. Repetir no texto atrapalha.
- Continuidade protegida no fim. Contagem, roupa, posse dos objetos,
direção de tela, luz e áudio, num bloco só.
03 · a primeira decisão
Antes de escrever, escolha o modo
Cada modo espera material diferente, trava configuração diferente e pede uma estrutura de
prompt diferente. Escolher o modo primeiro é o que faz o resto virar preenchimento.
| Base generation | Cena curta nova, de 4 a 30s, a partir de texto ou referências. |
| Omni Reference | Transferir identidade, produto, movimento, câmera, voz, ambiente ou música de uma referência. |
| Smart Edit | Editar um vídeo que já existe: substituir, remover, redesenhar. O vídeo-fonte manda. |
| Long Video | Narrativa direta de 30 a 180 segundos. |
| Extend Video | Somar até 30s antes ou depois de um clipe. |
| First & Last Frames | Caminho controlado entre duas composições — duas imagens. |
| Multi-keyframe | Beats visuais em ordem: keyframes separados ou uma grade de até ~15 painéis. |
| Green-screen | Isolar o sujeito para compor depois. |
| Clay Renderer | Transformar blockout de Maya ou Blender em imagem final. |
04 · a pontuação vira áudio
Som, fala e texto
O Seedance lê quatro sinais de pontuação como instrução de áudio e de tela. É a parte do
guia que menos gente usa e que mais muda o resultado.
| ( ) | Música — (cordas em pizzicato começam) |
| < > | Efeito sonoro — <sino de bicicleta toca uma vez> |
| { } | Fala — {O pedido está pronto.} |
| 【 】 | Legenda na tela — 【Aberto até meia-noite】 |
Para diálogo fora do chinês, diga tudo: idioma, sotaque, entrega, quem fala e a fala
literal. A prioridade oficial do modelo é chinês, inglês, espanhol, indonésio e malaio;
português, japonês e coreano estão cobertos.
E se você não quer trilha nem legenda inventada, proíba no bloco global:
sem legendas, sem música de fundo. O silêncio também se pede.
05 · como fica na prática
Um exemplo do guia
Esse é o prompt do grou, copiado do guia oficial sem tradução — os cabeçalhos e os
marcadores são a linguagem que o modelo espera. Repare que ele não descreve o pássaro com
adjetivo bonito: descreve o que acontece, em três faixas de tempo, e fecha proibindo o
que não pode aparecer.
exemplo · omni reference · 8s
MODE: Omni Reference
MATERIALS: @Image 1 wetland environment · @Image 2 crane identity
SETTINGS: 8 seconds · 16:9 · 720p
[Reference roles]
@Image 1 defines only the autumn reed bed, shallow water, mist, sunrise direction, and golden-green color palette.
@Image 2 defines one adult red-crowned crane: white body feathers, black flight feathers, red crown, long dark legs, and slender proportions.
Do not inherit extra birds, framing, text, or artificial objects from either reference.
[Creative direction]
Create a restrained wildlife-documentary moment at sunrise. Keep the crane near frame center in a low, eye-level-with-the-water medium shot. Use naturalistic contrast, soft atmospheric depth, and a slight handheld response to the bird's movement without losing the subject.
[Timeline]
0-3s: The crane stands still in ankle-deep water, then opens both wings in one slow continuous motion. The wing movement pushes visible rings across the water; the bird remains fully in frame.
3-6s: The same crane makes one light forward hop, touches down with both feet, and sends a small fan of droplets outward. The camera rises only enough to follow the hop.
6-8s: The crane folds its wings, settles into a tall standing pose, turns its head toward screen-right, and gives one clear call. Hold the final pose for the last half-second.
[Audio and continuity]
Use quiet water movement, reeds in a light breeze, one wingbeat sequence, one landing splash, and one crane call. No music, narration, dialogue, captions, or subtitles. Exactly one crane throughout; no duplicated wings, changing plumage, abrupt lens change, cutaway, or new animal.
Duas imagens, dois papéis. Uma é só o brejo, a outra é só o pássaro. A frase
"do not inherit extra birds, framing, text" existe porque, sem ela, o modelo copia
o enquadramento e os outros bichos que estavam nas fotos.
06 · pra copiar e preencher
O template
Troque o que está entre [[ ]] e apague a linha que você não vai
usar. As linhas cinza começadas com # são orientação, não fazem parte do prompt —
o botão copiar limpo já vem sem elas. Duração, proporção e resolução também ficam na
interface; e o prompt é em inglês na Dreamina, mas o miolo você escreve no idioma que quiser.
template base · serve pra qualquer modo
# o mesmo modo que você marcou na interface, e o que anexou, na ordem em que anexou
MODE: [[modo escolhido]]
MATERIALS: [[2 images · 1 video · 1 audio]]
SETTINGS: [[duração]]s · [[16:9 | 9:16 | 1:1]] · [[480p | 720p]]
# uma função por referência, e o que ela não deve trazer junto.
# o "não herde" é o que impede o modelo de copiar fundo, moldura e figurante.
[Papéis]
@Image 1 define apenas [[o que essa imagem controla: cenário, luz e paleta]]. Não herde [[pessoas, enquadramento, texto]].
@Image 2 define apenas [[a identidade: traços fixos de quem ou do que aparece]]. Não herde [[fundo, moldura, outros objetos]].
# uma frase só: que cena é essa, com quem, onde, e de onde a câmera vê.
# aqui cabe escrever bonito. no resto do prompt, não.
[Direção]
Crie [[gênero e clima da cena]] com [[sujeito]] em [[lugar]]. Câmera: [[altura, distância e movimento]].
# uma ação por faixa, e cada faixa termina num estado que dá pra ver na tela.
# segundo exato só na virada: entrada, saída, troca de mão, mudança de luz.
[Timeline]
0-[[X]]s: [[onde o sujeito está e o que ele faz]]. Termina com [[o que fica visível]].
[[X]]-[[Y]]s: mesmo [[sujeito e figurino]]. [[a próxima ação]]. Aos [[N]]s, [[a virada]].
[[Y]]-[[Z]]s: [[a ação final]]. Segure a pose no último meio segundo.
# a pontuação é que manda no áudio. apague a linha que você não vai usar —
# linha vazia aqui é convite pro modelo inventar trilha e legenda.
[Áudio]
{[[a fala, palavra por palavra]]} — em [[idioma]], [[como é dito]], por [[quem fala]]
<[[um efeito pontual, não uma paisagem sonora]]>
([[música ou som ambiente]])
【[[o texto que aparece na tela]]】
# o que não pode mudar do começo ao fim, e o que não pode aparecer nunca.
# conte os sujeitos com número: é o que evita a pessoa duplicada na cena.
[Regras globais]
Exatamente [[quantos sujeitos e objetos]] durante todo o vídeo. Figurino, luz e direção de tela contínuos.
Sem legendas, sem narração, sem música, sem cortes, sem duplicações.
As linhas que só alguns modos pedem
Cole a linha do seu modo logo abaixo do bloco de papéis. Se está em Base generation ou Omni
Reference, não precisa de nenhuma.
peças por modo
# Smart Edit
@Video 1 é o master de ordem de shots, duração, câmera, atuação, luz e diálogo.
Substitua apenas [[objeto, pela aparência e pela posição]] usando @Image 1. Mantenha exatamente [[contagem]].
Preserve posição, escala, sombra de contato e timing originais.
# Extend Video
@Video 1 é o vídeo-fonte; o trecho novo entra [[antes | depois]] dele.
Na emenda, iguale pose, direção da cabeça, mãos, distância, composição, luz, altura de câmera e direção do movimento.
# First and Last Frames
@Image 1 é o primeiro frame: [[composição]]. @Image 2 é o último: [[composição]].
As duas imagens têm a mesma proporção.
# Storyboard
Leia os painéis [[ordem de leitura]]. Não herde grades, linhas, setas, bordas ou rótulos no resultado final.
07 · material de entrada
Os limites, e o limite útil
O teto oficial da Dreamina é 50 referências: até 30 imagens (4K),
10 vídeos e 10 áudios, com 30 segundos totais em cada uma dessas duas últimas famílias.
Imagens em JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC ou HEIF, proporção de 0,4 a 2,5, entre 300 e
6.000px, até 30 MB. Vídeos em MP4 ou MOV, de 480p a 4K, 24 a 60fps, até 200 MB.
O limite útil é bem menor: de uma a oito imagens de sujeitos distintos. Cada referência a
mais é uma chance a mais de o modelo trocar os papéis.
Duas pegadinhas. A saída sai em 480p ou 720p — mandar 4K na entrada não
muda isso. E plataforma de terceiro costuma expor um subconjunto menor do que a Dreamina
(o Seedance2.so, por exemplo, aceita 9 imagens, 3 vídeos e 3 áudios).
08 · casos com regra própria
Editar, estender, emendar
Smart Edit
O vídeo-fonte é o master de tudo que não muda. Nomeie a edição, a referência-alvo, o que
pode ser tocado e o que precisa sobreviver intacto — inclusive a sombra de contato e o timing.
Extend Video
Descreva os dois lados da emenda: pose, luz, composição, direção do movimento. Descrever só
o evento novo é o erro clássico — e a emenda aparece.
First & Last Frames
A primeira imagem define a proporção do vídeo. Use as duas pontas com a mesma proporção,
ou a segunda entra deformada.
Storyboard
No máximo uns 15 painéis, limpos. Declare a ordem de leitura e proíba o que é andaime:
linhas, setas, bordas, rótulos.
09 · antes de apertar o play
Checklist
- Cada
@ tem um papel só, e uma cláusula de não-herança.
- As faixas de tempo são consecutivas, não se sobrepõem e cabem no relógio.
- Segundo exato só em handoff e transição crítica.
- A contagem de sujeitos está declarada.
- Diálogo com idioma, falante e a fala entre
{ }.
- As proibições globais estão escritas: legenda, música, corte.
- Duração, proporção e resolução estão na interface — e não repetidos na prosa.
Na revisão, olhe em passadas separadas: história, identidade, mãos e objetos, câmera,
emendas, áudio, legenda e técnica. Uma passada por vez acha mais coisa do que assistir dez
vezes procurando tudo ao mesmo tempo.