Pular para o conteúdo

Fluxo de trabalho

Como transformar uma imagem em vídeo com IA

Resposta curta: criar um vídeo com IA a partir de uma imagem leva cinco passos. Confirme que sua imagem é o quadro em que o clipe deve abrir, recorte-a e corrija a rotação, envie-a para que o modelo tenha um endereço de onde buscá-la, gaste o prompt em movimento e câmera e acerte a tomada em um rascunho curto antes de pagar por uma tomada longa. Uma imagem estática é a coisa mais barata que se pode levar a um modelo de vídeo, porque a composição já está decidida e toda a renderização vai para o movimento.

Decida se sua imagem é o quadro de abertura

Quando um modelo de vídeo aceita uma imagem, ele a usa como quadro de abertura. A renderização começa exatamente naqueles pixels, então a imagem define o conteúdo e o formato de todos os quadros seguintes. Nenhum modelo de vídeo daqui lê uma imagem como evidência para compor a cena em torno dela; um arquivo que não é o quadro em que o clipe deve começar ainda não está pronto para virar vídeo.

O catálogo mostra a capacidade em cada cartão: filtre por vídeo e leia o rótulo em vez de adivinhar pelo nome. Essa capacidade pertence ao modelo, não à execução; um modelo que exige quadro de abertura recusa uma requisição sem ele, e um que não lê imagens recusa uma requisição que as traz. Manter um personagem consistente explica por que a recusa é justamente o comportamento desejável aqui.

O caminho certo depende de quanto você já decidiu. Se você mesmo gerou e enquadrou a imagem e sabe em que momento o clipe abre, entregue-a como quadro. Se um personagem precisa aparecer, mas a cena ainda não foi composta, monte-a antes em um modelo de edição, escolha o quadro que deu certo e mande esse para o vídeo.

Recorte e confira a rotação antes de enviar

Como a imagem vira o primeiro quadro, o formato dela vira o formato do clipe. Modelos que abrem em uma imagem nem oferecem proporção: o campo nem aparece no formulário (não fica só desativado), e enviar uma proporção pela API volta como erro que cita o campo. Então recorte no seu editor de imagem enquanto o arquivo ainda é imagem. Recortar o clipe pronto significa pagar para renderizar pixels que você vai jogar fora e reenquadrar uma composição pensada para uma caixa mais larga.

Aproveite para conferir a rotação. Fotos de celular carregam uma tag EXIF Orientation, e o navegador a aplica sem avisar: o valor inicial da propriedade CSS image-orientation é from-image, que a MDN descreve dizendo que “the EXIF information contained in the image is used to rotate the image appropriately”. A visualização pode, portanto, aparecer em pé enquanto os pixels armazenados estão deitados. Se um clipe voltar girado, exporte a imagem de novo com a rotação gravada nos próprios pixels.

Tudo o mais que estiver nesse quadro vai junto: uma marca-d’água, uma tarja de letterbox, uma borda, uma dominante de cor que você pretendia corrigir depois. O quadro de abertura não é um rascunho que o modelo arruma de passagem.

Coloque o arquivo em uma URL que o modelo consiga buscar

Os endpoints de geração recebem imagens como endereços, não como bytes, porque quem executa a renderização é o provedor, e ele mesmo as busca. É também por isso que o link de uma das suas gerações não funciona: elas ficam protegidas pelas suas credenciais, e quem renderiza não tem sessão para usar. Faça o envio do arquivo e use o endereço devolvido, que traz um ID impossível de adivinhar e pode ser acessado sem entrar em conta nenhuma.

Você não precisa hospedar nada. Na página de cada modelo, a caixa de referência já faz o envio e preenche o campo com o endereço, e a referência da API documenta o mesmo endpoint para scripts, em que você envia os bytes brutos em vez de um formulário multipart.

As recusas aqui vêm de uma lista curta, e o erro cita o campo. O cabeçalho Content-Type é obrigatório e precisa corresponder ao corpo, porque o servidor lê os magic bytes do arquivo, e renomear uma captura de tela não muda o que ela é. Os formatos aceitos são os comuns: JPEG, PNG, WebP, BMP e GIF. Enviar exige saldo de créditos positivo. Um endereço fornecido por você precisa ser https em um host público, então loopback e faixas privadas são recusados. Quando a execução começa, a imagem precisa ser um JPEG, PNG, GIF ou WebP estático, sem áreas transparentes, e passa por uma verificação antes de qualquer crédito ser debitado: um quadro que a verificação reconheça como mostrando alguém que possa ter menos de 21 anos, ou como trazendo texto que tente influenciar a verificação, é recusado com image_blocked, um erro que não cita campo nem diz qual imagem foi. Chamar a API pelo código cobre o lado da requisição.

Uma tomada só: o prompt é a montagem

Não existe linha do tempo. O modelo renderiza o clipe inteiro de uma vez, e não há ponto no meio da renderização em que você entre, corte um trecho ou mude de ideia sobre a câmera. Como a imagem já respondeu como a cena é, gaste as palavras no que muda: como o sujeito se move, como a câmera se move e onde cada um termina.

Nomeie a câmera sempre. Deixá-la de fora não mantém o quadro parado; entrega a escolha ao modelo, e um deslocamento que você não pediu fica idêntico a um que você pediu. Escrever prompts sem filtro aprofunda a redação.

Reserve uma única ação por clipe, não uma cena. Cutting, DeLong e Brunick, ao analisar 295 longas-metragens em língua inglesa na Cognitive Research: Principles and Implications (2018), relatam que “shots have generally gotten shorter, decreasing more or less linearly from a mean of about 10 s/shot in 1950 to about 4 s/shot in 2010”. Uma tomada de cinema comercial carrega mais ou menos uma ação, e seu clipe é uma tomada, então uma ação escrita para uma cena inteira chega apressada, qualquer que seja a duração que você comprar.

Acerte a tomada em um rascunho curto

Duração e resolução se multiplicam, então a ordem que menos desperdiça é um rascunho curto em resolução modesta até o movimento funcionar e, depois, uma única execução longa na configuração desejada. Escolher resolução e duração detalha essa troca, e a página de cada modelo faz a conta ao vivo a partir do catálogo.

Mantenha a imagem fixa entre as tomadas para que a frase seja a única coisa que mudou. Uma execução que falha no provedor é reembolsada sozinha; uma que deu certo em um formato que você não queria não é, e esse é todo o argumento para recortar antes. Baixe o que decidir manter. Veja manter um personagem consistente quando o segundo clipe precisar combinar com o primeiro, e storyboard e pré-visualização quando forem dez.

Dúvidas frequentes

Como fazer um vídeo com IA a partir de uma imagem?

Escolha um modelo que abre em uma imagem, envie sua imagem e descreva a mudança, não a cena: a ação do sujeito, o trajeto da câmera e onde os dois terminam. A imagem já respondeu como as coisas são e também define o formato do clipe, então recorte antes de enviar. Para pular a leitura e gerar direto, transforme sua imagem em vídeo agora.

Posso definir uma proporção quando o clipe começa na minha imagem?

Não. A imagem é o primeiro quadro, então o formato dela é o formato do clipe. Modelos que abrem em uma imagem não expõem proporção, e enviar uma à API resulta em recusa, e não em um campo ignorado, porque um clipe devolvido em um formato que você não escolheu, sem erro que explique, seria pior. Modelos que trabalham só com descrição aceitam proporção, e em alguns ela é obrigatória.

Por que minha imagem de referência foi recusada?

A maioria dos erros cita o campo, e as causas são poucas: o modelo não lê imagens de referência, ou quer uma quantidade diferente da que você mandou; o endereço não é https ou aponta para um host privado; o cabeçalho Content-Type não corresponde aos bytes do arquivo; o formato não é aceito; ou a conta não tem saldo de créditos para o envio. Uma recusa não cita campo: quando a execução começa, uma imagem que a verificação reconheça como mostrando alguém que possa ter menos de 21 anos, ou como trazendo texto que tente influenciar a verificação, volta como image_blocked, e uma animada ou parcialmente transparente, como image_unreadable.

Como colocar um personagem recorrente em um clipe?

Pelo quadro de abertura. Monte a cena em um modelo de edição com o personagem fornecido como imagem de referência, escolha o quadro que deu certo e passe esse a um modelo de vídeo. Aqui, compor em torno de um personagem é trabalho de imagem, então ele termina antes de o clipe começar.

Guias relacionados

Todos os guias

Veja o catálogo antes de gastar qualquer coisa

Sem assinatura. Adicione créditos e pague só pelo que usar.

Escolher um modelo