Técnica
Como escolher resolução e duração sem gastar créditos à toa
Resolução e duração são as configurações que decidem quanto uma execução custa, e, em muitos modelos, cada degrau tem um preço diferente. Daí vem o método: acertar enquadramento e redação no degrau mais barato que o modelo oferece e só subir quando nada na tomada estiver mais em dúvida.
O que de fato mexe no preço
Para uma imagem estática, o custo está preso ao tamanho escolhido. Alguns modelos cobram o mesmo por qualquer tamanho; outros sobem em degraus, e é por isso que um modelo com degraus informa um valor inicial em vez de um valor único. Para um clipe, a resolução define uma taxa por segundo e a duração a multiplica, então um clipe longo em resolução alta não sai só um pouco mais caro que um rascunho curto no pé da escada: é a taxa mais alta paga por cada segundo que você pediu.
A proporção não custa nada: ela muda o formato do quadro, não a conta. Imagens de referência podem custar, porque alguns modelos de edição cobram por cada uma depois da primeira, e a interface já inclui isso no valor mostrado no botão de gerar.
Não faça orçamento a partir de texto corrido, esta página incluída. A página de cada modelo lista os tamanhos ou as resoluções dele com o custo em créditos ao lado de cada um, lidos ao vivo da tabela pela qual o servidor cobra, e a página de preços reúne o catálogo em uma só vista.
A escada de um modelo não vale para outro: degraus, proporções e faixas de duração são todos definidos por modelo.
Resolva a tomada no degrau mais baixo
Tudo o que ainda está em dúvida pertence ao degrau barato: se o sujeito é o que você queria, se a composição se sustenta, se a redação funcionou e, no vídeo, se a ação cabe na duração pedida.
O degrau barato, porém, não é uma amostra do caro. No artigo do SDXL, Podell e colegas condicionam o modelo ao tamanho original das imagens de treino e relatam que “the image quality clearly increases when conditioning on larger image sizes”, uma propriedade documentada desse esquema de condicionamento, e não uma afirmação sobre algum modelo daqui. Use um rascunho em baixa resolução para julgar encenação, enquadramento e se o prompt fez o que você escreveu. Não o use para julgar pele, mãos, rostos distantes ou texto pequeno, porque é exatamente aí que a baixa resolução engana. No vídeo, a duração é a segunda alavanca, e um rascunho curto responde “é esta a tomada?” por uma fração do preço de uma execução completa; converter imagem em vídeo cobre o resto dessa etapa.
Repetir é um novo sorteio, não uma nova renderização
Mesmo onde há seed, o mesmo número não garante o mesmo quadro, e os modelos que não declaram nenhuma não dão nada para fixar; por isso, repetir o mesmo prompt em um degrau mais alto não amplia o que você viu, e sim recomeça do zero. A documentação de reprodutibilidade do Hugging Face Diffusers abre com o caso geral: “Diffusion is a random process that generates a different output every time.” E, mesmo onde há seed, a mesma página avisa que você “can try to limit randomness, but it is not guaranteed even with an identical seed”.
Então leia o rascunho esperando que a execução cara volte diferente, e não apenas maior, e pergunte o que precisa sobreviver à viagem. A redação sobrevive, porque você a envia de novo. A composição, na maior parte das vezes. Um rosto, uma jaqueta ou um cômodo específicos não sobrevivem só pela redação, e, se foi disso que você gostou, o próprio rascunho precisa seguir adiante como entrada, que é para isso que existem os modelos de edição. Manter um personagem consistente trata desse assunto de ponta a ponta.
Pare de editar o prompt antes de subir. Suba o degrau e reescreva na mesma execução, e um resultado decepcionante não vai dizer qual das mudanças o causou. Acerte as palavras primeiro, com prompts escritos sem filtro, e só então mexa na configuração.
Duração e formato pertencem ao modelo
A duração é uma faixa com piso e teto próprios do modelo, e uma requisição fora dela é recusada com a faixa citada no erro, em vez de ser cortada para caber. Um clipe encurtado em silêncio para o que o modelo aceita, e cobrado, parece exatamente o clipe que você pediu até o momento em que você o assiste.
A proporção funciona do mesmo jeito nos dois sentidos. Um modelo que oferece proporções as aceita de uma lista fechada, e um modelo que não oferece nenhuma recusa uma requisição que traz uma, em vez de descartá-la, porque uma proporção ignorada em silêncio significa pagar por um formato que você não escolheu.
Essa restrição vem do treinamento, não de uma política. O artigo do SDXL justifica seus buckets de proporção observando que “real-world datasets include images of widely varying sizes and aspect-ratios”, e um modelo é mais previsível dentro dos formatos em que foi treinado. Então escolha no catálogo um modelo que já produz o formato de que você precisa, em vez de planejar chegar a ele recortando depois.
Quando uma requisição é recusada e quando é cobrada
Uma requisição rejeitada não custa nada, porque a validação acontece antes de os créditos serem debitados. Um tamanho desconhecido, uma duração fora da faixa, uma proporção em um modelo que não oferece nenhuma, uma referência faltando ou sobrando: cada caso volta como erro que cita o parâmetro, com seu saldo intacto. Os créditos saem quando a execução começa, e, se ela falhar depois, o reembolso é automático; chamar a API pelo código traz os códigos de status e as regras de acerto.
Baixe a execução que decidiu manter. Se você conduz isso por um script, tire tamanhos, resoluções, proporções e faixas de duração do catálogo em vez de uma constante no seu código, para que uma mudança do nosso lado chegue como valor novo e não como recusa. Para uma grade inteira de variações em vez de uma escada, veja arte conceitual.
Dúvidas frequentes
Um clipe mais longo custa proporcionalmente mais?
Sim. A resolução define uma taxa por segundo e a duração a multiplica, então os dois fatores se acumulam. A proporção não afeta o total; imagens de referência podem afetar, nos modelos que cobram pelas imagens além da primeira. A página do próprio modelo traz os valores, vindos da mesma fonte pela qual o servidor cobra.
Posso travar um resultado barato e renderizá-lo de novo em resolução maior?
Não como a mesma imagem. Mesmo onde há seed, o mesmo número não garante o mesmo quadro, então a execução mais alta é um sorteio novo e pode mudar de formas que você não pediu. Se um sujeito ou um quadro específico precisa passar adiante, entregue o resultado barato como imagem de referência a um modelo de edição.
O que acontece se eu pedir um clipe mais longo, ou uma proporção que o modelo não oferece?
A requisição é recusada e o erro diz o que aquele modelo aceita. Nada é cobrado e nada é ajustado para caber. Cortar o clipe em silêncio, ou descartar a proporção, entregaria algo diferente do que você pagou.
