Saltar al contenido

Flujo de trabajo

Imagen a video: cómo convertir una foto que ya tienes en un clip

Respuesta corta: convertir una imagen en video con IA lleva cinco pasos. Confirma que tu imagen es el fotograma con el que debe abrir el clip, recórtala y corrige su rotación, súbela para que el modelo tenga una dirección de donde tomarla, gasta el prompt en movimiento y cámara, y cierra la toma con un borrador corto antes de pagar una toma larga. Una imagen fija es lo más barato que le puedes llevar a un modelo de video: la composición ya está decidida y todo el render se va en movimiento.

Decide si tu imagen es el fotograma inicial

Un modelo de video que recibe una imagen la trata como fotograma inicial. El render arranca en esos píxeles exactos, así que la imagen determina el contenido y la forma de cada fotograma posterior. Ningún modelo de video de aquí lee una imagen como evidencia para componer la toma a su alrededor, de modo que un archivo que no es el cuadro con el que quieres abrir el clip todavía no está listo para video.

El catálogo imprime la capacidad en cada tarjeta: filtra por video y lee la etiqueta en vez de adivinar por el nombre. Esa capacidad es del modelo y no de la generación, así que uno que pide fotograma inicial rechaza la solicitud que no lo trae, y uno que no lee imágenes rechaza la que sí las trae; mantener un personaje consistente explica por qué ese rechazo es justo lo que te conviene.

La ruta que necesitas depende de cuánto tienes decidido. Si generaste y encuadraste la imagen tú y sabes en qué momento abre el clip, entrégala como fotograma. Si tiene que aparecer un personaje pero la toma todavía no está compuesta, móntala antes en un modelo de edición, quédate con el cuadro que funciona y manda ese al video.

Recorta y revisa la rotación antes de subir

Como la imagen pasa a ser el primer fotograma, su forma termina siendo la forma del clip. Los modelos que arrancan en una imagen no ofrecen relación de aspecto: el campo no está deshabilitado en el formulario, directamente no aparece, y si mandas una por la API vuelve un error que la nombra. Así que recorta en tu editor de imágenes mientras el archivo todavía es una imagen. Recortar el clip terminado es pagar por renderizar píxeles que vas a tirar y reencuadrar una composición pensada para un marco más ancho.

Ya que estás ahí, revisa la rotación. Las fotos que salen de un teléfono traen una etiqueta EXIF Orientation y tu navegador la aplica sin decir nada: el valor inicial de la propiedad CSS image-orientation es from-image, que MDN describe diciendo que "the EXIF information contained in the image is used to rotate the image appropriately". Así, la vista previa puede verse derecha mientras los píxeles guardados están acostados. Si un clip vuelve girado, exporta otra vez la imagen con la rotación incorporada a los píxeles.

Todo lo demás que va en ese cuadro viaja con él: una marca de agua, unas franjas negras, un borde, una dominante de color que pensabas corregir después. El fotograma inicial no es un borrador que el modelo limpia de paso.

Deja el archivo en una URL que el modelo pueda descargar

Los endpoints de generación reciben las imágenes como direcciones y no como bytes, porque el proveedor que hace el render las descarga por su cuenta. Por eso tampoco funciona el enlace a una de tus propias generaciones: esas se sirven detrás de tus credenciales y el renderizador no tiene sesión que usar. Sube el archivo y adjunta la dirección que te devuelven, que lleva un ID imposible de adivinar y se abre sin iniciar sesión.

No hace falta que alojes nada. El campo de referencias de la página de un modelo sube el archivo y escribe la dirección por ti, y la referencia de la API documenta el mismo endpoint para scripts, donde mandas los bytes crudos en lugar de un formulario multipart.

Los rechazos en este paso salen de una lista corta, y el error nombra el campo. El encabezado Content-Type es obligatorio y tiene que coincidir con el cuerpo, porque el servidor lee los bytes mágicos del archivo y renombrar una captura de pantalla no cambia lo que es. Los formatos aceptados son los habituales: JPEG, PNG, WebP, BMP y GIF. Para subir necesitas un saldo de créditos positivo. Una dirección que pongas tú tiene que ser https en un host público, así que loopback y los rangos privados quedan fuera. Cuando arranca la generación, la imagen tiene que ser un JPEG, PNG, GIF o WebP fijo y sin zonas transparentes, y se revisa antes de descontar créditos: un cuadro en el que la verificación reconoce a alguien que podría tener menos de 21 años, o que trae texto dirigido a la verificación, se rechaza con image_blocked, un error que no nombra ningún campo ni dice qué imagen fue. Llamar la API desde tu código cubre el lado de la solicitud.

Una sola toma, así que el prompt es el montaje

No hay línea de tiempo. El modelo renderiza el clip completo de una pasada, y no existe un punto a mitad del render en el que entres, cortes un momento o cambies de idea sobre la cámara. La imagen ya respondió cómo se ve la escena, así que gasta las palabras en lo que cambia: cómo se mueve el sujeto, cómo se mueve la cámara y dónde termina cada uno.

Nombra la cámara siempre. Dejarla fuera no mantiene quieto el cuadro: le cede la decisión al modelo, y un desplazamiento que no pediste se ve exactamente igual que uno que sí. Escribir prompts sin filtro va más a fondo con la redacción.

Presupuesta un solo momento, no una escena. Cutting, DeLong y Brunick, que analizaron 295 largometrajes en inglés en Cognitive Research: Principles and Implications (2018), reportan que "shots have generally gotten shorter, decreasing more or less linearly from a mean of about 10 s/shot in 1950 to about 4 s/shot in 2010". Una toma de cine comercial lleva más o menos una acción, y tu clip es una toma, así que una acción escrita para toda una escena llega atropellada, compres la duración que compres.

Cierra la toma con un borrador corto

Duración y resolución se multiplican, así que el orden que menos desperdicia es un borrador corto a resolución modesta hasta que el movimiento se entienda, y después una sola generación larga con el ajuste que quieres. Elegir resolución y duración desarrolla esa compensación completa, y cada página de modelo hace la cuenta en vivo a partir del catálogo.

Mantén la imagen igual entre tomas para que la frase sea lo único que se movió. Una generación que falla en el proveedor se reembolsa sola; una que salió bien pero con una forma que no querías no se reembolsa, y ese es todo el argumento para recortar primero. Descarga lo que decidas conservar. Consulta mantener un personaje consistente cuando el segundo clip tenga que coincidir con el primero, y storyboard y previsualización cuando sean diez.

Preguntas frecuentes

¿Cómo convierto una imagen en video con IA?

Elige un modelo que arranque en una imagen, dale la tuya mediante una subida y describe el cambio, no la escena: la acción del sujeto, el recorrido de la cámara y dónde terminan los dos. La imagen ya dejó resuelto cómo se ven las cosas y además determina la forma del clip, así que recorta antes de subir. Si prefieres saltarte la lectura y generar de una vez, convierte tu imagen en video ahora.

¿Puedo elegir la relación de aspecto si el clip parte de mi imagen?

No. La imagen es el primer fotograma, así que su forma es la del clip. Los modelos que arrancan en una imagen no exponen proporción, y mandar una a la API se rechaza en vez de ignorarse, porque recibir un clip con una forma que no elegiste, sin ningún error que lo explique, sería peor. Los modelos que trabajan solo con una descripción sí aceptan proporción, y en algunos es obligatoria.

¿Por qué rechazaron mi imagen de referencia?

Casi todos los errores nombran el campo, y las causas son pocas: el modelo no lee imágenes de referencia o pide otra cantidad de la que enviaste; la dirección no es https o apunta a un host privado; el encabezado Content-Type no coincide con los bytes del archivo; el formato no está entre los aceptados; o la cuenta no tiene saldo de créditos para subir. Un rechazo no nombra campo: al arrancar la generación, una imagen en la que la verificación reconoce a alguien que podría tener menos de 21 años, o que trae texto dirigido a la verificación, vuelve como image_blocked, y una animada o con partes transparentes, como image_unreadable.

¿Cómo meto un personaje recurrente en un clip?

Por el fotograma inicial. Monta la toma en un modelo de edición con el personaje entregado como imagen de referencia, quédate con el cuadro que funciona y pásale ese a un modelo de video. Aquí componer alrededor de un personaje es trabajo de imagen, así que queda terminado antes de que empiece el clip.

Guías relacionadas

Todas las guías

Mira el catálogo antes de gastar nada

Sin suscripción. Agrega créditos y paga solo por lo que usas.

Elige un modelo