Saltar al contenido

Flujo de trabajo

Mantener un personaje consistente a lo largo de una serie

Entre una generación y la siguiente no se conserva nada por sí solo: cada una se construye desde cero, así que la misma descripción escrita cae en una cara un poco distinta cada vez que presionas Generar. A un personaje lo sostienes entregándolo como imagen en vez de volver a describirlo: bocetas al sujeto una vez, guardas el cuadro que salió bien y lo metes en cada toma que sigue.

Un ancla es una imagen, no un párrafo

Lo que mantiene quieta una identidad es un adjunto, no una frase mejor escrita. Ye et al., en el artículo de IP-Adapter, dan la razón sin vueltas: sacar la imagen que quieres solo con texto es difícil porque "it often involves complex prompt engineering". No hay un adjetivo para una mandíbula concreta, y ninguna cantidad de adjetivos llega a sumar una.

No cualquier imagen sirve de ancla. Un retrato sencillo y con luz pareja suele rendir más que un cuadro dramático, porque trae menos cosas que el modelo pueda copiar sin querer: un contraluz duro o una dominante de color fuerte también son evidencia, y el modelo no tiene cómo saber que solo te importaba la cara. Deja el ancla aburrida y que el prompt se encargue de la puesta en escena.

Una imagen también puede llegar como fotograma y no como evidencia, que es otro trabajo con otras reglas; convertir una imagen en video explica esa diferencia y el recorte que te obliga a hacer.

La capacidad se declara, no se adivina

Cada modelo del catálogo publica lo que hace: texto a imagen, imagen a imagen, texto a video, imagen a video. Ese dato está escrito, no se deduce de si el modelo resulta aceptar imágenes, y por eso la página del modelo, el endpoint del catálogo y el servidor coinciden en la forma que debe tener el cuerpo de la solicitud.

Los modelos que leen referencias declaran su propio mínimo y máximo, y los rechazos van en las dos direcciones. Uno construido alrededor de referencias rechaza la solicitud que llega sin ninguna. Uno que no lee ninguna rechaza la que las trae, en lugar de descartar el adjunto y renderizar igual. Ese segundo rechazo es el que te ahorra dinero: una imagen descartada te deja con un resultado que nunca la usó y sin nada en pantalla que te avise.

Los tamaños válidos también pertenecen al modelo y no se heredan de un pariente con nombre parecido. Los adjuntos pueden tener un recargo, y tanto el botón de generar como elegir resolución y duración te hacen la suma.

Boceta una vez, quédate con el bueno y devuélvelo

Empieza en un modelo que trabaja solo con descripción, donde el personaje todavía está en negociación y pagas por descubrir quién es, no por proteger a nadie. Itera la redacción hasta que un cuadro salga bien; llegar ahí es un oficio aparte, y diseñar un personaje original lo recorre completo. Si el personaje es ilustrado u original, ese primer cuadro bueno se dibuja en el flujo de arte con IA para figuras y personajes; esta guía cuenta qué hacer con él después. Un personaje con estética hentai o anime sigue el mismo hábito del ancla, más la regla que el generador de hentai IA impone a cualquier personaje así: adulto en cada cuadro.

Luego consérvalo, en sentido literal: descarga el archivo, para que un ancla que piensas reutilizar durante meses viva en un lugar que controlas tú.

Devolverlo no consiste en copiar el enlace. Tus generaciones terminadas solo se entregan a quien presenta tus credenciales, y el proveedor que renderiza no puede entrar con tu sesión; por eso el archivo se sube y se adjunta con la dirección que recibes a cambio. Convertir una imagen en video trae el endpoint y los rechazos. En la Consola, el campo de referencias hace esa subida por su cuenta, y una selección de los modelos de edición que aceptan un ancla está reunida en una página con lo que admite cada uno; el catálogo completo tiene el resto.

Desde ahí, cada toma posterior es una solicitud con otra escena: el mismo adjunto, la misma redacción del personaje y solo la puesta en escena reescrita. La referencia de la API muestra el cuerpo, y escribir prompts sin filtro aporta la disciplina de redacción que impide que el resto del cuadro se mueva con ella.

Dónde se desvía la identidad y qué cambiar

La reproducibilidad, aquí, sale del adjunto y no de un número que puedas anotar: en los modelos que ofrecen seed, el cuadro igual se desvía entre generaciones, y la mayoría de los modelos no ofrece ninguna; elegir resolución y duración cuenta ese mecanismo. Dos envíos idénticos son dos sorteos independientes, de modo que una serie sostenida solo por la descripción se desvía por diseño.

Reescribir el prompt entre tomas es la causa más frecuente. Cada descripción con otras palabras reabre la negociación sobre todo lo que no pensabas tocar, incluida la cara. Mueve una cláusula por vez y verás qué se movió con ella.

La segunda es ascender cada resultado nuevo a ancla. Una generación reformula lo que recibe en vez de copiarlo, así que un ancla hecha sobre otra ancla hecha sobre otra más se va alejando de su punto de partida. Arma un conjunto de anclas: el cuadro original se queda en cada solicitud y los cuadros nuevos que salgan bien se suman sin jubilarlo. Que esto cueste no es idea tuya. Avrahami et al., en "The Chosen One: Consistent Characters in Text-to-Image Diffusion Models", arrancan con la observación de que "the users that use these models struggle with the generation of consistent characters".

La tercera causa es un ancla que no muestra la parte que se desvía. Un retrato de tres cuartos no dice nada de una hebilla que solo se ve de espaldas, así que el modelo la inventa de nuevo cada vez. Agrega una vista que la muestre, no una frase que la describa.

Ayuda saber qué no estás haciendo. DreamBooth (Ruiz et al., CVPR 2023) toma "just a few images of a subject" y ajusta el modelo para que asocie un identificador único a ese sujeto ("learns to bind a unique identifier with that specific subject"). Aquí no hay paso de entrenamiento: la identidad se reconstruye a partir de tus imágenes en cada solicitud. Por eso puede resbalar, y por eso mismo puedes cambiar de personaje entre dos tomas sin reentrenar nada.

Llevar al personaje al video

En video el reparto es otro. Cuando un modelo de video parte de una imagen, empieza exactamente en ella, así que el cuadro que armaste es lo que se anima: la composición ya no se discute y el recorte pasa a ser decisión tuya, no del modelo. Nada del lado del video compone una toma alrededor de un personaje por ti, de modo que quién aparece hay que resolverlo mientras el trabajo sigue siendo una imagen.

De ahí sale el orden: construye el ancla en un modelo de imagen, monta como imagen fija el cuadro que quieres, pásala al video y deja idéntica la redacción del personaje para que solo cambie la acción. La página del generador de video IA sin censura repasa las rutas, y storyboard y previsualización se ocupa de una serie de tomas que tiene que leerse como una sola producción.

Preguntas frecuentes

¿Puedo usar una imagen generada como referencia pegando su URL?

No. Tus generaciones terminadas quedan detrás de tu inicio de sesión, y quien renderiza la referencia no puede usar tu cuenta para abrirla. Súbela como archivo nuevo y usa la dirección que te da la subida; en la página de cada modelo, el campo de referencias se encarga de ese paso.

¿Por qué el mismo prompt me da una cara distinta cada vez?

Porque no envías nada que fije el sorteo. Un cuerpo lleva un modelo, un prompt y los ajustes propios de ese modelo; la mayoría no tiene campo de seed, y en los que lo tienen, repetir el número igual puede desviarse, así que dos envíos idénticos dan dos resultados independientes.

¿Conviene reemplazar mi ancla por el resultado más nuevo cada vez?

No. Cada generación reformula lo que recibe en vez de copiarlo, así que las anclas construidas sobre anclas se desvían. Deja el cuadro original en cada solicitud y que los cuadros nuevos que salgan bien se sumen al conjunto en lugar de reemplazarlo.

¿Adjuntar más referencias mejora el resultado?

Más referencias es una pregunta más acotada, no un ajuste de calidad. Cada imagen le quita una decisión al modelo, y eso solo ayuda cuando la decisión que tomaba era justamente la que salía mal.

Guías relacionadas

Todas las guías

Mira el catálogo antes de gastar nada

Sin suscripción. Agrega créditos y paga solo por lo que usas.

Elige un modelo