Saltar al contenido

Técnica

Elegir resolución y duración antes de gastar la generación

Resolución y duración son los dos ajustes que fijan el precio de una generación, y en muchos modelos no cuestan lo mismo en cada escalón. El patrón que conviene seguir es resolver encuadre y redacción en el escalón más barato que ofrezca el modelo, y subir solo cuando de la toma ya no queda nada en duda.

Qué mueve de verdad el precio

En una imagen, lo que pagas depende del tamaño elegido. Hay modelos con un solo precio para todos sus tamaños y otros que suben por escalones; por eso uno escalonado muestra un precio inicial en vez de una cifra única. En un clip, cada resolución tiene su propio precio por segundo y los segundos lo multiplican, así que un clip largo en alta resolución no sale apenas más caro que un borrador corto en el peldaño más bajo: es el precio alto pagado en cada segundo que pediste.

La relación de aspecto no cuesta nada: cambia la forma del cuadro, no la cuenta. Las imágenes de referencia sí pueden sumar, porque algunos modelos de edición cobran cada una a partir de la segunda, y la Consola lo incluye en la cifra del botón de generar.

No armes el presupuesto a partir de un texto, y eso incluye esta página. Cada página de modelo lista sus propios tamaños o resoluciones con el costo en créditos al lado, leído en vivo de la tabla con la que cobra el servidor, y la página de precios reúne el catálogo en una sola vista.

La escalera de un modelo no se traslada a otro: escalones, proporciones y rangos de duración van todos por modelo.

Resuelve la toma en el peldaño más bajo

Todo lo que siga en duda va en el escalón barato: si el sujeto es el que querías, si la composición se sostiene, si tu redacción dio en el blanco y, en video, si la acción entra en la duración que pediste.

Lo que el escalón barato no es: un adelanto del caro. En el artículo de SDXL, Podell y sus colegas condicionan el modelo con el tamaño original de sus imágenes de entrenamiento y reportan que "the image quality clearly increases when conditioning on larger image sizes", una propiedad documentada de ese esquema de condicionamiento, no una afirmación sobre algún modelo de aquí. Lee un borrador bajo para evaluar la puesta en escena, el encuadre y si el prompt hizo lo que escribiste. No lo leas para piel, manos, caras lejanas o texto pequeño, porque ahí es justamente donde te engaña. En video, la duración es la segunda palanca, y un borrador corto responde "¿es esta la toma?" por una fracción del precio de una pasada completa; convertir una imagen en video cubre el resto de ese recorrido.

Repetir es tirar de nuevo, no volver a renderizar

Incluso donde hay seed, el mismo número no garantiza el mismo cuadro, y los modelos que no declaran ninguna no te dejan nada que fijar; por eso, repetir el mismo prompt en un escalón más alto no agranda lo que viste: vuelve a empezar. La documentación de Hugging Face Diffusers sobre reproducibilidad abre con el caso general: "Diffusion is a random process that generates a different output every time." Y para cuando sí hay seed, la misma página advierte que el azar se puede acotar, pero sin garantías: "can try to limit randomness, but it is not guaranteed even with an identical seed".

Así que lee el borrador esperando que la generación cara vuelva distinta, no solo más grande, y pregúntate qué tiene que sobrevivir al viaje. La redacción sobrevive, porque la envías otra vez. La composición, casi siempre. Una cara, una chaqueta o una habitación concretas no sobreviven solo con palabras, y si eso es lo que te gustó, el propio borrador tiene que seguir adelante como entrada, que es para lo que están los modelos de edición. Mantener un personaje consistente trata ese tema completo.

Deja de editar el prompt antes de subir. Si en la misma generación subes el escalón y reescribes, un resultado decepcionante no puede decirte cuál de los dos cambios lo provocó. Primero asienta las palabras, con prompts escritos sin filtro, y después mueve el ajuste.

La duración y la forma son del modelo

La duración es un rango con un mínimo y un máximo propios del modelo, y una solicitud fuera de él se rechaza con el rango indicado en el error, en vez de recortarse para que entre. Un clip acortado sin aviso a lo que acepta el modelo, y cobrado, se ve idéntico al que pediste hasta que lo reproduces.

La proporción funciona igual en ambos sentidos. Un modelo que ofrece proporciones las toma de una lista cerrada, y uno que no ofrece ninguna rechaza la solicitud que trae una en lugar de descartarla, porque una proporción ignorada en silencio significa pagar por una forma que no elegiste.

Esa restricción viene del entrenamiento y no de una política. El artículo de SDXL justifica sus grupos por relación de aspecto observando que "real-world datasets include images of widely varying sizes and aspect-ratios", y un modelo es más predecible dentro de las formas con las que se entrenó. Así que elige en el catálogo un modelo que ya produzca la forma que necesitas, en vez de planear llegar a ella recortando después.

Cuándo se rechaza una solicitud y cuándo se cobra

Una solicitud rechazada no cuesta nada, porque la validación corre antes de tomar créditos. Un tamaño desconocido, una duración fuera de rango, una proporción en un modelo que no ofrece ninguna, una referencia que falta o que sobra: cada caso vuelve como un error que nombra el parámetro, con tu saldo intacto. El saldo se descuenta al arrancar la generación, y si esta falla después, el reembolso es automático; llamar la API desde tu código tiene los códigos de estado y las reglas de liquidación.

Descarga la generación que decidiste conservar. Si manejas todo esto desde un script, toma tamaños, resoluciones, proporciones y rangos de duración del catálogo y no de una constante en tu código, para que un cambio nuestro te llegue como un valor nuevo y no como un rechazo. Si buscas una cuadrícula entera de variaciones y no una sola escalera, mira arte conceptual.

Preguntas frecuentes

¿Un clip más largo cuesta proporcionalmente más?

Sí: el precio por segundo depende de la resolución y se paga en cada segundo, así que los dos factores se acumulan. La proporción no cambia el total; las imágenes de referencia sí pueden, en los modelos que cobran cada imagen después de la primera. La página del propio modelo trae las cifras, tomadas de la misma fuente con la que cobra el servidor.

¿Puedo quedarme con un resultado barato y volver a renderizarlo en más resolución?

No como la misma imagen. Aun donde hay seed, repetir el número no garantiza el mismo cuadro, así que la generación más alta es un sorteo nuevo y puede cambiar cosas que no pediste. Si un sujeto o un cuadro concreto tiene que mantenerse, pasa el resultado barato como imagen de referencia a un modelo de edición.

¿Qué pasa si pido un clip más largo, o una proporción que el modelo no ofrece?

La solicitud se rechaza y el error indica qué acepta ese modelo. No se cobra nada ni se ajusta nada para que encaje. Recortar el clip en silencio, o descartar la proporción, te entregaría algo distinto de lo que pagaste.

Guías relacionadas

Todas las guías

Mira el catálogo antes de gastar nada

Sin suscripción. Agrega créditos y paga solo por lo que usas.

Elige un modelo