Difusión latente — el proceso oculto Del ruido a la imagen: miles de pasos El espacio latente como mapa de ideas Cómo aprende una IA lo que es un árbol Video generativo: el cine del siglo XXI Agentes creativos: la próxima frontera SIGNAL · 2026 Difusión latente — el proceso oculto Del ruido a la imagen: miles de pasos El espacio latente como mapa de ideas Cómo aprende una IA lo que es un árbol Video generativo: el cine del siglo XXI Agentes creativos: la próxima frontera SIGNAL · 2026
Investigación Técnica accesible No. 07

Anatomía de una
imagen
generativa

Del ruido al significado: el viaje invisible que ocurre cada vez que una IA crea una imagen. Un proceso que millones de personas activan a diario sin saber exactamente qué hay detrás.

Escribes una frase. Presionas un botón. Tres segundos después, aparece una imagen que nunca existió antes. Para la mayoría de las personas, esto parece magia. Para muchos entusiastas, es simplemente "la IA haciendo su trabajo". Pero entre esas dos percepciones hay un proceso extraordinariamente complejo —y extraordinariamente elegante— que vale la pena entender.

No porque necesites ser ingeniero para usar estas herramientas. Sino porque entender qué ocurre cambia la manera en que interactúas con ellas. Como saber algo de música cambia la forma en que escuchas una canción.

Este artículo es una guía al interior de una imagen generativa. Sin fórmulas. Sin jerga técnica innecesaria. Solo el viaje, contado con claridad.

§ I

El mundo como datos

¿Cómo aprende una máquina lo que es un árbol, una persona o una ciudad?

Antes de que un modelo pueda crear una imagen, tiene que aprender a ver el mundo. Ese aprendizaje no ocurre como el nuestro —no hay infancia, no hay paseos por el parque, no hay errores con consecuencias emocionales. Ocurre a través de datos: millones, a veces miles de millones de imágenes, cada una acompañada de una descripción en texto.

"Un gato naranja dormido sobre un sofá." Imagen. "Fotografía aérea de una ciudad costera al atardecer." Imagen. "Retrato en acuarela de una mujer anciana con sombrero de paja." Imagen. El modelo procesa ese volumen descomunal de pares —texto más imagen— hasta que comienza a detectar patrones: estas formas suelen aparecer cuando la descripción dice "árbol". Estos colores ocurren cuando dice "atardecer". Estas texturas corresponden a "piel humana".

No hay comprensión. No hay emoción. Pero hay algo más curioso: hay estadística muy refinada. El modelo aprende las relaciones de probabilidad entre palabras y píxeles con una precisión que, a gran escala, se parece bastante a entender.

Infografía 01 — Cómo aprende un modelo a ver el mundo
"Un árbol en verano" "Ciudad nocturna" "Retrato, mujer" DATOS IMÁGENES + TEXTO 5,000,000,000+ pares de entrenamiento detecta BORDES COLORES FORMAS TEXTURAS PATRONES RECONOCIMIENTO VISUAL aprende gato tigre león felino pelaje RELACIONES MAPA CONCEPTUAL genera MODELO ENTRENADO El modelo no "entiende" el mundo — aprende las relaciones estadísticas entre palabras y píxeles

El resultado de ese aprendizaje es un modelo: un sistema matemático que ha interiorizado millones de conexiones entre conceptos visuales. No sabe qué es un árbol en el sentido filosófico. Pero sabe, con extraordinaria precisión, qué aspecto tiene uno —y cómo cambia ese aspecto según la época del año, el estilo artístico, la hora del día o el ángulo de la luz.

§ II

El espacio latente

¿Dónde viven las imágenes antes de existir?

Aquí comienza la parte verdaderamente fascinante. Para poder generar imágenes, un modelo no trabaja con píxeles directamente —trabajar con millones de píxeles a la vez sería computacionalmente imposible. En cambio, trabaja con algo llamado espacio latente: una representación matemática comprimida del mundo visual.

Imagina que cada imagen posible pudiera ubicarse como un punto en un mapa enorme. Imágenes similares estarían cerca. Un retrato y otro retrato, próximos. Un paisaje invernal y otro paisaje invernal, vecinos. Un dibujo animado y una fotografía realista, separados por una gran distancia.

Ese mapa existe, y el modelo ha aprendido a navegarlo. Cuando le das un prompt —"un gato naranja dormido sobre libros viejos"— el modelo no busca una imagen guardada en ningún lugar. Calcula un punto en ese mapa que corresponde a tu descripción, y luego trabaja desde ese punto hacia afuera para construir la imagen.

Concepto clave — Espacio latente

El espacio latente es como una ciudad donde cada barrio es un estilo visual, cada calle es un concepto, y cada dirección específica es una imagen posible. Cuando describes lo que quieres, el modelo calcula a qué dirección ir en esa ciudad.

La distancia entre puntos tiene significado real: "gato" y "tigre" están más cerca que "gato" y "automóvil". "Pintura al óleo" y "acuarela" están más cerca que "pintura al óleo" y "fotografía digital". El modelo aprendió esas distancias durante su entrenamiento.

La consecuencia práctica de esto es poderosa: puedes mezclar conceptos que no existen en la realidad, y el modelo encontrará el punto en el mapa que corresponde a esa mezcla. "Un castillo medieval estilo Studio Ghibli con luz de atardecer" no existe en ninguna base de datos. Pero el espacio latente tiene un lugar para esa combinación, y el modelo puede alcanzarlo.

Las imágenes generativas no son fotografías de algo que existe. Son predicciones visuales de algo que podría existir.

— SIGNAL
§ III

Del ruido a la imagen

Por qué los modelos empiezan con estática, como un televisor sin señal

Ahora viene el proceso en sí. Una vez que el modelo sabe qué quiere crear —gracias a tu prompt y al espacio latente—, ¿cómo lo construye? La respuesta es contraintuitiva: comienza con ruido puro, como estática de televisor, y va eliminando ese ruido paso a paso hasta que emerge una imagen.

Este proceso se llama difusión. La idea viene de un principio matemático: si puedes aprender a añadir ruido gradualmente a una imagen hasta destruirla por completo, también puedes aprender a hacer el proceso inverso. A partir de ruido puro, deshacer el desorden poco a poco hasta revelar algo coherente.

En cada paso, el modelo hace una pregunta: "¿Qué ajuste pequeño me acerca un poco más a la imagen que este prompt describe?" Puede ser mil pasos. O cien, con técnicas modernas. Al final de ese proceso iterativo, lo que era caos se ha convertido en una imagen reconocible.

Infografía 02 — El proceso de difusión paso a paso
PROCESO DE DIFUSIÓN — EL MODELO ITERA ~1000 VECES DESDE RUIDO PURO HASTA IMAGEN COHERENTE PASO 0 RUIDO PURO Estática aleatoria 100% ruido PASO 200 EMERGENCIA Formas vagas 75% ruido PASO 500 SILUETAS Composición definida 50% ruido PASO 800 DETALLES Estructuras visibles 25% ruido PASO 1000 IMAGEN FINAL Coherente · Detallada 0% ruido · 100% imagen Prompt: "Un árbol solitario al atardecer, pintura digital" El prompt guía cada uno de los ~1000 pasos de eliminación de ruido, orientando el resultado hacia tu descripción

Lo que hace especial al proceso de difusión es que el prompt no actúa una sola vez al principio. En cada paso de la eliminación de ruido, el modelo consulta tu descripción: "¿El ajuste que voy a hacer me acerca más o menos a 'árbol solitario al atardecer'?" Tu texto es el faro que orienta mil micro-decisiones consecutivas.

Por eso cambiar una sola palabra en un prompt puede producir resultados radicalmente diferentes. No porque el modelo sea impredecible, sino porque cada palabra ajusta la dirección del proceso en cada uno de esos pasos.

§ IV

El papel del prompt

Tu texto no es una instrucción. Es una dirección artística.

Si entiendes el proceso hasta aquí, algo cambia en cómo ves el prompt. Ya no es simplemente "escribir lo que quieres". Es navegar el espacio latente: apuntar al punto del mapa donde vive la imagen que tienes en mente, y luego guiar el proceso de difusión hacia ese punto.

Cada palabra tiene peso. "Árbol" y "árbol roble centenario" apuntan a lugares diferentes del mapa. "Atardecer" y "hora dorada con sol bajo el horizonte" también. Los prompts más efectivos no son los más largos ni los más elaborados: son los que describen con más precisión el punto exacto del espacio latente donde vive la imagen que el creador imagina.

También importa el contexto artístico: decirle al modelo en qué parte del mapa estás antes de pedirle que se mueva. "Fotografía de un árbol" y "pintura impresionista de un árbol" están en barrios completamente diferentes de esa ciudad imaginaria. El modelo los encuentra con igual facilidad, pero el resultado es un universo visual aparte.

Para tener en cuenta — La interpretación probabilística

El modelo no ejecuta tu prompt de forma literal y determinista. Lo interpreta probabilísticamente: dado todo lo que aprendió, ¿cuál es la imagen más probable que corresponde a esta descripción? Por eso dos generaciones del mismo prompt producen resultados diferentes. Cada vez el modelo toma un camino ligeramente distinto por el mapa hacia el mismo destino.

Esto tiene una consecuencia importante: la variedad es una característica, no un error. Si siempre obtuvieras exactamente el mismo resultado, el modelo no estaría siendo creativo, sino mecánico.

§ V

Del texto al video

La siguiente revolución ya está ocurriendo

Si la generación de imágenes fue el primer gran impacto cultural de la IA generativa, el video es el segundo, y está sucediendo ahora mismo. Herramientas como Runway, Kling o Sora permiten hoy producir video con calidad cinematográfica desde una descripción de texto, con presupuestos que habrían parecido absurdos hace tres años.

El principio es el mismo que el de las imágenes, pero con una dimensión adicional: el tiempo. Una imagen es un punto en el espacio latente. Un video es una trayectoria a través de ese espacio: un camino que el modelo recorre de forma coherente, asegurando que los objetos se muevan de manera creíble, que la luz cambie naturalmente, que la física del mundo simulado tenga sentido interno.

Infografía 03 — La democratización de la producción audiovisual
PRODUCIR 3 MINUTOS DE VIDEO CON CALIDAD PROFESIONAL VS ANTES PRODUCCIÓN TRADICIONAL · 2020 CÁMARA $15,000–$50,000 EQUIPO 15–30 personas LOCACIÓN Permisos + viajes COSTO TOTAL ESTIMADO $40,000 — $150,000 TIEMPO DE PRODUCCIÓN 4–12 SEMANAS AHORA PRODUCCIÓN GENERATIVA · 2026 IDEA Solo la tienes tú PROMPT Descripción en texto ITERACIÓN Refinar el resultado COSTO TOTAL ESTIMADO $20 — $200 TIEMPO DE PRODUCCIÓN 1–5 DÍAS

Las cifras importan menos que lo que representan. El cambio no es que hacer video sea más barato. El cambio es que hacer video ya no requiere capital ni infraestructura: requiere visión. Una persona con una idea y acceso a internet puede producir hoy lo que hace cinco años exigía un equipo de producción profesional.

Lo que está emergiendo no es solo un formato más accesible. Es una nueva forma de autoría cinematográfica, donde el creador puede dirigir directamente —sin intermediar a través de un equipo técnico— con la IA ocupando simultáneamente los roles de cámara, iluminador y director de fotografía.

La pregunta ya no es quién puede producir imágenes en movimiento. La pregunta es quién tiene historias que contar.

§ Cierre

La imagen no aparece de la nada

Detrás de esos tres segundos entre el prompt y la imagen hay un proceso que involucra miles de millones de parámetros matemáticos, décadas de investigación en inteligencia artificial, y un modelo que ha "visto" más imágenes de las que un ser humano podría ver en mil vidas.

Entender ese proceso no hace que la experiencia sea menos mágica. La hace más interesante. Cuando sabes que el modelo navega un espacio latente, empiezas a pensar en tus prompts como coordenadas. Cuando sabes que el proceso de difusión es iterativo, entiendes por qué la paciencia y la iteración producen mejores resultados que la búsqueda del prompt perfecto desde el primer intento.

Y cuando entiendes que el modelo no "entiende" nada —que lo que parece comprensión es estadística refinada a escala masiva— puedes apreciar algo más profundo: que la creatividad genuina sigue siendo tuya. El modelo puede predecir la imagen más probable para tu descripción. Pero decidir qué descripción vale la pena escribir, qué pregunta visual merece ser explorada, qué historia tiene sentido contar: eso es, todavía, irrevocablemente humano.

La imagen es el resultado de una negociación continua entre tu lenguaje, la estadística del modelo y algo que ninguna ecuación puede formular: la decisión de qué vale la pena imaginar.

— SIGNAL
Gerardo Ventura · Editor · SIGNAL · 2026 · @gfvc1978
Artículo No. 07 · Arte generativo e inteligencia artificial · San Salvador