Revista de Arte e Inteligencia Artificial
2025
Arte · Proceso · Técnica
Distribución digital
Instagram · Substack
Acceso libre
por: Gerardo Ventura  @gfvc1978
Perfil de artista

Willtoulan y el arte
de construir escala
desde cero

Cómo un arborista de Massachusetts se convirtió en referente del sci-fi visual con 593K seguidores — y qué podemos aprender de su pipeline C4D + Midjourney.

Willtoulan: el arte de construir mundos que aplastan al espectador

Su obra no es solo ciencia ficción — es arquitectura de civilizaciones que nunca existieron, construida con una combinación inusual de software 3D e inteligencia artificial.

§ 01 — El artista

Will Toulan
@willtoulan · Instagram · Massachusetts, EE.UU.

Artista digital, motion designer, y arborista de profesión. Estudió pintura, grabado y video art en el Maryland Institute College of Art (MICA), graduándose en 2010. En 2016, entre trabajos, comenzó a publicar una pieza nueva en Instagram cada día — y no paró.

593KSeguidores
3,831Publicaciones
2016Inicio en Instagram
Cinema 4D Midjourney Adobe Photoshop World Machine RealFlow Motion Design
Muestra de obra reciente

Will Toulan no se describe a sí mismo como un artista de IA — y eso es precisamente lo que lo hace interesante. Antes de que Midjourney existiera, ya construía civilizaciones imposibles en Cinema 4D, ladrillo virtual por ladrillo virtual. La IA llegó después, como una capa más en un proceso que ya tenía estructura y punto de vista.

Sus influencias son declaradas y reconocibles: el trabajo de Industrial Light & Magic en la trilogía original de Star Wars, y la estética biomecánica de H.R. Giger en Alien (1979). Dos universos aparentemente opuestos — la épica espacial luminosa y el horror orgánico oscuro — que en su obra se fusionan en algo propio: estructuras que parecen haber crecido, no sido construidas.

Sus estructuras no parecen construidas. Parecen geológicas — como si la civilización que las levantó llevara tanto tiempo que sus edificios se volvieron paisaje.

Observación editorial — Signal No. 01

El pipeline híbrido: por qué C4D + Midjourney

§ 02 — Estructura más atmósfera

La pregunta que todo entusiasta del AI art se hace al ver el trabajo de Toulan es inevitable: ¿cómo lo hace? La respuesta no está solo en el prompt — está en entender que Cinema 4D y Midjourney no son herramientas competidoras. Son complementarias, y cada una resuelve lo que la otra no puede.

¿Cómo funciona el pipeline?

Cinema 4D → Render base: Construye la escena en 3D. Geometría, proporciones, iluminación técnica, ángulo de cámara. No tiene que ser perfecto — tiene que ser estructuralmente correcto.

Render base → Midjourney (image prompt): El render se sube como imagen de referencia. Midjourney toma esa estructura y le aplica el estilo, la textura orgánica, la atmósfera — todo lo que tarda horas lograr manualmente.

Resultado: Perspectiva creíble con detalle imposible. La combinación que define visualmente su trabajo.

Lo que Cinema 4D aporta es control. Perspectiva exacta, proporciones consistentes entre publicaciones, iluminación técnica (HDRI, luces de área) que el ojo reconoce como "real" aunque la escena sea fantástica. Lo que Midjourney aporta es lo que ningún artista puede hacer manualmente en tiempo razonable: texturas orgánico-mecánicas complejas, atmósfera volumétrica, el "peso visual" cinematográfico que convierte un render limpio en algo que parece capturado, no fabricado.

El prompt de texto en este workflow no describe formas — las formas ya vienen del render. El prompt describe cómo se siente la imagen: estilo, atmósfera, referencias estéticas. Más dirección artística que instrucción técnica.

El vocabulario de la magnitud

§ 03 — Cuando una palabra cambia la civilización que el modelo imagina

Aquí llegamos a uno de los hallazgos más interesantes que surgieron investigando cómo replicar el impacto visual de Toulan con herramientas más accesibles. Existe, en los modelos de generación de imagen actuales, lo que podríamos llamar una jerarquía de magnitud — y no es solo semántica.

Cuando cambias la palabra que describe el tamaño de una estructura o escena, no solo cambias cuán grande aparece en la imagen. Cambias el tipo de civilización que el modelo infiere. El contexto histórico implícito. La escala de tiempo. El tipo de fotografía que ese mundo requeriría para ser capturado.

Palabra Lo que el modelo infiere Estética resultante
Gigantesco Grande para estándares humanos. El modelo piensa en edificios altos, naves grandes. Arquitectura épica reconocible. Blade Runner, Star Wars.
Monumental Diseñado para impresionar. Implica intención humana de grandeza. Más ceremonial, más simétrico. Tiende a lo imperial.
Sobreescalado Excede la escala humana sin justificación aparente. Algo salió de control. Más caótico, más orgánico. Menos orden, más crecimiento.
Continental ★ clave La civilización ya no construye edificios — construye geografía. El tiempo implicado es geológico. Las estructuras parecen terreno natural. Fotografía satelital. Civilización post-humana.

"Continental" activa en el modelo un conjunto de asociaciones muy específico: fotografía aérea, escala geológica, tiempo profundo. No es solo que las estructuras sean más grandes — es que el modelo asume que llevan tanto tiempo existiendo que se han vuelto parte del planeta. Eso es exactamente lo que se siente en el trabajo de Toulan.

Nota de metodología

Este hallazgo surgió de un proceso de ingeniería inversa sistemática: analizar las imágenes de Toulan, intentar replicar el impacto visual con prompts progresivos, documentar qué cambiaba con cada variación de vocabulario, y registrar los resultados.

La hipótesis de que los modelos actuales han sido entrenados con suficiente obra de Toulan como para que ciertos descriptores activen patrones asociados a su estética es plausible y consistente con lo observado en las generaciones. No es replicación directa — es influencia de entrenamiento, como ocurre con cualquier artista con presencia masiva y firma visual definida.

Prompts comentados: el sistema JSON

§ 04 — Una metodología propia para mantener coherencia visual

En lugar de prompts lineales ("una nave enorme sobre una ciudad en la niebla"), existe una aproximación más sofisticada: estructurar el prompt como un documento JSON con capas semánticas separadas. El resultado es menos prompt y más brief de dirección artística.

La lógica es sencilla: los modelos como GPT-4o procesan el prompt como razonamiento antes de generar. Darle una estructura jerárquica — sujeto, ambiente, arquitectura, atmósfera, composición, vibe — le permite al modelo entender qué es central y qué es contextual, en lugar de tratar todas las palabras con el mismo peso.

Estructura del sistema — fragmento comentado
"subject": {
  "description": "Vast agricultural landscape from a high terrace",
  "scale": "Continental scale",       // ← la palabra clave
  "presence": "Quiet, immense and awe-inspiring"
},

"atmosphere": {
  "celestial_body": {
    "type": "Rocky moon",
    "scale": "Enormous apparent size in the sky",
    "presence": "Ancient and majestic"  // contexto temporal implícito
  }
},

"the_vibe": {
  "story": "A future civilization cultivated entire
           continents into geometric ecosystems
           beneath impossible skies",   // ← narrativa, no descripción
  "aesthetic": "Far-future architectural sci-fi artbook"
},

"constraints": {
  "must_keep": ["continental scale feeling", "gigantic moon"],
  "avoid": ["cyberpunk neon", "urban city skyline"]
}

El campo the_vibe.story es probablemente el más poderoso de todo el sistema. No describe lo que hay en la imagen — describe lo que pasó en ese mundo para que esa imagen exista. El modelo usa esa narrativa como contexto para todas las demás decisiones visuales.

Resultado

El resultado más exitoso con este sistema produjo exactamente lo que el JSON describía: campos agrícolas geométricos infinitos vistos desde una terraza elevada, una luna rocosa de escala imposible, nubes estratocúmulus monumentales, paleta desaturada en verdes y beige, y una figura humana solitaria que ancla toda la escala. Sin ella, "continental" sería abstracto. Con ella, el cerebro calcula la proporción instintivamente — y la imagen se vuelve abrumadora.

Un detalle que el modelo añadió sin instrucción explícita: una etiqueta técnica ("A5-01") en la columna de la terraza. Le dio autenticidad de concept art real — como si esa imagen existiera en el archivo de diseño de una civilización que realmente construyó eso.

Para replicar en GPT-4o — puntos clave

1. Usa "Continental scale" como descriptor de magnitud, no "gigantesco" ni "monumental".

2. Separa el prompt en capas semánticas (subject / atmosphere / the_vibe) aunque sea en texto plano.

3. El campo "story" en the_vibe es el más importante — dale al modelo una narrativa, no solo una descripción.

4. Los "constraints" con avoid son importantes pero GPT-4o los respeta de forma inconsistente — reforzar con negativos explícitos ayuda.

§ Cierre

Lo que Toulan realmente enseña

La lección más valiosa del trabajo de Will Toulan no es técnica — es filosófica. La escala no es un parámetro que ajustas al final. Es la premisa desde la que construyes todo. Cuando decides que tu civilización es continental, todo lo demás — la arquitectura, la luz, la atmósfera, la paleta — se alinea a esa decisión.

Y eso es exactamente lo que el sistema JSON intenta capturar: no un prompt, sino un punto de vista. Una serie de decisiones sobre qué mundo existe detrás de esa imagen, antes de que el modelo genere un solo píxel.

Toulan lo hace con Cinema 4D y años de oficio. Tú puedes empezar a hacerlo con GPT-4o y un JSON bien pensado. La brecha es más pequeña de lo que parece — y los resultados lo demuestran.