Hasta hace poco, la forma más rápida de detectar una imagen generada por IA era leerla. Un cartel de fondo con letras imposibles, un menú escrito en un idioma que no existe, una camiseta con un logo derretido. El texto era la grieta por donde se colaba la mentira.
Eso empezó a cambiar en 2026, y no por un truco de renderizado. Cambió porque los modelos dejaron de dibujar al instante. Ahora, antes de soltar un solo pixel, se detienen a pensar. Sí, como el resto de nosotros debería hacer antes de mandar ese mensaje a la ex.
Meta acaba de sumarse a la tendencia con Muse Image, pero ese no es el tema. El tema es qué significa que un modelo de imagen "razone", qué ganamos con eso, y sobre todo qué siguen escondiendo las demos pulidas.
El día que los modelos dejaron de dibujar a ciegas
Durante años, un generador de imágenes funcionó como un reflejo: recibía el prompt y disparaba pixeles de inmediato, sin pensar, como quien contesta "sí" antes de que termines la pregunta. En abril de 2026, GPT Image 2 (de OpenAI) rompió ese patrón. Fue el primer modelo mainstream en "pensar" antes de dibujar: planifica la composición, opcionalmente busca referencias en la web y revisa su propio resultado antes de mostrarlo. Ese paso de más le abrió una ventaja enorme en los rankings, del orden de 240 puntos Elo sobre el segundo.
Google llegó por otro camino con Nano Banana Pro, que se apoya en el conocimiento del mundo de Gemini y en búsqueda en tiempo real para acertar nombres, unidades y datos dentro de una infografía en lugar de inventarlos.
Y Muse Image, el modelo que Meta lanzó el 7 de julio, hace lo mismo: razona el prompt, planifica la escena, usa herramientas de código y búsqueda, y se autocorrige antes de entregar. Según Meta, ese hábito de revisarse a sí mismo no lo programaron, apareció solo durante el entrenamiento. Una IA que desarrolló autocrítica sin que se la pidieran: más de lo que se puede decir de muchos.
La frase que resume todo el cambio: "generar una imagen" se está convirtiendo en "completar una tarea visual".
El talón de Aquiles que aprendió a escribir
El texto legible dentro de una imagen fue durante años el punto más débil de esta tecnología, y por una razón lógica. Un modelo que dibuja al instante no tiene cómo planificar dónde va cada palabra ni revisar la ortografía. Cuando aparece el paso de razonamiento, primero decide la maqueta y después corrige lo que escribió, en ese orden.
El resultado se nota. GPT Image 2 escribe texto en inglés con una precisión cercana al 99%, suficiente para que diseñadores lo usen en borradores de posters y piezas con copy real. Nano Banana Pro es su rival más cercano y manda en los textos largos, algo que Google puso como argumento de venta. Y cuando el texto es el protagonista absoluto (logos, letreros, tipografía), especialistas como Ideogram y Seedream siguen ganando.
| Modelo | ¿Piensa antes de generar? | Texto dentro de la imagen | Dónde flojea |
|---|---|---|---|
| GPT Image 2 (OpenAI) | Sí, fue el primero | Casi perfecto en inglés (~99%) | Lento (40 a 60s), caro, objetos que se "derriten" |
| Nano Banana Pro (Google) | Usa conocimiento de Gemini y búsqueda web | Fuerte, líder en párrafos largos | Menos control en ediciones puntuales |
| Muse Image (Meta) | Sí, planifica y se autocorrige | Legible, apoyado en herramientas | Por detrás de GPT Image 2 según la propia Meta |
| Ideogram / Seedream | Especialistas | Lo mejor para tipografía y carteles | No son generalistas |
| FLUX.2 / Qwen (open source) | Parcial | Qwen brilla en multilingüe | Calidad general por debajo del top |
La letra chica: el texto está "prácticamente resuelto", pero solo en la cima del mercado y solo hasta cierto punto.
Lo que la galería de lanzamiento no te muestra
Cada modelo llega con una galería impecable. Lo interesante es lo que queda fuera de esa galería.
Pensar cuesta. Ese paso de razonamiento que mejora el texto también hace al modelo más lento y más caro: GPT Image 2 puede tardar entre 40 y 60 segundos por imagen, mientras uno rápido resuelve en unos 15. Multiplicá eso por las 30 variantes que vas a pedir hasta que una salga bien y la cuenta empieza a doler.
La composición precisa sigue sin ser confiable. Pedile "A a la izquierda de B, con C arriba" y vas a recibir una interpretación libre de tus instrucciones, no un plano. Ni GPT Image 2 ni Nano Banana son deterministas con posiciones exactas, y ambos todavía tropiezan con grillas.
Y el texto perfecto no salva la imagen entera. En pruebas independientes aparecieron casos donde el modelo escribió cada palabra impecable, pero ignoró los colores que pedía el prompt y dejó objetos que se derriten en los bordes. Diez de ortografía, aplazado en física.
Hasta la propia Meta lo admite: sus benchmarks internos ponen a Muse Image por debajo de GPT Image 2, ganándole solo a Nano Banana 2 en edición. Aunque, como ya escribimos sobre cuánto conviene fiarse de un benchmark interno, incluso ese segundo puesto conviene leerlo con pinzas.
Un modelo ya no te alcanza
La conclusión práctica de 2026 es que no existe el mejor generador, existe el mejor generador para cada tarea. Los equipos que trabajan en serio enrutan: texto y layouts a GPT Image 2 o Ideogram, fotorrealismo y consistencia de rostros a Nano Banana Pro, volumen y borradores a los modelos baratos, multilingüe a Qwen. Apostar todo a un solo proveedor dejó de tener sentido, más o menos como tener un solo cuchillo para toda la cocina.
El punto
Lo interesante no es que la IA dibuje mejor. Es que dejó de dibujar y empezó a razonar, el mismo salto que dieron antes los modelos de texto. Ese cambio explica por qué las letras dentro de una imagen pasaron de ser la delación más obvia a volverse casi invisibles.
Pero la precisión, la composición y la honestidad física son la próxima frontera, y ahí todavía hay tela para rato. Cuando alguien te diga que la generación de imágenes ya está "resuelta", te está mostrando la demo buena, no las diez generaciones que salieron mal antes de esa.
En la newsletter de macareno.net miramos de cerca estos cambios y los contamos sin el filtro del marketing. Si te sirve leer la letra chica antes de comprar el titular, suscribite.
Fuentes
- Introducing Muse Image — Meta
- Meta unveils its first picture-generating model — Axios
- Best AI Image Generator 2026: GPT Image 2 vs 4 Rivals — Tech Insider
- 2026 AI Image API Benchmark — Atlas Cloud
- GPT Image 2 vs Nano Banana 2: 2026 Comparison Guide — PixVerse
