Resumen
- Qwen Image 3.0 es el modelo de texto a imagen y edición de imágenes de Alibaba, diseñado para diseños con mucha información: infografías, pósteres, storyboards, maquetas de UI y diseños multipanel.
- Acepta prompts de hasta 4,5K tokens y afirma renderizar texto de hasta unos 10 píxeles en 12 idiomas.
- En las pruebas prácticas aguantó bien con escenas individuales cargadas y pósteres independientes, pero el texto factual pequeño (como los porcentajes nutricionales) seguía saliendo distorsionado.
- Edita imágenes usando de una a tres imágenes de referencia, y se lanza con pesos cerrados, así que no puedes descargarlo ni ejecutarlo en local.
- Puedes generar con él directamente en OpenArt sin una cuenta de Alibaba Cloud.
¿Qué es Qwen Image 3.0?
Qwen Image 3.0 es un modelo de generación y edición de imágenes con IA de Alibaba, lanzado en julio de 2026. Genera imágenes a partir de un prompt de texto y edita imágenes existentes usando de una a tres imágenes de referencia junto con instrucciones escritas. Alibaba lo diseñó pensando en manejar visuales densos y con mucha información, más que en imágenes protagonistas limpias e individuales.
El modelo genera imágenes de entre 512x512 y 2048x2048 píxeles, en formato PNG. Pide un tamaño concreto o déjalo en blanco y el modelo elegirá una resolución según el prompt. Una sola petición puede devolver hasta seis imágenes.
Qwen Image 3.0 se lanza con pesos cerrados. A diferencia de las versiones anteriores Qwen-Image 1.0 y 2.0, no puedes descargar el modelo ni ejecutarlo en tu propio hardware. El acceso se realiza a través de un servicio alojado, incluido el Qwen Image 3.0 modelo en OpenArt.
¿Para qué se usa Qwen Image 3.0?
Alibaba y las primeras pruebas prácticas apuntan al mismo puñado de tareas:
- Infografías y publicaciones de carrusel, donde varios datos o paneles deben encajar en un diseño coherente.
- Pósteres y conceptos de campaña, especialmente las construidas en torno a una única escena elaborada en lugar de un recorte de producto. Para un póster más sencillo y puntual, la Creador de pósteres con IA es la herramienta más directa.
- maquetas de UI y visuales de producto, donde la imagen tiene que sugerir una interfaz o una pantalla.
- Storyboards y fichas de conocimiento, donde el texto y la imagen tienen que encajar viñeta a viñeta, el mismo tipo de tarea que el Generador de storyboards con IA controles para escenas con guion.
- Diseños multipanel y densos en general, el tipo de encargo que normalmente se dividiría en varias generaciones separadas.
Encaja peor con una única foto de producto limpia, un logo que deba quedar idéntico píxel a píxel o cualquier cosa donde un puñado de números pequeños (precios, porcentajes, dosis) tenga que salir bien a la primera. Más sobre por qué a continuación.
Funciones clave
Alibaba plantea Qwen Image 3.0 en torno a tres pilares, y conviene tratarlos como promesas del proveedor y no como comportamiento confirmado hasta que hayas probado un prompt tú mismo:
- Contenido rico: prompts de hasta 4,5K tokens, unas cuatro veces el límite de Qwen-Image 2.0. Los propios ejemplos de Alibaba incluyen periódicos, storyboards y exámenes, es decir, composiciones con mucho contenido.
- Detalles auténticos: texto renderizado a un tamaño tan pequeño como unos 10 píxeles, además de textura visual fina como los poros de la piel y hebras individuales de cabello.
- Conocimiento profundo: renderizado nativo de texto en unos 12 idiomas, con ejemplos oficiales en chino, inglés, japonés, coreano y español. Alibaba también menciona webs simuladas, pantallas de videojuegos y código renderizado dentro de una imagen.
La propia documentación de Alibaba señala límites reales junto a esas afirmaciones: pueden aparecer errores ortográficos, sobre todo en texto pequeño o que no esté en inglés, y el modelo no debe tratarse como una fuente de verdad para los números de un gráfico o infografía sin una revisión manual.
Cómo usar Qwen Image 3.0
En OpenArt, generar con Qwen Image 3.0 requiere cuatro pasos:
- Abre el Qwen Image 3.0 página del modelo y elige el modo de generación o edición.
- Para editar, sube de una a tres imágenes de referencia.
- Escribe un prompt detallado: describe la composición, el texto exacto que quieres que aparezca, la paleta de colores y el estilo, en lugar de una descripción de una sola línea.
- Revisa el resultado a tamaño completo, haz zoom en cualquier texto o número pequeño y afina el prompt para todo lo que haya salido mal.
Un prompt diseñado para lo que el modelo hace realmente bien, una escena densa con instrucciones claras, tiende a superar a un prompt que pide varios recursos separados a la vez. Ejemplo:
Un taller de relojero abarrotado al anochecer, cálida luz de lámpara de escritorio, decenas de diminutos engranajes y herramientas esparcidos por un banco de madera, un reloj de bolsillo a medio montar en primer plano, motas de polvo visibles en el haz de luz, detalle fotorrealista en cada superficie.
Qué esperar: cómo rinde en la práctica
Una cosa son las afirmaciones de Alibaba; otra, las generaciones reales. En una ronda de pruebas prácticas, se le pidió a Qwen Image 3.0 crear un anuncio de una bebida deportiva con una etiqueta nutricional cargada de información, un carrusel de tres imágenes para redes, una infografía, un gráfico minimalista para redes y varias escenas individuales llenas de información.
La promesa del texto de 10 píxeles no se cumplió en la etiqueta nutricional. Algunos porcentajes y la cantidad de proteína salieron desordenados, lo que significa que cualquier cosa con texto pequeño exacto (precios, dosis, información nutricional) todavía necesita una revisión manual antes de publicar. La tipografía grande tipo póster funcionó mucho mejor; un póster de café independiente salió con un titular limpio y legible.
La solicitud de carrusel tampoco se devolvió como tres archivos separados. Qwen fusionó los tres paneles en una sola imagen, así que para obtener recursos individuales hubo que recortar el resultado después, con cierta pérdida de resolución por panel.
Al editar un logo subido se produjeron cambios no solicitados (añadió un collar y pelo desaliñado a un logotipo de un perro Scottie) hasta que el prompt indicó explícitamente que se mantuviera el logo sin cambios y se conservara la relación de aspecto. Una vez detalladas esas restricciones, las ediciones se ciñeron al recurso solicitado. Para trabajos de marca recurrentes en los que un logo debe permanecer intacto a lo largo de muchas generaciones, el Kit de marca con IA impone esa coherencia automáticamente en lugar de depender del texto del prompt cada vez.
Donde mejor rindió Qwen Image 3.0 fue en una única escena densa: un abarrotado taller de relojero y una biblioteca flotante en 21:9 conservaron los detalles finos en todo el encuadre sin convertirse en ruido visual. Si un encargo se centra en una composición elaborada en lugar de en varios recursos coordinados, ahí es donde este modelo da lo mejor de sí.
Una cuenta gratuita alcanzó el límite de uso tras unas cuatro o cinco generaciones en esta ronda de pruebas. Tómalo como la experiencia de una cuenta concreta más que como un límite documentado, ya que Qwen no publica una cifra fija para el plan gratuito.
Preguntas frecuentes
¿Para qué se usa Qwen Image 3.0?
Principalmente visuales densos y con mucha información: infografías, publicaciones de carrusel, pósteres, maquetas de UI, storyboards y diseños multipanel. También edita imágenes existentes usando de una a tres imágenes de referencia.
¿Es gratis usar Qwen Image 3.0?
Alibaba no publica una asignación fija de nivel gratuito, y una cuenta probada alcanzó el límite tras unas cuatro o cinco generaciones. En OpenArt, las cuentas nuevas reciben 40 créditos gratis para probarlo junto con otros modelos, sin necesidad de tarjeta de crédito.
¿Puedo ejecutar Qwen Image 3.0 en local?
No. Se lanza con pesos cerrados, a diferencia de las versiones abiertas Qwen-Image 1.0 y 2.0. Accedes a él a través de un servicio alojado en lugar de con pesos descargables.
¿En qué se diferencia Qwen Image 3.0 de Qwen-Image 2.0?
El cambio principal es la longitud del prompt: 3.0 admite unos 4,5K tokens frente al límite de 1.000 tokens de 2.0, algo que importa en composiciones densas con muchas instrucciones. Alibaba también promociona un mejor renderizado de texto pequeño y mayor soporte de idiomas, aunque el texto factual pequeño sigue beneficiándose de una revisión manual.
¿Qwen Image 3.0 admite otros idiomas además del inglés?
Los ejemplos oficiales de Alibaba abarcan chino, inglés, japonés, coreano y español, con renderizado nativo de texto que afirman soportar en unos 12 idiomas en total.
¿Y si mi proyecto necesita mucho texto muy pequeño y exacto?
Cuenta con una revisión manual. En las pruebas, el texto denso de una etiqueta nutricional y los porcentajes salieron distorsionados a pesar de la promesa de 10 píxeles de Alibaba, así que cualquier cosa con precios, dosis u otro microtexto exacto conviene verificarla línea por línea antes de publicar. Para ese trabajo concreto, una herramienta de diseño con mucho texto como la ChatGPT Image 2.0 modelo puede necesitar menos retoques; para varias imágenes de referencia que deben mantenerse coherentes, Nano Banana Pro es la otra opción disponible en la misma cuenta de OpenArt.
Lecturas relacionadas
¿Quieres comparar primero Qwen Image 3.0 con otras opciones? El resumen de OpenArt de los mejores generadores de imágenes con IA en 2026 compara una gama más amplia de modelos en paralelo.
Prueba Qwen Image 3.0 en OpenArt
Puedes generar con Qwen Image 3.0 directamente en OpenArt, junto a otros modelos de imagen y vídeo, sin tener que crear una cuenta aparte en Alibaba Cloud.