Sube una foto, añade un prompt y el modelo crea una imagen nueva que conserva la composición, la pose, la iluminación o el estilo de tu referencia mientras cambia lo que le pediste que cambiara.
Eso es la generación de imagen a imagen, y resuelve el problema que los prompts de texto no pueden. El texto por sí solo no puede replicar algo que ya existe, ya sea tu producto, tu personaje, tu diseño o un estilo que llevas años perfeccionando.
Conclusiones clave
- Imagen a imagen lee la estructura y el estilo de tu referencia en lugar de copiar sus píxeles. La composición y la pose se trasladan de forma fiable. El detalle fino no.
- Los logos exactos y el texto pequeño son el punto débil, así que cuenta con ediciones con máscara y una revisión humana en lugar de fiarte de un prompt.
- Cada modelo gana en tareas distintas, por eso pasar una referencia por dos o tres es mejor que apostar por uno solo.
- Los editores más recientes eliminaron el deslizador de fidelidad, así que ahora la preservación se indica en el prompt como una instrucción explícita.
- Subir una referencia sobre la que no tienes derechos es un riesgo en sí mismo, al margen del aspecto que tenga el resultado.
¿Qué es un generador de imágenes con IA a partir de imagen?
Un generador de imágenes por IA a partir de una imagen, normalmente llamado imagen a imagen o img2img, toma dos entradas en lugar de una: una imagen de referencia y un prompt de texto. El modelo lee el color, la estructura, la iluminación y la pose de la referencia en vez de copiar sus píxeles. Después crea una nueva imagen, guiada por tu prompt.
Si solo has usado texto a imagen, la diferencia se nota enseguida en el control que consigues. Un prompt de texto puede describir «una mujer con chaqueta roja, en vista de tres cuartos», pero no puede reproducir una mujer concreta, una chaqueta concreta ni un ángulo de cámara concreto.
Una imagen de referencia sí puede. En OpenArt subes la foto junto con tu prompt para que el resultado conserve tu composición mientras cambian el estilo, el ambiente o los detalles.
Imagen a imagen frente a texto a imagen
Ambos enfoques usan los mismos modelos base. Resuelven problemas distintos.
| Dimensión | Imagen a imagen | Texto a imagen |
|---|---|---|
| Entrada | Imagen de referencia más un prompt de texto | Solo prompt de texto |
| Control | Alta, ya que la composición y la pose se anclan a la referencia | Menor, ya que el modelo construye a partir de tu descripción |
| Consistencia | El mismo sujeto o diseño en muchas generaciones | Cada generación empieza de cero |
| Ideal para | Fotos de producto, transferencia de estilo, trabajo con personajes, reestilizado de fotos | Conceptualizar, explorar y crear escenas nuevas |
Usa texto a imagen mientras aún estás explorando y no sabes qué quieres. Usa imagen a imagen cuando ya tienes algo, como la foto de un producto, una hoja de personaje, un boceto o un diseño, y necesitas versiones que le sean fieles.
Cómo funciona la IA de imagen a imagen
Los modelos de difusión lo hacen codificando tu referencia en una forma comprimida, añadiendo una cantidad controlada de ruido y usando después tu prompt para guiar la limpieza. La propia documentación de Hugging Face lo explica claramente. Un valor de intensidad más alto le da al modelo más margen para crear algo distinto de tu referencia. Con una intensidad de 1.0, la referencia se "ignora más o menos".
El modelo extrae estructura y estilo de tu referencia. Traslada de forma fiable la composición, la paleta de colores, la dirección de la iluminación, la pose y el ángulo de cámara. Lo que no traslada de forma fiable es el detalle fino exacto.
Photoroom probó 850 productos de ropa y accesorios en 3.400 generaciones en julio de 2026. El mejor modelo superó sus comprobaciones de precisión del producto en el 29,0% de las generaciones. La distorsión de logos o texto fue el fallo más común, con un 20,1%. Photoroom vende una capa de fidelidad de producto, así que tiene interés en esa respuesta.
La lección sigue siendo válida aun teniendo en cuenta la fuente. Si tu trabajo depende de una etiqueta o logo exactos, cuenta con ediciones enmascaradas y una revisión humana, no solo con prompts.
Transferencia de estilo desde una imagen de referencia
La transferencia de estilo funciona porque el modelo lee el aspecto de una referencia por separado de su contenido. La documentación de Midjourney lo expresa bien. Una referencia de estilo "captura el ambiente visual de una imagen existente", es decir, sus colores, medio, texturas o iluminación. "No copia objetos ni personas."
La misma idea vale para todas las herramientas. Tu referencia aporta el aspecto y tu prompt aporta el sujeto.
Para mantener un aspecto en todo un lote, guárdalo en lugar de volver a subirlo cada vez. El Brand Kit de OpenArt almacena tus colores, fuentes y referencias de estilo a nivel de proyecto, y OpenArt Characters almacena una persona que puedes etiquetar en imágenes posteriores.
Controlar la fidelidad del resultado
Las herramientas de Stable Diffusion tienen un control deslizante de intensidad o denoising que fija el equilibrio directamente. La cuenta es simple. Multiplica la intensidad por los pasos de inferencia para obtener los pasos que realmente ejecutas, así que una intensidad de 0,8 con 50 pasos ejecuta 40 pasos de cambio.
Dicho en términos sencillos, un valor más bajo mantiene el resultado cerca de la foto que subiste y uno más alto da más libertad al modelo. La escala de Stable Diffusion Art es una buena guía orientativa: en torno a 0,2 da un cambio ligero, 0,6 uno grande y 1,0 uno muy grande. Trata cualquier cifra más precisa que veas por internet como los valores por defecto que alguien ha probado, no como una recomendación oficial, y encuentra los tuyos.
OpenArt lo resuelve con un control deslizante de creatividad en imagen a imagen, desde un reestilizado sutil que se mantiene cerca del original hasta una reinterpretación atrevida que solo conserva la composición general.
Midjourney usa el peso de imagen, escrito --iw, en su lugar. Su documentación indica un rango de 0 a 3 con un valor por defecto de 1 en V8.1, y aún no hay valores publicados para V8.2.
Los editores basados en instrucciones más recientes, como FLUX.1 Kontext y GPT Image 2, han eliminado por completo el control deslizante. Controlas la fidelidad escribiendo cláusulas de conservación en el prompt.
Cómo generar una imagen a partir de una referencia, paso a paso
El flujo es más o menos igual en todas partes. Aquí lo tienes en OpenArt.
- Sube tu imagen de referencia en el Generador de imágenes con IA.
- Escribe tu prompt. Describe la imagen final que quieres, no instrucciones para editar la referencia.
- Elige un modelo. GPT Image 2 gestiona instrucciones complejas y texto pequeño, Nano Banana Pro encaja en trabajos fotorrealistas con varias referencias, y Seedream 4.5 es la opción para anime e ilustración plana.
- Ajusta el control de creatividad. Un valor bajo te mantiene cerca de la referencia y uno alto da al modelo margen para reinterpretar.
- Genera, compara hasta 8 variaciones y descarga las que quieras.
La velocidad depende del modelo. FLUX.1 Kontext crea una imagen de 1024 por 1024 en tres a cinco segundos. Nano Banana promedia unos diez segundos según las mediciones de Replicate. OpenAI dice que los prompts complejos de GPT Image 2 pueden tardar hasta dos minutos.
Mejores modelos de IA para imagen a imagen
Ningún modelo gana en todas las tareas, y ese es justo el motivo práctico para pasar una misma referencia por varios. De los modelos de abajo, GPT Image 2, Nano Banana Pro y Seedream funcionan con el mismo bote de créditos compartido de OpenArt, así que comparar estos tres no implica comparar suscripciones. FLUX, Stable Diffusion y Midjourney necesitan cada uno su propia cuenta.
- FLUX (Black Forest Labs). En el propio KontextBench de BFL, FLUX.1 Kontext obtuvo la mejor puntuación en edición de texto y preservación de personajes. Fue el primer modelo creado para ediciones en varios turnos que mantienen la identidad entre cambios. BFL es sincero sobre el límite y documenta una degradación visible tras seis ediciones seguidas. Ahora dirige los nuevos proyectos a FLUX.2, que admite hasta 8 imágenes de referencia a través de la API.
- GPT Image 2 (OpenAI). Acepta hasta 16 imágenes de entrada por solicitud de edición y procesa cada entrada con alta fidelidad. Se sitúa tercero con 1256 Elo en la clasificación de edición de imágenes de Artificial Analysis. En el académico GEditBench v2, GPT Image 1.5 obtuvo la mejor puntuación en seguimiento de instrucciones con 1260, y Nano Banana Pro quedó primero en general.
- Nano Banana Pro (Google). Oficialmente, Gemini 3 Pro Image. Google documenta hasta 14 entradas de referencia en un solo prompt, de las cuales 6 pueden ser de alta fidelidad, y semejanza consistente para hasta cinco personas. Genera en 4K nativo.
- Seedream (ByteDance). La opción para anime, ilustración y diseños de pósteres. Seedream 5.0 Pro combina hasta 10 imágenes de referencia, y Seedream 4.5 tiene un estilizado de animación 2D más potente.
- Stable Diffusion. Sigue siendo el que ofrece más control manual si lo ejecutas tú mismo, con un deslizador de intensidad y guías estructurales ControlNet, aunque los ControlNets oficiales de SD 3.5 solo cubren Canny, Depth y Blur, y las guías de pose o boceto vienen de la comunidad.
- Midjourney (V8.2). Estética por defecto sólida gracias a los prompts de imagen y las referencias de estilo. Su función Omni Reference sigue funcionando con V7, cuesta el doble de tiempo de GPU y no funciona con Vary Region, Pan, Zoom Out, Fast Mode ni Draft Mode. No hay plan gratuito, y los planes empiezan en 10 $ al mes.
Replicate realizó su propia comparativa en septiembre de 2025, con una generación más antigua de modelos. Descubrió que FLUX.1 Kontext y Nano Banana conservaban mejor la tipografía y la textura en las ediciones de texto, y que Nano Banana y Seedream superaban a Kontext en transferencia de estilo. Prueba tu propia referencia antes de gastar créditos en un lote.
Casos de uso principales
La imagen a imagen se gana su sitio siempre que el resultado tenga que coincidir con algo que ya existe.
- Transferencia de estilo. Aplica un estilo de pintura, un aspecto cinematográfico o una estética de marca a una foto que ya tengas.
- Fotografía de producto. Convierte una foto de móvil en una toma con iluminación de estudio sobre una nueva superficie manteniendo intacta la forma del producto.
- Conversión a anime y arte. Convierte retratos en estilos anime, ilustración o cómic manteniendo la identidad y la pose.
- Consistencia de personajes. Mantén la misma cara, atuendo y proporciones a lo largo de decenas de generaciones.
- Combinar referencias. Combina varias entradas en un solo resultado: Nano Banana Pro admite hasta 14 y FLUX.2 hasta 8.
- Imagen a vídeo. Usa un fotograma terminado como primer fotograma de un clip.
Coherencia de personajes entre resultados
La deriva de identidad es el mayor modo de fallo en el trabajo basado en referencias. La misma cara vuelve sutilmente distinta en cada generación, y para la décima imagen el personaje se ha convertido silenciosamente en otra persona.
OpenArt Characters soluciona la deriva convirtiendo al personaje en un recurso guardado en lugar de una referencia por cada prompt. Crea el personaje una sola vez a partir de un prompt, una foto de referencia o un preset. Luego etiqueta a ese mismo personaje en cualquier imagen o vídeo posterior, incluidas escenas en OpenArt Director, la herramienta de vídeo multiescena.
Esa diferencia importa más que cualquier cifra de benchmark. Una imagen de referencia le pide al modelo que vuelva a deducir la cara cada vez, mientras que un personaje guardado le da el mismo punto de partida siempre.
Prompt engineering for image-to-image
Todos los editores actuales usan lenguaje natural en lugar de etiquetas de palabras clave. Las mismas reglas se aplican en FLUX, GPT Image y Gemini. Describe la imagen final que quieres, no las ediciones que quieres hacer.
Indica claramente qué debe conservarse y elige verbos precisos. Black Forest Labs lo señala directamente en su guía de prompts: "transformar" implica un cambio completo, mientras que "cambiar la ropa" o "reemplazar el fondo" te da control sobre lo que realmente cambia.
Para la conversión a anime, nombra el estilo objetivo y bloquea la identidad: "crea una ilustración anime 2D con lineart limpio y cel shading, conserva la identidad facial, el peinado, la pose y el encuadre de la persona, cambia solo el estilo de renderizado."
Para reestilizados fotorrealistas, añade límites estrictos sobre el encuadre y el fondo. La propia guía de prompting de OpenAI recomienda indicar las exclusiones de forma explícita, incluyendo frases como «sin elementos adicionales», para evitar que el modelo se desvíe.
Para el trabajo de producto, merece la pena tomar prestada la plantilla publicada por Google, uses el modelo que uses. Especifica la iluminación, el ángulo de cámara, la superficie del fondo y el detalle que debe mantenerse nítido.
Cuando sustituyas texto o un logotipo, entrecomíllalo. El patrón documentado de FLUX Kontext es: Sustituye "[texto original]" por "[texto nuevo]".
Corregir el resultado sin empezar de cero
La primera generación rara vez es la última. Empezar de cero desperdicia créditos cuando solo una zona está mal. En OpenArt, los arreglos habituales se quedan en el mismo lienzo.
- Ediciones por zonas. El modo Edición por Zonas de Editar Imagen te permite resaltar un punto y cambiar únicamente esa zona.
- Relleno y eliminación. El Relleno Generativo con IA rellena un hueco, elimina un objeto o amplía el encuadre.
- Cambios de fotograma. Expandir Imagen amplía el lienzo a cualquier relación de aspecto o preajuste social.
- Fondos. El Eliminador de Fondos con IA ofrece un recorte limpio, y el Cambiador de Fondos con IA cambia la escena.
- Caras. El Editor de Caras con IA se encarga de los cambios de expresión y el retoque.
- Reescalado. El escalador de imágenes funciona en modo Preciso, Refinado o Creativo, y el Vellum Skin Enhancer llega hasta 8K cuando la textura de la piel importa.
Cada una de esas correcciones se ejecuta en el mismo lienzo, con el modelo con el que generaste. En Midjourney, la edición por regiones ocurre en Discord tras un reescalado, usando una versión más antigua del modelo.
Uso comercial, derechos de autor y propiedad
Start with the baseline. The U.S. Copyright Office's January 2025 report says AI output can be protected "only where a human author has determined sufficient expressive elements." That covers three cases. Your own work is visible in the output, or you arrange the output creatively, or you modify it creatively. Prompts on their own do not count.
En la práctica, eso significa que una imagen generada solo con un prompt no tiene copyright, y son tus propias ediciones y disposición las que se lo ganan.
Los términos de la plataforma se añaden a eso, y varían mucho. OpenArt no reclama ninguna propiedad ni derechos de autor sobre tu resultado. Los derechos comerciales se aplican en los planes de pago elegibles, sin regalías ni necesidad de mencionar créditos. Los términos de OpenAI para consumidores y empresas te asignan los derechos del resultado, siempre que tuvieras los derechos sobre tus entradas y siguieras las políticas de uso. Midjourney exige un plan Pro o Mega antes de que una empresa con más de 1 millón de dólares de ingresos anuales, o un empleado de una, sea propietaria de sus activos.
Dos riesgos se aplican específicamente al trabajo con imágenes de referencia.
Subir una foto con derechos de autor sobre la que no tienes derechos puede ser un problema en sí mismo, sea cual sea el aspecto del resultado. Y publicar un resultado que acabe siendo sustancialmente similar a una obra protegida invita a una reclamación aunque nadie lo pretendiera.
El Comprobación de seguridad de PI analiza el resultado antes de que publiques, buscando similitudes con marcas, caras famosas y riesgo de parecido. Un resultado verde significa que no se detectó nada, una advertencia significa que alguien debería revisarlo y no seguro significa que hay una similitud significativa. OpenArt indica que los resultados son informativos, así que trata un resultado verde como un filtro y no como una autorización legal.
Planes y créditos
OpenArt funciona con un único fondo de créditos que cubre sus modelos de imagen, vídeo y audio. Puedes empezar gratis con 40 créditos durante 7 días y sin tarjeta, además de una asignación diaria de créditos gratuitos para la generación básica de imágenes a partir de entonces.
| Plan | Mensual | Créditos al mes |
|---|---|---|
| Starter | $14 | 4,000 |
| Plus | $34 | 12,000 |
| Pro | $56 | 24,000 |
| Wonder | $240 | 106,000 |
Esas cifras son para la facturación mensual. La facturación anual reduce cada plan, con un ahorro de hasta el 27 %, y todos los planes de pago exportan sin marca de agua. Los créditos base se renuevan cada mes, y el Pack de Créditos Extra de 15 $ añade unos 5000 créditos que sí se acumulan.
Kit de marca merece la pena configurarlo si generas para una marca. Guarda tu logo, los códigos hex exactos, las fuentes, los recursos de producto, las referencias de estilo y las reglas de marca a nivel de proyecto, para que un lote de referencias salga coherente sin importar el modelo que elijas.
Primeros pasos
La forma más rápida de valorar la imagen a imagen es pasar tu propia referencia por el proceso.
- Abre el generador de imágenes de OpenArt y sube tu foto de referencia.
- Escribe un prompt que describa la imagen final e indica qué debe permanecer igual.
- Elige un modelo, ajusta el control de creatividad y genera.
- Compara las variaciones y luego arregla lo que esté casi bien con la Edición por Zonas o el escalador.
- Si el mismo personaje tiene que aparecer de nuevo más adelante, créalo una vez en Personajes y etiquétalo en futuros prompts.
Preguntas frecuentes
¿Qué formatos y tamaños de archivo puedo subir como referencia?
La mayoría de las plataformas admiten los formatos web habituales con sus propios límites de tamaño. Midjourney acepta .png, .gif, .webp, .jpg y .jpeg de hasta 10 MB. Sea cual sea la herramienta, una referencia nítida, bien iluminada y cercana a tu resolución objetivo da el mejor resultado, porque el modelo no puede recuperar detalles que tu referencia nunca tuvo.
¿Cómo controlo cuánto se parece el resultado a mi referencia?
Depende de la herramienta. En las de Stable Diffusion, baja el control deslizante de intensidad. En Midjourney, súbelo --iw hacia 3. FLUX Kontext y GPT Image 2 no tienen deslizador. En su lugar, escribe la preservación en el prompt, como en "manteniendo los mismos rasgos faciales y peinado". En OpenArt, el deslizador de creatividad se encarga de ello, y puedes generar hasta 8 variaciones con distintos ajustes para ver el abanico de resultados.
¿Puedo usar fotos de personas reales como referencias?
Solo con su consentimiento. Las políticas de uso de OpenAI prohíben usar la imagen de alguien sin consentimiento, incluida una imagen o voz fotorrealista, de formas que puedan confundir a la gente sobre qué es real. Nueva York exige ahora a los anunciantes que lo indiquen claramente cuando usan a sabiendas a un actor sintético en un anuncio. La sanción es de 1.000 $ por la primera infracción y 5.000 $ por cada una posterior. Para cualquier uso comercial de una persona real, consigue los derechos de todos los implicados, tanto del fotógrafo como del modelo.
¿Qué modelo es mejor para imagen a imagen?
Depende de la tarea. FLUX Kontext lidera en ediciones locales y preservación de personajes en el benchmark de su creador. GPT Image 2 gestiona instrucciones complejas con varias imágenes y texto pequeño. Nano Banana Pro lidera en trabajo fotorrealista y admite más referencias, y Seedream es la opción para anime e ilustración. Las clasificaciones cambian entre tareas, así que pasa tu referencia por GPT Image 2, Nano Banana Pro y Seedream en OpenArt y compara, ya que esos tres usan los mismos créditos.
¿Por qué el logo de mi producto sale mal?
Porque el modelo reconstruye el logotipo en lugar de copiarlo. Las pruebas de Photoroom detectaron que la distorsión de logotipos y texto era el fallo de precisión más común. La solución es dejar de pedirle al prompt que lo haga: genera la escena, luego usa la Edición por Áreas para reparar solo esa región y compruébalo a ojo antes de publicar nada.
¿Cómo evito que la cara de un personaje cambie entre generaciones?
Deja de volver a subir una referencia y guarda el personaje en su lugar. Créalo una vez en OpenArt Characters a partir de un prompt, una foto o una plantilla. Luego etiqueta ese personaje en cada generación posterior. El modelo parte del mismo punto cada vez en lugar de volver a deducir la cara desde una referencia nueva.
¿Puedo convertir el resultado en un vídeo?
Sí. Cuando tienes una imagen fija que te gusta, Imagen a Vídeo la anima. OpenArt Director va más allá y crea un vídeo de varias escenas que mantiene los mismos personajes en todas las tomas. Generar primero la imagen fija y animarla después te da más control que describir todo el vídeo en un solo prompt.