Sube una foto, agrega un prompt y el modelo construye una nueva imagen que conserva la composición, la pose, la iluminación o el estilo de tu referencia mientras cambia lo que le pediste.
Eso es la generación de imagen a imagen, y resuelve el problema que los prompts de texto no pueden. El texto por sí solo no puede replicar algo que ya existe, ya sea tu producto, tu personaje, tu diseño o un look que llevas años perfeccionando.
Puntos clave
- La imagen a imagen lee la estructura y el estilo de tu referencia en lugar de copiar sus píxeles. La composición y la pose se conservan de forma confiable. El detalle fino no.
- Los logotipos exactos y el texto pequeño son el punto débil, así que planea ediciones con máscara y una revisión humana en lugar de confiar en un prompt.
- Distintos modelos ganan en distintas tareas, por eso pasar una referencia por dos o tres supera a comprometerse con uno solo.
- Los editores más nuevos eliminaron el control deslizante de fidelidad, así que ahora la preservación va en el prompt como una instrucción explícita.
- Subir una referencia sobre la que no tienes derechos es un riesgo en sí mismo, aparte de cómo se vea el resultado.
¿Qué es un generador de imágenes con IA a partir de imagen?
Un generador de imágenes con IA a partir de una imagen, normalmente llamado imagen a imagen o img2img, toma dos entradas en lugar de una: una imagen de referencia y un prompt de texto. El modelo lee el color, la estructura, la iluminación y la pose de la referencia en lugar de copiar sus píxeles. Luego crea una nueva imagen, guiada por tu prompt.
Si solo has usado texto a imagen, la diferencia se nota de inmediato en el control que obtienes. Un prompt de texto puede describir "una mujer con chaqueta roja, vista de tres cuartos", pero no puede reproducir a una mujer específica, una chaqueta específica ni un ángulo de cámara específico.
Una imagen de referencia sí puede. En OpenArt subes la foto junto con tu prompt para que el resultado conserve tu composición mientras cambian el estilo, el ambiente o los detalles.
Imagen a imagen frente a texto a imagen
Ambos enfoques usan los mismos modelos base. Resuelven problemas distintos.
| Dimensión | Imagen a imagen | Texto a imagen |
|---|---|---|
| Entrada | Imagen de referencia más un prompt de texto | Solo prompt de texto |
| Control | Alto, ya que la composición y la pose están ancladas a la referencia | Menor, ya que el modelo construye a partir de tu descripción |
| Consistencia | El mismo sujeto o composición en muchas generaciones | Cada generación empieza desde cero |
| Ideal para | Tomas de producto, transferencia de estilo, trabajo con personajes, reestilizar fotos | Concepto, exploración, escenas totalmente nuevas |
Usa texto a imagen mientras todavía estás explorando y no sabes qué quieres. Usa imagen a imagen cuando ya tienes algo, como una foto de producto, una hoja de personaje, un boceto o un diseño, y necesitas versiones que se mantengan fieles a él.
Cómo funciona la IA de imagen a imagen
Los modelos de difusión manejan esto codificando tu referencia en una forma comprimida, agregando una cantidad controlada de ruido y luego usando tu prompt para guiar la limpieza. La propia documentación de Hugging Face lo dice sin rodeos. Un valor de fuerza más alto le da al modelo más margen para crear algo diferente de tu referencia. Con una fuerza de 1.0, la referencia se "ignora más o menos".
El modelo extrae la estructura y el estilo de tu referencia. Transfiere de forma confiable la composición, la paleta de colores, la dirección de la iluminación, la pose y el ángulo de cámara. Lo que no transfiere de forma confiable son los detalles finos exactos.
Photoroom probó 850 productos de ropa y accesorios en 3,400 generaciones en julio de 2026. El mejor modelo pasó sus verificaciones de precisión de producto en el 29.0% de las generaciones. La distorsión de logotipos o texto fue la falla más común, con un 20.1%. Photoroom vende una capa de fidelidad de producto, así que tiene un interés en esa respuesta.
La lección se mantiene incluso considerando la fuente. Si tu trabajo depende de una etiqueta o logo exactos, cuenta con ediciones enmascaradas y una revisión humana, no solo con prompts.
Transferencia de estilo desde una imagen de referencia
La transferencia de estilo funciona porque el modelo lee el look de una referencia por separado de su contenido. La documentación de Midjourney lo explica muy bien. Una referencia de estilo "captura la vibra visual de una imagen existente", es decir, sus colores, medio, texturas o iluminación. "No copia objetos ni personas."
La misma idea aplica en todas las herramientas. Tu referencia aporta el look y tu prompt aporta el sujeto.
Para mantener un look en todo un lote, guárdalo en lugar de volver a subirlo cada vez. El Brand Kit de OpenArt almacena tus colores, fuentes y referencias de estilo a nivel de proyecto, y OpenArt Characters almacena a una persona que puedes etiquetar en imágenes posteriores.
Controlar la fidelidad del resultado
Las herramientas de Stable Diffusion tienen un control deslizante de fuerza o de reducción de ruido que ajusta el equilibrio directamente. La cuenta es sencilla. Multiplica la fuerza por los pasos de inferencia para obtener los pasos que realmente se ejecutan, así una fuerza de 0.8 con 50 pasos ejecuta 40 pasos de cambio.
En términos sencillos, un valor más bajo mantiene el resultado cerca de la foto que subiste y uno más alto le da al modelo más libertad. La escala de Stable Diffusion Art es una buena guía aproximada: alrededor de 0.2 da un cambio ligero, 0.6 uno grande y 1.0 uno muy grande. Toma cualquier número más específico que veas en línea como los valores por defecto que alguien probó, más que como una guía oficial, y encuentra los tuyos.
OpenArt maneja esto con un control deslizante de creatividad en imagen a imagen, desde un reestilizado sutil que se mantiene cerca del original hasta una reinterpretación audaz que solo conserva la composición aproximada.
Midjourney usa el peso de imagen, escrito --iw, en su lugar. Su documentación indica un rango de 0 a 3 con un valor predeterminado de 1 en la V8.1, y aún no hay valores publicados para la V8.2.
Los editores más nuevos basados en instrucciones, como FLUX.1 Kontext y GPT Image 2, eliminaron el control deslizante por completo. Controlas la fidelidad escribiendo cláusulas de preservación en el prompt.
Cómo generar una imagen a partir de una referencia, paso a paso
El flujo es más o menos el mismo en todos lados. Aquí lo tienes en OpenArt.
- Sube tu imagen de referencia en el Generador de imágenes con IA.
- Escribe tu prompt. Describe la imagen final que quieres, no instrucciones para editar la referencia.
- Elige un modelo. GPT Image 2 maneja instrucciones complejas y texto pequeño, Nano Banana Pro es ideal para trabajos fotorrealistas con varias referencias, y Seedream 4.5 es la opción para anime e ilustración plana.
- Ajusta el control deslizante de creatividad. Un valor más bajo se mantiene cerca de la referencia y uno más alto le da al modelo margen para reinterpretar.
- Genera, compara hasta 8 variaciones y descarga las que quieras.
La velocidad depende del modelo. FLUX.1 Kontext crea una imagen de 1024 por 1024 en tres a cinco segundos. Nano Banana promedia unos diez segundos según las mediciones de Replicate. OpenAI dice que los prompts complejos de GPT Image 2 pueden tardar hasta dos minutos.
Los mejores modelos de IA para imagen a imagen
Ningún modelo gana en todas las tareas, lo cual es el argumento práctico para pasar una referencia por varios. De los modelos de abajo, GPT Image 2, Nano Banana Pro y Seedream funcionan con el fondo compartido de créditos de OpenArt, así que comparar esos tres no implica comparar suscripciones. FLUX, Stable Diffusion y Midjourney necesitan cada uno su propia cuenta.
- FLUX (Black Forest Labs). En el propio KontextBench de BFL, FLUX.1 Kontext obtuvo la puntuación más alta en edición de texto y preservación de personajes. Fue el primer modelo creado para ediciones multiturno que mantienen la identidad a través de los cambios. BFL es franco sobre el límite y documenta una degradación visible después de seis ediciones seguidas. Ahora dirige los proyectos nuevos hacia FLUX.2, que admite hasta 8 imágenes de referencia a través de la API.
- GPT Image 2 (OpenAI). Acepta hasta 16 imágenes de entrada por solicitud de edición y procesa cada entrada con alta fidelidad. Ocupa el tercer lugar con 1,256 Elo en la tabla de edición de imágenes de Artificial Analysis. En el GEditBench v2 académico, GPT Image 1.5 obtuvo la mejor puntuación en seguimiento de instrucciones con 1,260, y Nano Banana Pro se llevó el primer lugar general.
- Nano Banana Pro (Google). Oficialmente Gemini 3 Pro Image. Google documenta hasta 14 entradas de referencia en un prompt, de las cuales 6 pueden ser de alta fidelidad, y semejanza consistente para hasta cinco personas. Genera en 4K nativo.
- Seedream (ByteDance). La opción para anime, ilustración y diseños de póster. Seedream 5.0 Pro combina hasta 10 imágenes de referencia, y Seedream 4.5 tiene un estilo de animación 2D más potente.
- Stable Diffusion. Sigue siendo el que ofrece más control manual si lo ejecutas tú mismo, con un control deslizante de intensidad y guías estructurales ControlNet, aunque los ControlNets oficiales de SD 3.5 solo cubren Canny, Depth y Blur, y las guías de pose o boceto vienen de la comunidad.
- Midjourney (V8.2). Estética por defecto potente a través de prompts de imagen y referencias de estilo. Su función Omni Reference todavía funciona en la V7, cuesta el doble de tiempo de GPU y no funciona con Vary Region, Pan, Zoom Out, Fast Mode ni Draft Mode. No hay nivel gratuito, y los planes empiezan en $10 al mes.
Replicate realizó su propia comparación en septiembre de 2025, con una generación anterior de modelos. Descubrió que FLUX.1 Kontext y Nano Banana conservaban mejor la tipografía y la textura en ediciones de texto, y que Nano Banana y Seedream superaban a Kontext en transferencia de estilo. Prueba tu propia referencia antes de gastar créditos en un lote.
Principales casos de uso
La imagen a imagen se gana su lugar allí donde el resultado tiene que coincidir con algo que ya existe.
- Transferencia de estilo. Aplica un estilo de pintura, un look de película o una estética de marca a una foto que ya tienes.
- Fotografía de producto. Convierte una foto de celular en una toma con iluminación de estudio sobre una nueva superficie, manteniendo intacta la forma del producto.
- Conversión a anime y arte. Convierte retratos en estilos anime, ilustración o cómic manteniendo la identidad y la pose.
- Consistencia de personajes. Mantén el mismo rostro, atuendo y proporciones en decenas de generaciones.
- Combinar referencias. Combina varias entradas en una sola salida, con Nano Banana Pro admitiendo hasta 14 y FLUX.2 hasta 8.
- Imagen a video. Usa un fotograma terminado como el primer fotograma de un clip.
Consistencia de personajes entre resultados
La deriva de identidad es el mayor modo de falla en el trabajo basado en referencias. La misma cara vuelve sutilmente distinta en cada generación, y para la décima imagen el personaje se ha convertido silenciosamente en otra persona.
Personajes de OpenArt maneja la desviación convirtiendo al personaje en un recurso guardado en lugar de una referencia por prompt. Crea el personaje una vez a partir de un prompt, una foto de referencia o un preajuste. Luego etiqueta ese mismo personaje en cualquier imagen o video posterior, incluyendo escenas en OpenArt Director, la herramienta de video multiescena.
Esa diferencia importa más que cualquier número de referencia. Una imagen de referencia le pide al modelo que vuelva a derivar la cara cada vez, mientras que un personaje guardado le da el mismo punto de partida siempre.
Prompt engineering for image-to-image
Todos los editores actuales usan lenguaje natural en lugar de etiquetas de palabras clave. Las mismas reglas aplican en FLUX, GPT Image y Gemini. Describe la imagen final que quieres, no las ediciones que quieres hacer.
Indica con claridad qué se debe conservar y elige verbos precisos. Black Forest Labs lo señala directamente en su guía de prompting: "transformar" implica un cambio completo, mientras que "cambiar la ropa" o "reemplazar el fondo" te da control sobre lo que realmente cambia.
Para convertir a estilo anime, nombra el look deseado y bloquea la identidad: "crea una ilustración anime 2D con lineart limpio y sombreado cel, conserva la identidad facial de la persona, el peinado, la pose y el encuadre, cambia solo el estilo de renderizado."
Para reestilizados fotorrealistas, agrega límites estrictos sobre el encuadre y el fondo. La propia guía de prompts de OpenAI recomienda indicar las exclusiones de forma explícita, incluyendo frases como "sin elementos adicionales", para evitar que el modelo se desvíe.
Para trabajos de producto, vale la pena tomar prestada la plantilla publicada por Google sea cual sea el modelo que uses. Nombra la configuración de iluminación, el ángulo de cámara, la superficie del fondo y el detalle que debe mantenerse nítido.
Cuando estés reemplazando texto o un logo, ponlo entre comillas. El patrón documentado de FLUX Kontext es: Reemplaza "[texto original]" por "[texto nuevo]".
Corregir el resultado sin empezar de cero
La primera generación rara vez es la última. Empezar de cero desperdicia créditos cuando solo una zona está mal. En OpenArt, los arreglos comunes se quedan en el mismo lienzo.
- Ediciones por región. El modo de Edición por Área de Editar Imagen te permite resaltar un punto y cambiar solo esa zona.
- Relleno y eliminación. El Relleno Generativo con IA rellena un espacio, elimina un objeto o extiende el encuadre.
- Cambios de encuadre. Expandir imagen amplía el lienzo a cualquier relación de aspecto o preset para redes sociales.
- Fondos. El Removedor de Fondo con IA da un recorte limpio, y el Cambiador de Fondo con IA intercambia la escena.
- Rostros. El Editor de Rostros con IA se encarga de los cambios de expresión y el retoque.
- Escalado. El escalador de imágenes funciona en modo Preciso, Refinado o Creativo, y el Vellum Skin Enhancer llega hasta 8K cuando la textura de la piel importa.
Cada una de esas correcciones se ejecuta en el mismo lienzo, con el modelo que usaste para generar. En Midjourney, la edición por regiones ocurre en Discord después de un escalado, usando una versión más antigua del modelo.
Uso comercial, derechos de autor y propiedad
Start with the baseline. The U.S. Copyright Office's January 2025 report says AI output can be protected "only where a human author has determined sufficient expressive elements." That covers three cases. Your own work is visible in the output, or you arrange the output creatively, or you modify it creatively. Prompts on their own do not count.
En la práctica eso significa que una imagen puramente generada por prompt no tiene derechos de autor, y son tus propias ediciones y disposición las que se los ganan.
Los términos de la plataforma se suman a eso, y varían mucho. OpenArt no reclama propiedad ni derechos de autor sobre tu resultado. Los derechos comerciales aplican en los planes de pago elegibles, sin regalías y sin necesidad de dar crédito. Los términos de consumidor y empresa de OpenAI te asignan los derechos del resultado, siempre que tuvieras los derechos de tus entradas y siguieras las políticas de uso. Midjourney exige un plan Pro o Mega antes de que una empresa con más de $1M anuales en ingresos, o un empleado de ella, sea dueña de sus activos.
Dos riesgos aplican específicamente al trabajo con imágenes de referencia.
Subir una foto con derechos de autor sobre la que no tienes derechos puede ser un problema en sí mismo, sin importar cómo se vea el resultado. Y publicar un resultado que termine siendo sustancialmente similar a una obra protegida invita a una demanda incluso cuando nadie lo pretendía.
El Verificación de seguridad de PI revisa el resultado antes de que publiques, buscando similitud con marcas, rostros famosos y riesgo de parecido. Un resultado verde significa que no se detectó nada, una advertencia significa que alguien debería revisarlo, y no seguro significa una similitud significativa. OpenArt indica que los resultados son informativos, así que trata un resultado verde como un filtro y no como una aprobación legal.
Planes y créditos
OpenArt funciona con un solo pool de créditos que cubre sus modelos de imagen, video y audio. Puedes empezar gratis con 40 créditos durante 7 días y sin tarjeta, además de una asignación diaria de créditos gratis para generación básica de imágenes después de eso.
| Plan | Mensual | Créditos al mes |
|---|---|---|
| Starter | $14 | 4,000 |
| Plus | $34 | 12,000 |
| Pro | $56 | 24,000 |
| Wonder | $240 | 106,000 |
Esas cifras son para la facturación mensual. La facturación anual reduce cada plan y ahorra hasta un 27%, y todos los planes de pago exportan sin marca de agua. Los créditos base se reinician cada mes, y el Paquete de Créditos Extra de $15 agrega alrededor de 5,000 créditos que sí se acumulan.
Kit de marca vale la pena configurarlo si generas para una marca. Guarda tu logo, los códigos hex exactos, las fuentes, los recursos de producto, las referencias de estilo y las reglas de marca a nivel de proyecto, para que un lote de referencias salga consistente sin importar qué modelo elijas.
Primeros pasos
La forma más rápida de evaluar imagen a imagen es pasar tu propia referencia por ella.
- Abre el generador de imágenes de OpenArt y sube tu foto de referencia.
- Escribe un prompt que describa la imagen final e indica qué debe permanecer igual.
- Elige un modelo, ajusta el control deslizante de creatividad y genera.
- Compara las variaciones y luego corrige lo que esté casi listo con Área de edición o el escalador.
- Si el mismo personaje tiene que volver a aparecer más adelante, créalo una vez en Personajes y etiquétalo en tus próximos prompts.
Preguntas frecuentes
¿Qué formatos y tamaños de archivo puedo subir como referencia?
La mayoría de las plataformas aceptan los formatos web comunes con sus propios límites de tamaño. Midjourney acepta .png, .gif, .webp, .jpg y .jpeg de hasta 10 MB. Sea cual sea la herramienta, una referencia clara y bien iluminada cercana a tu resolución objetivo da el mejor resultado, porque el modelo no puede recuperar detalles que tu referencia nunca tuvo.
¿Cómo controlo qué tanto se parece el resultado a mi referencia?
Depende de la herramienta. En las herramientas de Stable Diffusion, baja el control deslizante de fuerza. En Midjourney, sube --iw hacia 3. FLUX Kontext y GPT Image 2 no tienen control deslizante. En su lugar, escribe la preservación en el prompt, como en "manteniendo los mismos rasgos faciales y peinado". En OpenArt, el control deslizante de creatividad lo hace, y puedes generar hasta 8 variaciones con distintos valores para ver el rango.
¿Puedo usar fotos de personas reales como referencias?
Solo con su consentimiento. Las políticas de uso de OpenAI prohíben usar la imagen de una persona sin consentimiento, incluida una imagen fotorrealista o su voz, de maneras que puedan confundir a la gente sobre qué es real. Nueva York ahora exige a los anunciantes divulgarlo con claridad cuando usan a sabiendas a un intérprete sintético en un anuncio. La multa es de $1,000 por una primera infracción y $5,000 por cada una posterior. Para cualquier uso comercial de una persona real, obtén los derechos de todos los involucrados, tanto del fotógrafo como del modelo.
¿Qué modelo es el mejor para imagen a imagen?
Depende de la tarea. FLUX Kontext lidera en ediciones locales y preservación de personajes en el benchmark de su creador. GPT Image 2 maneja instrucciones complejas con múltiples imágenes y texto pequeño. Nano Banana Pro lidera en trabajo fotorrealista y acepta más referencias, y Seedream es la opción para anime e ilustración. Los rankings cambian entre tareas, así que pasa tu referencia por GPT Image 2, Nano Banana Pro y Seedream en OpenArt y compara, ya que los tres usan los mismos créditos.
¿Por qué el logotipo de mi producto sale mal?
Porque el modelo reconstruye el logo en lugar de copiarlo. Las pruebas de Photoroom encontraron que la distorsión de logos y texto fue el fallo de precisión más común. La solución es dejar de pedírselo al prompt: genera la escena, luego usa Edición por Área para reparar solo esa región y revísala a simple vista antes de publicar cualquier cosa.
¿Cómo evito que la cara de un personaje cambie entre generaciones?
Deja de volver a subir una referencia y guarda el personaje en su lugar. Créalo una vez en OpenArt Characters a partir de un prompt, una foto o un preajuste. Luego etiqueta ese personaje en cada generación posterior. El modelo parte del mismo punto cada vez en lugar de volver a derivar el rostro de una referencia nueva.
¿Puedo convertir el resultado en un video?
Sí. Una vez que tienes una imagen fija que te gusta, Imagen a Video la anima. OpenArt Director va más allá y crea un video de varias escenas que mantiene los mismos personajes en todas las tomas. Generar primero la imagen fija y animarla después te da más control que describir todo el video en un solo prompt.