Envie uma foto, adicione um prompt, e o modelo cria uma nova imagem que mantém a composição, a pose, a iluminação ou o estilo da sua referência, enquanto muda o que você pediu.
Isso é geração de imagem para imagem, e resolve um problema que os prompts de texto não conseguem. Só o texto não consegue reproduzir algo que já existe, seja o seu produto, seu personagem, seu layout ou um estilo que você levou anos aperfeiçoando.
Principais destaques
- O image-to-image lê a estrutura e o estilo da sua referência em vez de copiar seus pixels. Composição e pose são transferidas de forma confiável. Os detalhes finos não.
- Logotipos exatos e textos pequenos são o ponto fraco, então conte com edições mascaradas e uma verificação humana em vez de confiar em um prompt.
- Modelos diferentes vencem em tarefas diferentes, e é por isso que rodar uma referência em dois ou três supera apostar em um só.
- Os editores mais novos abandonaram o controle de fidelidade, então agora a preservação vai no prompt como uma instrução explícita.
- Enviar uma referência sobre a qual você não tem direitos é um risco à parte, separado da aparência do resultado.
O que é um gerador de imagem por IA a partir de imagem?
Um gerador de imagens por IA a partir de imagem, geralmente chamado de image-to-image ou img2img, recebe duas entradas em vez de uma: uma imagem de referência e um prompt de texto. O modelo lê cor, estrutura, iluminação e pose da referência em vez de copiar seus pixels. Depois, ele cria uma nova imagem, guiada pelo seu prompt.
Se você só usou texto para imagem, a diferença aparece de cara na quantidade de controle que você tem. Um prompt de texto pode descrever "uma mulher de jaqueta vermelha, vista de três quartos", mas não pode reproduzir uma mulher específica, uma jaqueta específica ou um ângulo de câmera específico.
Uma imagem de referência pode. No OpenArt você envia a foto junto com o prompt para que o resultado mantenha sua composição enquanto o estilo, o clima ou os detalhes mudam.
Image-to-image versus text-to-image
Ambas as abordagens usam os mesmos modelos por trás. Elas resolvem problemas diferentes.
| Dimensão | Imagem para imagem | Texto para imagem |
|---|---|---|
| Entrada | Imagem de referência mais um prompt de texto | Apenas prompt de texto |
| Controle | Alta, já que a composição e a pose estão ancoradas na referência | Menor, já que o modelo constrói a partir da sua descrição |
| Consistência | O mesmo sujeito ou layout em várias gerações | Toda geração começa do zero |
| Ideal para | Fotos de produto, transferência de estilo, trabalho com personagens, reestilização de fotos | Concepção, exploração, cenas totalmente novas |
Use texto para imagem enquanto você ainda está explorando e não sabe o que quer. Use imagem para imagem quando já tem o material em mãos, como uma foto de produto, uma ficha de personagem, um esboço ou um layout, e precisa de versões fiéis a ele.
Como funciona a IA de image-to-image
Os modelos de difusão lidam com isso codificando sua referência em uma forma compactada, adicionando uma quantidade controlada de ruído e usando seu prompt para guiar a limpeza. A própria documentação da Hugging Face explica de forma direta. Um valor de intensidade mais alto dá ao modelo mais liberdade para criar algo diferente da sua referência. Com intensidade 1.0, a referência é "mais ou menos ignorada".
O modelo extrai a estrutura e o estilo da sua referência. Ele transfere de forma confiável a composição, a paleta de cores, a direção da iluminação, a pose e o ângulo de câmera. O que ele não transfere de forma confiável são os detalhes finos exatos.
A Photoroom testou 850 produtos de vestuário e acessórios em 3.400 gerações em julho de 2026. O melhor modelo passou nas verificações de precisão de produto em 29,0% das gerações. A distorção de logotipo ou texto foi a falha mais comum, com 20,1%. A Photoroom vende uma camada de fidelidade de produto, então tem interesse nessa resposta.
A lição vale mesmo levando em conta a fonte. Se o seu trabalho depende de um rótulo ou logotipo exato, conte com edições mascaradas e uma checagem humana, não apenas com prompts.
Transferência de estilo a partir de uma imagem de referência
A transferência de estilo funciona porque o modelo lê a aparência de uma referência separadamente do seu conteúdo. A documentação do Midjourney explica bem. Uma referência de estilo "captura o clima visual de uma imagem existente", ou seja, suas cores, meio, texturas ou iluminação. Ela "não copia objetos ou pessoas".
A mesma ideia se aplica a todas as ferramentas. Sua referência fornece o visual e seu prompt fornece o sujeito.
Para manter um visual em um lote, salve-o em vez de fazer upload toda vez. O Brand Kit da OpenArt armazena suas cores, fontes e referências de estilo no nível do projeto, e o OpenArt Characters armazena uma pessoa que você pode marcar em imagens futuras.
Controle da fidelidade da saída
As ferramentas do Stable Diffusion têm um controle de força ou de denoising que define esse equilíbrio diretamente. A matemática é simples. Multiplique a força pelos passos de inferência para obter os passos que realmente são executados, então força 0,8 com 50 passos roda 40 passos de alteração.
Em termos simples, um valor mais baixo mantém o resultado próximo da foto que você enviou e um mais alto dá ao modelo mais liberdade. A escala do Stable Diffusion Art é um bom guia aproximado: cerca de 0,2 gera uma pequena mudança, 0,6 uma grande e 1,0 uma mudança muito grande. Trate quaisquer números mais específicos que você veja online como padrões testados por alguém, e não como orientação oficial, e encontre os seus próprios.
A OpenArt resolve isso com um controle deslizante de criatividade no image-to-image, indo de um restyle sutil que fica próximo do original a uma reinterpretação ousada que mantém apenas a composição geral.
O Midjourney usa peso de imagem, escrito --iw, em vez disso. A documentação lista um intervalo de 0 a 3 com padrão 1 na V8.1, e ainda não há valores publicados para a V8.2.
Editores mais novos baseados em instruções, como FLUX.1 Kontext e GPT Image 2, abandonaram o controle deslizante de vez. Você controla a fidelidade escrevendo cláusulas de preservação no prompt.
Como gerar uma imagem a partir de uma referência, passo a passo
O fluxo é mais ou menos o mesmo em qualquer lugar. Veja como fica na OpenArt.
- Faça upload da sua imagem de referência no Gerador de imagens com IA.
- Escreva seu prompt. Descreva a imagem final que você quer, não instruções para editar a referência.
- Escolha um modelo. O GPT Image 2 lida com instruções complexas e textos pequenos, o Nano Banana Pro é ideal para trabalhos fotorrealistas com várias referências, e o Seedream 4.5 é a escolha para anime e ilustração flat.
- Ajuste o controle de criatividade. Valores mais baixos mantêm você próximo da referência e valores mais altos dão ao modelo espaço para reinterpretar.
- Gere, compare até 8 variações e baixe as que você quiser.
A velocidade depende do modelo. O FLUX.1 Kontext cria uma imagem de 1024 por 1024 em três a cinco segundos. O Nano Banana leva cerca de dez segundos, segundo as medições da Replicate. A OpenAI diz que prompts complexos do GPT Image 2 podem levar até dois minutos.
Melhores modelos de IA para imagem para imagem
Nenhum modelo sozinho vence em todas as tarefas, o que é o argumento prático para rodar uma referência em vários. Dos modelos abaixo, GPT Image 2, Nano Banana Pro e Seedream rodam no pool de créditos compartilhado da OpenArt, então comparar esses três não significa comparar assinaturas. FLUX, Stable Diffusion e Midjourney precisam cada um da sua própria conta.
- FLUX (Black Forest Labs). No próprio KontextBench da BFL, o FLUX.1 Kontext teve a pontuação mais alta em edição de texto e preservação de personagem. Foi o primeiro modelo construído para edições em múltiplas etapas que mantêm a identidade ao longo das mudanças. A BFL é franca sobre o limite e documenta degradação visível após seis edições seguidas. Agora ela direciona novos projetos para o FLUX.2, que aceita até 8 imagens de referência via API.
- GPT Image 2 (OpenAI). Aceita até 16 imagens de entrada por solicitação de edição e processa cada entrada com alta fidelidade. Ocupa a terceira posição, com 1.256 de Elo, no ranking de edição de imagem da Artificial Analysis. No GEditBench v2 acadêmico, o GPT Image 1.5 registrou a melhor pontuação em seguir instruções, com 1.260, e o Nano Banana Pro ficou em primeiro no geral.
- Nano Banana Pro (Google). Oficialmente Gemini 3 Pro Image. O Google documenta até 14 entradas de referência em um único prompt, das quais 6 podem ser de alta fidelidade, e semelhança consistente para até cinco pessoas. Ele gera em 4K nativo.
- Seedream (ByteDance). A escolha ideal para anime, ilustração e layouts de pôster. O Seedream 5.0 Pro combina até 10 imagens de referência, e o Seedream 4.5 tem o estilo de animação 2D mais forte.
- Stable Diffusion. Ainda é o controle mais manual se você mesmo executar, com um controle deslizante de intensidade e guias estruturais do ControlNet, embora os ControlNets oficiais do SD 3.5 cubram apenas Canny, Depth e Blur, e os guias de pose ou esboço venham da comunidade.
- Midjourney (V8.2). Estética padrão forte por meio de prompts de imagem e referências de estilo. O recurso Omni Reference ainda roda na V7, custa o dobro de tempo de GPU e não funciona com Vary Region, Pan, Zoom Out, Fast Mode ou Draft Mode. Não há um plano gratuito, e os planos começam em US$ 10 por mês.
A Replicate fez sua própria comparação em setembro de 2025, com uma geração mais antiga de modelos. Ela concluiu que o FLUX.1 Kontext e o Nano Banana preservaram melhor a tipografia e a textura em edições de texto, e que o Nano Banana e o Seedream superaram o Kontext em transferência de estilo. Teste sua própria referência antes de gastar créditos em um lote.
Principais casos de uso
O image-to-image se destaca sempre que o resultado precisa combinar com algo que já existe.
- Transferência de estilo. Aplique um estilo de pintura, um visual de cinema ou uma estética de marca a uma foto que você já tem.
- Fotografia de produto. Transforme uma foto de celular em uma imagem com iluminação de estúdio sobre uma nova superfície, mantendo o formato do produto intacto.
- Conversão para anime e arte. Transforme retratos em estilos anime, ilustração ou HQ mantendo a identidade e a pose.
- Consistência de personagem. Mantenha o mesmo rosto, roupa e proporções ao longo de dezenas de gerações.
- Combinar referências. Combine várias entradas em uma única saída, com o Nano Banana Pro aceitando até 14 e o FLUX.2 até 8.
- Imagem para vídeo. Use um quadro finalizado como o primeiro quadro de um clipe.
Consistência de personagem entre os resultados
O desvio de identidade é a maior falha no trabalho baseado em referência. O mesmo rosto volta sutilmente diferente a cada geração, e na décima imagem o personagem já virou outra pessoa sem você perceber.
Personagens da OpenArt lida com o desvio transformando o personagem em um ativo salvo em vez de uma referência por prompt. Crie o personagem uma vez a partir de um prompt, uma foto de referência ou um preset. Depois marque esse mesmo personagem em qualquer imagem ou vídeo posterior, incluindo cenas no OpenArt Director, a ferramenta de vídeo com várias cenas.
Essa diferença importa mais do que qualquer número de benchmark. Uma imagem de referência pede que o modelo recrie o rosto toda vez, enquanto um personagem salvo dá a ele o mesmo ponto de partida sempre.
Prompt engineering for image-to-image
Todos os editores atuais usam linguagem natural em vez de tags de palavras-chave. As mesmas regras valem para FLUX, GPT Image e Gemini. Descreva a imagem final que você quer, não as edições que você quer fazer.
Deixe claro o que precisa ser preservado e escolha verbos precisos. A Black Forest Labs vai direto ao ponto em seu guia de prompts: "transformar" implica uma mudança completa, enquanto "trocar as roupas" ou "substituir o fundo" te dá controle sobre o que realmente muda.
Para conversão em anime, indique o visual desejado e trave a identidade: "crie uma ilustração de anime 2D com lineart limpo e sombreamento cel, preserve a identidade facial da pessoa, o penteado, a pose e o enquadramento, mude apenas o estilo de renderização."
Para reestilizações fotorrealistas, adicione limites rígidos de enquadramento e fundo. O próprio guia de prompting da OpenAI recomenda declarar exclusões explicitamente, incluindo frases como "sem elementos extras", para impedir que o modelo se desvie.
Para trabalhos com produtos, vale a pena aproveitar o modelo publicado pelo Google, seja qual for o modelo que você use. Ele especifica a configuração de iluminação, o ângulo da câmera, a superfície de fundo e o detalhe que precisa ficar nítido.
Quando estiver substituindo texto ou um logo, coloque-o entre aspas. O padrão documentado do FLUX Kontext é: Replace "[original text]" with "[new text]".
Corrigir o resultado sem começar do zero
A primeira geração raramente é a última. Recomeçar do zero desperdiça créditos quando só uma região está errada. No OpenArt, os ajustes mais comuns acontecem no mesmo canvas.
- Edições por região. O modo Editar Área da opção Editar Imagem permite destacar um ponto e alterar somente aquela área.
- Preenchimento e remoção. O Generative AI Fill preenche uma lacuna, remove um objeto ou expande o quadro.
- O quadro muda. O Expand Image amplia a tela para qualquer proporção ou predefinição para redes sociais.
- Fundos. O Removedor de Fundo com IA gera um recorte limpo, e o Trocador de Fundo com IA muda a cena.
- Rostos. O AI Face Editor cuida de mudanças de expressão e retoques.
- Upscaling. O upscaler de imagem roda nos modos Preciso, Refinado ou Criativo, e o Vellum Skin Enhancer chega a 8K quando a textura da pele importa.
Cada uma dessas correções roda na mesma tela, com o modelo que você usou para gerar. No Midjourney, a edição de região acontece no Discord após um upscale, usando uma versão mais antiga do modelo.
Uso comercial, direitos autorais e propriedade
Comece pelo básico. O relatório de janeiro de 2025 do U.S. Copyright Office diz que o resultado de IA pode ser protegido "apenas quando um autor humano determinou elementos expressivos suficientes". Isso abrange três casos. Seu próprio trabalho está visível no resultado, ou você organiza o resultado de forma criativa, ou você o modifica de forma criativa. Prompts sozinhos não contam.
Na prática, isso significa que uma imagem gerada apenas por prompt não tem direitos autorais, e são suas próprias edições e sua organização que os conquistam.
Os termos da plataforma vêm por cima disso, e variam bastante. O OpenArt não faz nenhuma reivindicação de propriedade ou direitos autorais sobre o seu resultado. Os direitos comerciais se aplicam em planos pagos elegíveis, sem royalties e sem exigência de crédito. Os termos de consumidor e empresarial da OpenAI atribuem os direitos do resultado a você, desde que você tivesse os direitos sobre suas entradas e seguisse as políticas de uso. O Midjourney exige um plano Pro ou Mega para que uma empresa com mais de US$1 milhão de receita anual, ou um funcionário dela, seja dono dos ativos.
Dois riscos se aplicam especificamente ao trabalho com imagens de referência.
Enviar uma foto protegida por direitos autorais sobre a qual você não tem direitos pode ser um problema por si só, seja qual for a aparência do resultado. E publicar um resultado que acabe sendo substancialmente semelhante a uma obra protegida convida a uma reclamação mesmo quando ninguém teve essa intenção.
O Verificação de segurança de PI analisa o resultado antes de você publicar, procurando por semelhança com marcas, rostos famosos e risco de imagem. Um resultado verde significa que nada foi detectado, um alerta significa que alguém deveria dar uma olhada, e inseguro significa semelhança relevante. A OpenArt afirma que os resultados são informativos, então trate um resultado verde como uma triagem, não como aval jurídico.
Planos e créditos
O OpenArt funciona com um único pool de créditos que cobre seus modelos de imagem, vídeo e áudio. Você pode começar de graça com 40 créditos por 7 dias e sem cartão, além de um limite diário de créditos gratuitos para geração básica de imagens depois disso.
| Plano | Mensal | Créditos por mês |
|---|---|---|
| Starter | $14 | 4,000 |
| Plus | $34 | 12,000 |
| Pro | $56 | 24,000 |
| Maravilhe-se | $240 | 106,000 |
Esses valores são para cobrança mensal. A cobrança anual reduz cada plano, economizando até 27%, e todo plano pago exporta sem marca d'água. Os créditos base são renovados mensalmente, e o Pacote de Créditos Extras de US$15 adiciona cerca de 5.000 créditos que são acumulados.
Brand Kit vale a pena configurar se você gera conteúdo para uma marca. Ele salva seu logo, códigos hex exatos, fontes, assets de produto, referências de estilo e regras da marca no nível do projeto, então um lote de referências sai consistente independentemente do modelo que você escolher.
Primeiros passos
A maneira mais rápida de avaliar o image-to-image é rodar sua própria referência por ele.
- Abra o gerador de imagem do OpenArt e envie sua foto de referência.
- Escreva um prompt descrevendo a imagem final e diga o que deve permanecer igual.
- Escolha um modelo, ajuste o controle de criatividade e gere.
- Compare as variações e depois ajuste o que estiver quase pronto com o Area Edit ou o upscaler.
- Se o mesmo personagem precisar aparecer de novo mais tarde, crie-o uma vez em Personagens e marque-o nos prompts futuros.
Perguntas Frequentes
Quais formatos e tamanhos de arquivo posso enviar como referência?
A maioria das plataformas aceita os formatos web comuns, com seus próprios limites de tamanho. O Midjourney aceita .png, .gif, .webp, .jpg e .jpeg até 10 MB. Seja qual for a ferramenta, uma referência nítida e bem iluminada, próxima da resolução desejada, dá o melhor resultado, porque o modelo não consegue recuperar detalhes que sua referência nunca teve.
Como controlo o quão fielmente o resultado corresponde à minha referência?
Depende da ferramenta. Nas ferramentas Stable Diffusion, reduza o controle de intensidade. No Midjourney, aumente --iw em direção a 3. O FLUX Kontext e o GPT Image 2 não têm controle deslizante. Em vez disso, escreva a preservação no prompt, como em "mantendo os mesmos traços faciais e o mesmo penteado." No OpenArt, o controle de criatividade faz isso, e você pode gerar até 8 variações com diferentes ajustes para ver a variação.
Posso usar fotos de pessoas reais como referência?
Somente com o consentimento delas. As políticas de uso da OpenAI proíbem usar a imagem de alguém sem consentimento, incluindo uma imagem ou voz fotorrealista, de formas que possam confundir as pessoas sobre o que é real. Nova York agora exige que anunciantes divulguem claramente quando usam intencionalmente um artista sintético em um anúncio. A penalidade é de US$ 1.000 pela primeira infração e US$ 5.000 por cada uma depois. Para qualquer uso comercial de uma pessoa real, obtenha os direitos de todos os envolvidos, tanto do fotógrafo quanto do modelo.
Qual modelo é melhor para imagem para imagem?
Depende da tarefa. O FLUX Kontext lidera em edições locais e preservação de personagem no benchmark de seu criador. O GPT Image 2 lida com instruções complexas de várias imagens e textos pequenos. O Nano Banana Pro lidera em trabalhos fotorrealistas e aceita mais referências, e o Seedream é a escolha para anime e ilustração. Os rankings mudam conforme a tarefa, então passe sua referência pelo GPT Image 2, Nano Banana Pro e Seedream no OpenArt e compare, já que esses três usam os mesmos créditos.
Por que o logotipo do meu produto sai errado?
Porque o modelo reconstrói o logo em vez de copiá-lo. Os testes da Photoroom descobriram que a distorção de logo e texto era a falha de precisão mais comum. A solução é parar de pedir isso ao prompt: gere a cena, depois use o Area Edit para reparar só aquela região, e confira a olho antes de publicar qualquer coisa.
Como evito que o rosto de um personagem mude entre as gerações?
Pare de refazer o upload de uma referência e salve o personagem. Crie-o uma vez no OpenArt Characters a partir de um prompt, uma foto ou um preset. Depois marque esse personagem em cada geração posterior. O modelo parte sempre do mesmo ponto em vez de reconstruir o rosto a partir de uma referência nova.
Posso transformar o resultado em vídeo?
Sim. Assim que tiver uma imagem estática que você gostou, o Image to Video a anima. O OpenArt Director vai além e cria um vídeo com várias cenas mantendo os mesmos personagens em todas as tomadas. Gerar primeiro a imagem estática e animar depois dá muito mais controle do que descrever o vídeo inteiro em um único prompt.