Upload a photo, add a prompt, and the model builds a new image that keeps your reference's composition, pose, lighting, or style while changing what you asked it to change.
That is image-to-image generation, and it solves the problem text prompts cannot. Text alone cannot match something that already exists, whether that is your product, your character, your layout, or a look you have spent years refining.
Points clés à retenir
- L'image-vers-image reprend la structure et le style de ta référence au lieu de copier ses pixels. La composition et la pose se transposent de manière fiable. Les détails fins, non.
- Les logos précis et les petits textes sont le point faible, alors prévois des retouches masquées et une vérification humaine plutôt que de te fier à un prompt.
- Chaque modèle excelle sur des tâches différentes, c'est pourquoi faire passer une même référence par deux ou trois modèles vaut mieux que de s'en tenir à un seul.
- Les éditeurs plus récents ont supprimé le curseur de fidélité, donc la préservation passe désormais dans le prompt sous forme d'instruction explicite.
- Importer une référence sur laquelle tu n'as pas de droits est un risque en soi, indépendamment du rendu final.
Qu'est-ce qu'un générateur d'images IA à partir d'une image ?
Un générateur d'images IA à partir d'image, souvent appelé image-vers-image ou img2img, prend deux entrées au lieu d'une : une image de référence et un prompt textuel. Le modèle lit la couleur, la structure, l'éclairage et la pose de la référence au lieu d'en copier les pixels. Puis il construit une nouvelle image, guidée par ton prompt.
Si tu n'as utilisé que le texte-vers-image, la différence saute aux yeux dès qu'il s'agit de contrôle. Un prompt textuel peut décrire « une femme en veste rouge, vue de trois quarts », mais il ne peut pas reproduire une femme précise, une veste précise ou un angle de caméra précis.
Une image de référence, oui. Sur OpenArt, tu télécharges la photo avec ton prompt pour que le rendu conserve ta composition tout en changeant le style, l'ambiance ou les détails.
Image vers image versus texte vers image
Les deux approches reposent sur les mêmes modèles sous-jacents. Elles résolvent des problèmes différents.
| Dimension | Image-to-image | Text-to-image |
|---|---|---|
| Input | Image de référence plus un prompt texte | Prompt texte uniquement |
| Contrôle | Élevée, car la composition et la pose sont ancrées sur la référence | Plus bas, puisque le modèle construit à partir de ta description |
| Consistency | Le même sujet ou la même mise en page sur de nombreuses générations | Chaque génération repart de zéro |
| Idéal pour | Product shots, style transfer, character work, restyling photos | Concepting, exploring, brand-new scenes |
Use text-to-image while you are still exploring and do not know what you want. Use image-to-image once you have the thing already, like a product photo, a character sheet, a sketch, or a layout, and you need versions that stay faithful to it.
Comment fonctionne l'IA image-to-image
Diffusion models handle this by encoding your reference into a compressed form, adding a controlled amount of noise, then using your prompt to guide the cleanup. Hugging Face's own docs put it plainly. A higher strength value gives the model more room to make something different from your reference. At a strength of 1.0, the reference is "more or less ignored."
Le modèle extrait la structure et le style de ta référence. Il reprend fidèlement la composition, la palette de couleurs, la direction de la lumière, la pose et l'angle de caméra. Ce qu'il ne reprend pas de façon fiable, ce sont les détails fins précis.
Photoroom a testé 850 produits de vêtements et d'accessoires sur 3 400 générations en juillet 2026. Le meilleur modèle a passé ses contrôles de précision produit dans 29,0 % des générations. La distorsion des logos ou du texte était l'échec le plus courant, à 20,1 %. Photoroom vend une couche de fidélité produit, il a donc un intérêt dans cette réponse.
The lesson holds even allowing for the source. If your work depends on an exact label or logo, plan on masked edits and a human check, not prompts alone.
Style transfer from a reference image
Style transfer works because the model reads a reference's look separately from its content. Midjourney's documentation puts it well. A style reference "captures the visual vibe of an existing image," meaning its colors, medium, textures, or lighting. It "doesn't copy objects or people."
La même idée s'applique à tous les outils. Ta référence fournit le style et ton prompt fournit le sujet.
Pour conserver un même rendu sur toute une série, enregistre-le au lieu de le réimporter à chaque fois. Le Brand Kit d'OpenArt stocke tes couleurs, polices et références de style au niveau du projet, et OpenArt Characters enregistre une personne que tu peux taguer dans tes images ultérieures.
Maîtriser la fidélité du rendu
Stable Diffusion tools have a strength or denoising slider that sets the balance directly. The math is simple. Multiply strength by inference steps to get the steps you actually run, so strength 0.8 with 50 steps runs 40 steps of change.
En clair, un réglage plus bas garde le résultat proche de la photo que tu as importée et un réglage plus élevé laisse plus de liberté au modèle. L'échelle de Stable Diffusion Art donne un bon repère approximatif : environ 0,2 donne un léger changement, 0,6 un grand changement et 1,0 un très grand changement. Considère les chiffres plus précis que tu vois en ligne comme des valeurs par défaut testées par quelqu'un plutôt que comme des recommandations officielles, et trouve les tiennes.
OpenArt handles this with a creativity slider on image-to-image, from a subtle restyle that stays close to the original to a bold reinterpretation that keeps only the rough composition.
Midjourney uses image weight, written --iw, à la place. Sa doc indique une plage de 0 à 3 avec une valeur par défaut de 1 sur la V8.1, et aucune valeur publiée pour la V8.2 pour l'instant.
Newer instruction-based editors like FLUX.1 Kontext and GPT Image 2 dropped the slider altogether. You control fidelity by writing preservation clauses into the prompt.
Comment générer une image à partir d'une référence, étape par étape
The flow is roughly the same everywhere. Here it is on OpenArt.
- Importe ton image de référence dans le Générateur d'images IA.
- Écris ton prompt. Décris l'image finale que tu veux, pas des instructions pour éditer la référence.
- Pick a model. GPT Image 2 handles complex instructions and small text, Nano Banana Pro suits photoreal work with several references, and Seedream 4.5 is the pick for anime and flat illustration.
- Règle le curseur de créativité. Plus bas, tu restes proche de la référence ; plus haut, tu laisses au modèle plus de liberté pour réinterpréter.
- Generate, compare up to 8 variations, and download the ones you want.
La vitesse dépend du modèle. FLUX.1 Kontext crée une image de 1024 par 1024 en trois à cinq secondes. Nano Banana tourne en moyenne autour de dix secondes selon les mesures de Replicate. OpenAI indique que les prompts GPT Image 2 complexes peuvent prendre jusqu'à deux minutes.
Meilleurs modèles IA pour l'image-vers-image
Aucun modèle ne l'emporte sur toutes les tâches, d'où l'intérêt concret de faire passer une même référence par plusieurs. Parmi les modèles ci-dessous, GPT Image 2, Nano Banana Pro et Seedream puisent dans le pool de crédits partagé d'OpenArt, donc comparer ces trois-là ne revient pas à comparer des abonnements. FLUX, Stable Diffusion et Midjourney nécessitent chacun leur propre compte.
- FLUX (Black Forest Labs). Sur le propre KontextBench de BFL, FLUX.1 Kontext a obtenu les meilleurs scores en édition de texte et en préservation des personnages. C'était le premier modèle conçu pour les modifications multi-tours qui conservent l'identité au fil des changements. BFL est transparent sur cette limite et documente une dégradation visible après six modifications consécutives. La marque oriente désormais les nouveaux projets vers FLUX.2, qui accepte jusqu'à 8 images de référence via l'API.
- GPT Image 2 (OpenAI). Accepte jusqu'à 16 images en entrée par requête d'édition et traite chaque entrée en haute fidélité. Il se place troisième avec 1 256 Elo sur le classement d'édition d'images d'Artificial Analysis. Sur le benchmark académique GEditBench v2, GPT Image 1.5 a obtenu le meilleur score de suivi d'instructions avec 1 260, et Nano Banana Pro a pris la première place au général.
- Nano Banana Pro (Google). Officiellement Gemini 3 Pro Image. Google documente jusqu'à 14 entrées de référence dans un seul prompt, dont 6 peuvent être en haute fidélité, et une ressemblance cohérente pour jusqu'à cinq personnes. Il génère en 4K natif.
- Seedream (ByteDance). The pick for anime, illustration, and poster layouts. Seedream 5.0 Pro blends up to 10 reference images, and Seedream 4.5 has the stronger 2D animation styling.
- Stable Diffusion. Toujours le plus de contrôle manuel si tu le fais tourner toi-même, avec un curseur d'intensité et des guides structurels ControlNet, même si les ControlNets officiels de SD 3.5 ne couvrent que Canny, Depth et Blur, et que les guides de pose ou de croquis viennent de la communauté.
- Midjourney (V8.2). Une esthétique par défaut soignée grâce aux prompts d'image et aux références de style. Sa fonctionnalité Omni Reference tourne encore sur V7, coûte deux fois plus de temps GPU et ne fonctionne pas avec Vary Region, Pan, Zoom Out, Fast Mode ou Draft Mode. Il n'y a pas de version gratuite, et les forfaits démarrent à 10 $ par mois.
Replicate a mené sa propre comparaison en septembre 2025, sur une génération plus ancienne de modèles. Il a constaté que FLUX.1 Kontext et Nano Banana préservaient le mieux la typographie et la texture dans les édits de texte, et que Nano Banana et Seedream surpassaient Kontext sur le transfert de style. Teste ta propre référence avant de dépenser des crédits sur un lot.
Top use cases
L'image-vers-image trouve sa place partout où le résultat doit correspondre à quelque chose qui existe déjà.
- Transfert de style. Applique un style pictural, un rendu cinéma ou une esthétique de marque à une photo que tu as déjà.
- Product photography. Transforme une photo prise au téléphone en un shot éclairé comme en studio sur une nouvelle surface, en préservant la forme du produit.
- Conversion en anime et en illustration. Turn portraits into anime, illustration, or comic styles while keeping identity and pose.
- Cohérence des personnages. Garde le même visage, la même tenue et les mêmes proportions sur des dizaines de générations.
- Merging references. Fusionne plusieurs entrées en une seule sortie, avec Nano Banana Pro qui en accepte jusqu'à 14 et FLUX.2 jusqu'à 8.
- Image vers vidéo. Use a finished frame as the first frame of a clip.
Character consistency across outputs
La dérive d'identité est le principal problème du travail basé sur une référence. Le même visage revient subtilement différent à chaque génération, et à la dixième image le personnage est devenu discrètement quelqu'un d'autre.
Personnages OpenArt gère la dérive en faisant du personnage un asset enregistré plutôt qu'une référence propre à chaque prompt. Crée le personnage une seule fois à partir d'un prompt, d'une photo de référence ou d'un préréglage. Ensuite, tague ce même personnage dans n'importe quelle image ou vidéo ultérieure, y compris des scènes dans OpenArt Director, l'outil vidéo multi-scènes.
That difference matters more than any benchmark number. A reference image asks the model to re-derive the face every time, while a saved character gives it the same starting point every time.
Prompt engineering for image-to-image
Chaque éditeur actuel comprend le langage naturel plutôt que des mots-clés. Les mêmes règles valent pour FLUX, GPT Image et Gemini. Décris l'image finale que tu veux, pas les modifications à apporter.
State plainly what must be preserved, and pick precise verbs. Black Forest Labs makes the point directly in its prompting guide: "transform" implies a complete change, while "change the clothes" or "replace the background" gives you control over what actually changes.
For anime conversion, name the target look and lock the identity: "create a 2D anime illustration with clean lineart and cel shading, preserve the person's facial identity, hairstyle, pose, and framing, change only the rendering style."
Pour les restylages photoréalistes, ajoute des limites strictes sur le cadrage et l'arrière-plan. Le propre guide de prompting d'OpenAI recommande d'énoncer les exclusions explicitement, avec des formules comme « pas d'éléments supplémentaires », pour empêcher le modèle de dériver.
For product work, Google's published template is worth borrowing whatever model you use. It names the lighting setup, the camera angle, the background surface, and the detail that must stay sharp.
When you are replacing text or a logo, quote it. The documented FLUX Kontext pattern is: Replace "[original text]" with "[new text]".
Fixing the result without starting over
The first generation is rarely the last. Starting over wastes credits when only one region is wrong. On OpenArt the common fixes stay on the same canvas.
- Modifications par région. Edit Image's Area Edit mode lets you highlight one spot and change only that area.
- Fill and removal. Generative AI Fill fills a gap, removes an object, or extends the frame.
- Frame changes. Expand Image élargit le canevas à n'importe quel format ou preset social.
- Arrière-plans. Le suppresseur d'arrière-plan IA offre un détourage net, et le changeur d'arrière-plan IA remplace la scène.
- Faces. The AI Face Editor handles expression changes and retouching.
- Upscaling. Le agrandisseur d'image runs in Precise, Refined, or Creative mode, and the Vellum Skin Enhancer goes to 8K when skin texture matters.
Chacune de ces corrections s'effectue sur le même canvas, avec le modèle utilisé pour la génération. Sur Midjourney, l'édition par région se fait sur Discord après un upscale, avec une version plus ancienne du modèle.
Commercial use, copyright, and ownership
Start with the baseline. The U.S. Copyright Office's January 2025 report says AI output can be protected "only where a human author has determined sufficient expressive elements." That covers three cases. Your own work is visible in the output, or you arrange the output creatively, or you modify it creatively. Prompts on their own do not count.
Concrètement, une image purement générée par prompt n'a pas de droit d'auteur, et ce sont tes propres retouches et ta composition qui lui en confèrent un.
Les conditions de la plateforme s'ajoutent par-dessus, et elles varient beaucoup. OpenArt ne revendique aucune propriété ni droit d'auteur sur tes créations. Les droits commerciaux s'appliquent sur les forfaits payants éligibles, sans redevances ni mention obligatoire. Les conditions grand public et pro d'OpenAI t'attribuent les droits sur les créations, tant que tu détenais les droits sur tes éléments d'entrée et que tu as respecté les règles d'usage. Midjourney exige un forfait Pro ou Mega avant qu'une entreprise dépassant 1 M$ de revenus annuels, ou l'un de ses employés, possède ses actifs.
Deux risques concernent spécifiquement le travail avec image de référence.
Importer une photo protégée sur laquelle tu n'as pas de droits peut poser problème en soi, quel que soit le rendu. Et publier une création qui finit par ressembler nettement à une œuvre protégée expose à une plainte, même sans intention.
Le IP Safety Check analyse ton rendu avant publication, à la recherche de similitudes avec des marques, de visages célèbres et de risques de ressemblance. Un résultat vert signifie que rien n'a été détecté, un avertissement signifie que quelqu'un devrait y jeter un œil, et « non sûr » signale une ressemblance significative. OpenArt précise que les résultats sont informatifs, alors considère un résultat vert comme un filtrage plutôt qu'une validation juridique.
Forfaits et crédits
OpenArt runs on one credit pool covering its image, video, and audio models. You can start free with 40 credits over 7 days and no card, plus a daily free credit allowance for basic image generation after that.
| Plan | Mensuel | Crédits par mois |
|---|---|---|
| Starter | $14 | 4,000 |
| Plus | $34 | 12,000 |
| Pro | $56 | 24,000 |
| Wonder | $240 | 106,000 |
Ces montants correspondent à la facturation mensuelle. La facturation annuelle réduit chaque forfait, jusqu'à 27 % d'économie, et tous les forfaits payants exportent sans filigrane. Les crédits de base se réinitialisent chaque mois, et le pack Extra Credit à 15 $ ajoute environ 5 000 crédits qui, eux, sont reportés.
Kit de marque is worth setting up if you generate for a brand. It saves your logo, exact hex codes, fonts, product assets, style references, and brand rules at the project level, so a batch of references comes out consistent no matter which model you pick.
Pour commencer
The fastest way to judge image-to-image is to run your own reference through it.
- Ouvre le générateur d'images OpenArt et importe ta photo de référence.
- Écris un prompt décrivant l'image finale, et précise ce qui doit rester identique.
- Pick a model, set the creativity slider, and generate.
- Compare les variations, puis corrige ce qui est presque bon avec Area Edit ou l'upscaler.
- If the same character has to appear again later, build it once in Characters and tag it in future prompts.
FAQ
Quels formats et tailles de fichiers puis-je importer comme référence ?
La plupart des plateformes acceptent les formats web courants avec leurs propres limites de taille. Midjourney accepte les .png, .gif, .webp, .jpg et .jpeg jusqu'à 10 Mo. Quel que soit l'outil, une référence nette et bien éclairée, proche de ta résolution cible, donne le meilleur résultat, car le modèle ne peut pas récupérer un détail que ta référence n'a jamais eu.
Comment contrôler la fidélité du résultat par rapport à ma référence ?
Ça dépend de l'outil. Sur les outils Stable Diffusion, baisse le curseur d'intensité. Sur Midjourney, augmente-le --iw vers 3. FLUX Kontext et GPT Image 2 n'ont pas de curseur. Intègre plutôt la préservation dans le prompt, comme dans « en conservant les mêmes traits du visage et la même coiffure ». Sur OpenArt, le curseur de créativité s'en charge, et tu peux générer jusqu'à 8 variations à différents réglages pour voir l'éventail.
Can I use photos of real people as references?
Only with their consent. OpenAI's usage policies bar using someone's likeness without consent, including a photorealistic image or voice, in ways that could confuse people about what is real. New York now asks advertisers to disclose it clearly when they knowingly use a synthetic performer in an ad. The penalty is $1,000 for a first violation and $5,000 for each one after. For any commercial use of a real person, get rights from everyone involved, the photographer as well as the model.
Quel modèle est le meilleur pour l'image-à-image ?
Ça dépend de la tâche. FLUX Kontext excelle sur les retouches locales et la préservation des personnages selon le benchmark de son créateur. GPT Image 2 gère les instructions multi-images complexes et les petits textes. Nano Banana Pro domine sur le rendu photoréaliste et accepte le plus de références, et Seedream est le choix pour l'anime et l'illustration. Les classements changent selon les tâches, alors passe ta référence dans GPT Image 2, Nano Banana Pro et Seedream sur OpenArt et compare, puisque ces trois-là puisent dans les mêmes crédits.
Pourquoi le logo de mon produit sort-il déformé ?
Parce que le modèle reconstruit le logo au lieu de le copier. Les tests de Photoroom ont révélé que la distorsion des logos et des textes était l'erreur de précision la plus courante. La solution est d'arrêter de demander ça au prompt : génère la scène, puis utilise Area Edit pour réparer uniquement cette zone, et vérifie à l'œil avant toute publication.
How do I stop a character's face drifting between generations?
Arrête de réimporter une référence et enregistre plutôt ton personnage. Crée-le une seule fois dans OpenArt Characters à partir d'un prompt, d'une photo ou d'un préréglage. Puis tague ce personnage dans chacune de tes générations. Le modèle repart toujours du même point au lieu de reconstruire le visage depuis une nouvelle référence.
Puis-je transformer le résultat en vidéo ?
Yes. Once you have a still you like, Image to Video animates it. OpenArt Director goes further and builds a multi-scene video that keeps the same characters across shots. Generating the still first and animating it second gives you more control than describing the whole video in one prompt.