Maîtrise de la génération visuelle par IA : Stratégies avancées pour les prompts en texte et image-vidéo

Les raisons pour lesquelles un prompt parfait ne produit pas le résultat attendu

  • Absence de négatifs : L'absence de mots-clés négatifs augmente exponentiellement les risques de dérive visuelle.
  • Préférence du modèle pour les images de référence : Le modèle interprète d'abord l'image fournie, puis le texte — ce qui peut altérer l'intention initiale.
  • Interprétation séquentielle en vidéo : Les éléments directionnels, temporels et spatiaux sont réévalués entre chaque cadre, introduisant des incohérences si mal encadrés.

Pourquoi privilégier les prompts en anglais ?

Utiliser l’anglais pour les prompts assure une meilleure stabilité, principalement à cause de trois facteurs :

  • Découpage token plus précis : Les modèles comme Seedream 4.5 utilisent des outils comme CLIP ou Tokenizer. L’anglais, avec ses espaces naturels, se découpe clairement en tokens. En revanche, le chinois est souvent divisé en fragments de 1 à 3 caractères, entraînant une perte de sémantique. Avec 75 tokens, l’anglais peut contenir 60 concepts utiles contre seulement 30 environ en chinois, provoquant des troncatures.
  • Corpus d’apprentissage dominé par l’anglais : La majorité des jeux de données open-source (LAION-5B, Pixar, 3D-cartoon) utilisent des annotations anglaises. Des termes comme rim light, depth of field ou subsurface scattering sont fortement ancrés dans le modèle. Traduits en chinois (lumière de contour, profondeur de champ), leur poids diminue, affectant la qualité de sortie.
  • Communauté bien documentée : Sur Civitai, Discord ou Hugging Face, plus de 90 % des exemples de haute qualité pour Seedream 4.5 utilisent des prompts en anglais.

Si vous préférez le chinois, adaptez votre style :

  • Divisez les phrases longues en segments courts, utilisez des points-virgules ou des sauts de ligne au lieu de virgules multiples.
  • Maintenez les termes techniques en anglais (ou mixez langues) : soft rim-light, pastel palette — cela permet au modèle d’accéder à des poids élevés dans les deux langues.

Structure des prompts positifs et négatifs

Le couple positif/négatif est essentiel pour contrôler la sortie :

  • Positif : Ce que vous voulez voir.
  • Négatif : Ce que vous ne voulez pas.

Un prompt sans négatif laisse le modèle libre d’imiter les défauts fréquents du jeu de données d’entraînement : doigts supplémentaires, sur-exposition, filigranes. Le négatif agit comme un correctif inverse, nettoyant immédiatement la sortie.

3 axes fondamentaux pour les négatifs

  1. Erreurs structurelles : extra limbs, extra fingers, deformed hands, twisted anatomy, long neck
  2. Problèmes de qualité visuelle : lowres, blurry, overexposed, noisy, jpeg artifacts
  3. Contamination par des éléments indésirables : watermark, text, logo, signature, username, border, frame

Contrôle des poids

  • Renforcer : (extra fingers:1.3) → punition accrue de 30 %.
  • Atténuer : (blurry:0.8) → tolérance accrue de 20 %, utile pour des effets de flou intentionnels.
  • Suppression globale : (no distorted perspective:1.2) → élimine systématiquement les distorsions de perspective.

Règle simple : >1 = intensification du rejet ; <1 = atténuation du rejet.

Formule en 3 étapes pour la génération d’image

Sujet + Matériau/Style + Lumière + Composition + Résolution + Négatifs

  1. Sujet : Combinez adjectifs + nom (jusqu’à 3 niveaux). Exemple : a futuristic cyberpunk male pilot.
  2. Matériau / Style : Donnez directement une référence stylistique. Exemple : cel-shaded, 8-bit pixel art, oil painting, Studio Ghibli style.
  3. Lumière : Précisez les sources lumineuses. Exemple : rim light from behind, 45° warm key light.
  4. Composition : Définissez la caméra en une phrase. Exemple : medium shot, low-angle, rule of thirds.
  5. Résolution : Alignez-vous avec les normes de la plateforme. Exemple : 4K, 8K, 300 dpi.
  6. Négatifs : Bloquez les artefacts indésirables. Exemple : low-res, extra limbs, text, watermark, distortedd.

Contrôle en 5 dimensions pour la génération vidéo à partir d’image

  1. Durée = budget motion : Pour une caméra lentement glissante, allouez 6 secondes minimum. Moins de 5 s, le modèle optimise et perd en fluidité.
  2. Image de départ fidèle : Utilisez une image validée comme référence. Cela verrouille le contexte initial.
  3. Actions clés découpées par tranche : Découpez les mouvements en intervalles : 0–1 s, 1–3 s, 3–6 s. Évitez les descriptions continues.
  4. Repères spatiaux précis : Utilisez camera-left ou camera-right, plutôt que left seul, pour éviter toute ambiguïté avec la perspective du spectateur.
  5. Négatifs renforcés : Incluez shaking, flash, morphing, cut transitions dans les négatifs. Cela améliore la stabilité des cadres consécutifs de 40 %.

Exemple complet de prompt

Génération d’image

Positive: a boy, cowboy shot, silver hair, leather jacket, city night, neon reflections, cinematic lighting, ultra-detailed, 8K, anatomically correct hands, perfect proportions, clean image without any watermark or text
Negative: extra limbs, extra fingers, deformed, long neck, blurry, lowres, jpeg artifacts, watermark, text, logo, cropped, worst quality, duplicate hands, mutated anatomy

Génération vidéo à partir d’image

Positive: starting from the exact frame: silver-haired boy in leather jacket stands in neon-soaked alley, slow dolly-in 15% + 5° upward tilt, subtle wind lifts her hair, glowing particles drift, background bokeh pulses twice, 24 fps, cinematic depth of field, smooth stabilization, ultra-detailed, 4K, ProRes 422, 8-second clip, no cut, no transition
Negative: extra limbs, jerky motion, sudden zoom, frame tear, overexposure flicker, morphing anatomy, watermark, text, logo, jump cut, motion blur artifact

Questions fréquentes

Commencez par remplir le négatif, puis appuyez sur Entrée pour valider.

Comparaison visuelle

Deux séries d’images générées avec le même prompt : une version complète (positif + négatif), une autre avec seulement le positif. La première montre une composition cohérente, des couleurs riches, des mains anatomiquement justes. La seconde présente des défauts fréquents : arrière-plan terne, doigts supplémentaires, absence de détail vestimentaire (ex. casquette manquante).

Références

  • [1] Sohu Tech. Comparaison pratique : questions en chinois vs anglais, quelle réponse est meilleure ? (2023-05-29). [En ligne]. Disponible à : https://m.sohu.com/a/718464295_104036.

Outils utiles

Mise à jour : 11 janvier 2026 | Version : v1.0 | Catégorie : Blog technique | Mots-clés : IA image, IA vidéo, ingénierie de prompts, AIGC, génération contrôlée, Runway, Stable Diffusion, Seedream 4.5

Étiquettes: Seedream 4.5 Runway Stable Diffusion Prompt Engineering AIGC

Publié le 7 septembre à 18h35