Qwen-Image-Edit-Rapid-AIO est une solution open source conçue pour ComfyUI, intégrant des composants optimisés du modèle Qwen dédié à l’édition d’images. Ce projet propose plusieurs versions (v1 à v23), chacune affinée pour permettre une génération rapide — souvent en seulement 4 étapes — tout en garantissant une haute qualité visuelle.
Fonctionnalités clés
- Génération ultra-rapide : jusqu’à 4 pas suffisent pour produire des images détaillées.
- Versions NSFW/SFW séparées à partir de la v5, adoptées aux différents contextes d’utilisation.
- Compatibilité native avec ComfyUI, facilitant l’intégration dans des workflows existants.
- Édition guidée par image(s) de référence, avec prise en charge de jusqu’à 4 entrées simultanées.
- Nœud texte amélioré inclus pour une meilleure interprétation des prompts et gestion des dimensions.
Prérequis système
- OS : Windows 10/11, Linux ou macOS
- Python ≥ 3.8
- VRAM GPU ≥ 8 Go (12 Go recommandés)
- Espace disque : ~20 Go pour stocker les modèles (2–4 Go par version)
Installation locale
Commencez par cloner ComfyUI :
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt
Puis installez un environnement virtuel Python :
python -m venv comfy_env
# Activation (Linux/macOS)
source comfy_env/bin/activate
# Activation (Windows)
comfy_env\Scripts\activate
Téléchargement et organisation des modèles
Récupérez le dépôt principal :
git clone https://gitcode.com/hf_mirrors/Phr00t/Qwen-Image-Edit-Rapid-AIO
La structure inclut :
- Répertoires
v1/àv4/: versions initiales combinées (NSFW + SFW). - Répertoires
v5/àv23/: versions séparées par type de contenu. - Dossier
fixed-textencode-node/: contientnodes_qwen.v2.py, un nœud corrigé pour ComfyUI.
Intégration dans ComfyUI
Remplacez le fichier de nœud par défaut :
cp Qwen-Image-Edit-Rapid-AIO/fixed-textencode-node/nodes_qwen.v2.py \
ComfyUI/custom_nodes/nodes_qwen.py
Configurez votre workflow :
- Ajoutez un nœud Load Checkpoint et sélectionnez un modèle Qwen-Rapid-AIO.
- Utilisez TextEncodeQwenImageEditPlus pour encoder vos prompts.
- Réglez CFG = 1 et steps = 4.
- (Optionnel) Connectez jusqu’à 4 images de référence.
Paramètres recommandés par version
| Version | Scheduler optimal |
|---|---|
| v1–v4 | sa_solver/beta ou euler_a/beta |
| v5 (SFW) | lcm/beta |
| v5 (NSFW) | lcm/normal |
| v7 | lcm/sgm_uniform (4–6 pas) |
| v19/v23 | euler_ancestral/beta |
Déploiement cloud
Google Colab :
!git clone https://github.com/comfyanonymous/ComfyUI
%cd ComfyUI
!pip install -r requirements.txt
!git clone https://gitcode.com/hf_mirrors/Phr00t/Qwen-Image-Edit-Rapid-AIO
Docker (exemple minimal) :
FROM pytorch/pytorch:2.1.0-cuda11.8-cudnn8-runtime
RUN apt-get update && apt-get install -y git
WORKDIR /app
RUN git clone https://github.com/comfyanonymous/ComfyUI
WORKDIR /app/ComfyUI
COPY requirements.txt .
RUN pip install -r requirements.txt
RUN git clone https://gitcode.com/hf_mirrors/Phr00t/Qwen-Image-Edit-Rapid-AIO models/qwen-aio
Optimisation et dépannage
Problèmes courants :
- Échec de chargement du modèle : vérifiez que tous les fichiers
.safetensorssont présents. - Images mal dimensionnées : utilisez le nœud corrigé et fournissez un latent vide pour calibrer la résolution cible.
Amélioration de la qualité :
- Ajoutez des mots-clés comme
professional digital photographypour éviter un rendu « plastique ». - Expérimentez avec CFG ∈ [1, 2] selon la précision souhaitée.
- En cas de VRAM limitée, privilégiez les résolutions inférieures ou activez la quantification FP8.
Guide de choix de version
| Cas d’usage | Version recommandée | Avantage principal |
|---|---|---|
| Édition cohérente | v19 | Stabilité maximale entre entrée et sortie |
| Réactivité au prompt | v23 | Interprétation sémantique avancée |
| Contenu sensible | v5.3+ (NSFW) | Spécifiquement entraîné pour ce type de contenu |
| Réalisme peau/texture | v21–v22 | Détails biologiques améliorés |
| Découverte | v4 | Interface simple, modèle unique |
Astuces avancées
L’outil accepte jusqu’à quatre images d’entrée :
- Style : influence artistique globale.
- Contenu : structure principale à préserver.
- Arrière-plan : contexte environnant.
- Détail : éléments spécifiques à reproduire (ex. : bijoux, motifs).
Le système inclut un template automatique qui décrit les images fournies, mais vous pouvez affiner manuellement avec des prompts explicites.