Performances et Capacités du Modèle
Malgré ses 10 milliards de paramètres, STEP3-VL-10B excelle dans diverses tâches de raisonnement multimodal, surpassant souvent des modèles beaucoup plus volumineux :
- MMMU (Raisonnement STEM) : 78.11 points
- MathVista (Compréhension Visuelle Mathématique) : 83.97 points
- OCRBench (Reconnaissance de Documents) : 86.75 points
Ces résultats soulignent l'efficacité et la puissance du modèle pour des applications complexes.
Accès à l'Interface Web
Une fois le déploiement terminé, l'accès à l'interface utilisateur web est simplifié :
- Localisez le bouton "Accès Rapide" dans la barre de navigation latérale de votre serveur de calcul.
- Cliquez dessus pour ouvrir une URL du type :
https://[votre-adresse-serveur]/. L'adresse exacte varie selon votre configuration. - Attendez quelques instants que l'interface se charge complètement.
Fonctionnalités de l'Interface Web
- Zone de Téléchargement d'Images (Gauche) : Permet de télécharger des images par glisser-déposer ou sélection manuelle.
- Zone de Saisie de Questions (Milieu Haut) : Pour poser vos questions relatives à l'image téléchargée.
- Zone d'Affichage des Réponses (Milieu Bas) : Où les réponses intelligentes du modèle seront présentées en temps réel.
Gestion des Services avec Supervisor
Supervisor est configuré pour démarrer automatiquement le service STEP3-VL-10B. Cependant, vous pouvez le gérer manuellement via les commandes suivantes :
# Afficher le statut des services
supervisorctl status
# Arrêter le service WebUI
supervisorctl stop webui
# Démarrer le service WebUI
supervisorctl start webui
# Redémarrer le service WebUI
supervisorctl restart webui
# Arrêter tous les services gérés par Supervisor
supervisorctl stop all
Configuration du Port
Pour modifier le port d'écoute par défaut (7860), éditez le script de démarrage :
vim /usr/local/bin/start-webui-service.sh
Localisez la ligne de lancement de Python et modifiez le numéro de port :
exec python /root/Step3-VL-10B/webui.py \
--host 0.0.0.0 \
--port 7860 # Modifiez ce numéro ici
Après avoir sauvegardé les modifications, redémarrez le service pour qu'elles prennent effet :
supervisorctl restart webui
Méthode de Démarrage Manuel (Alternative)
Bien que Supervisor gère le démarrage automatique, connaître la procédure manuelle est utile :
cd ~/Step3-VL-10B
source ~/Step3-VL-10B/venv/bin/activate
python3 webui.py --host 0.0.0.0 --port 7860
Une fois démarré, le modèle sera accessible via votre navigateur web.
Appel d'API pour Intégration
STEP3-VL-10B expose une API compatible avec le standard OpenAI, facilitent son intégration dans des applications personnalisées.
Appel de Base pour le Dialogue Texte :
curl -X POST https://[votre-adresse-serveur]/api/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Step3-VL-10B",
"messages": [{"role": "user", "content": "Bonjour"}],
"max_tokens": 1024
}'
Appel pour la Compréhension Multimodale (Image + Texte) :
curl -X POST http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Step3-VL-10B",
"messages": [
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://exemple.com/image_abeille.jpg"}},
{"type": "text", "text": "Décris cette image"}
]
}
],
"max_tokens": 1024
}'
Configuration Matérielle et Optimisation
Configuration Minimale Requise :
| Composant | Configuration Minimale | Configuration Recommandée |
|---|---|---|
| GPU | NVIDIA avec ≥ 24 Go de VRAM | A100 40 Go/80 Go |
| Mémoire Vive (RAM) | ≥ 32 Go | ≥ 64 Go |
| CUDA Toolkit | 12.x | 12.4+ |
Conseils d'Optimisation :
- Traitement par Lots : Pour plusieurs images, espacez les requêtes d'au moins 10 secondes.
- Optimisation des Images : Maintenez la résolution des images à 728x728 pixels ou moins.
- Décomposition des Requêtes : Divisez les questions comlpexes en sous-questions plus simples.
- Ajustement des Paramètres : Si la réponse est lente, envisagez de réduire la valeur de
max_tokens.
Diagnostic des Problèmes Courants
Service Inaccessible :
- Vérifiez le statut du service :
supervisorctl status webui - Consultez les logs d'erreurs :
tail -100 /var/log/supervisor/webui-stderr.log - Causes fréquentes : conflit de port (modifier le port), manque de VRAM (réduire les requêtes simultanées), fichiers modèle corrompus (redéployer).
Lenteur de Réponse :
- Le premier chargement peut prendre 1 à 2 minutes (chargement du modèle en VRAM).
- Le traitement de grandes images est plus lent (compresser les images au préalable).
- Les questions complexes nécessitent plus de ressources de calcul.
Amélioration de la Précision :
- Assurez une bonne qualité d'image (clarté, éclairage uniforme).
- Formulez des questions précises.
- Pour des sujets spécialisés, fournissez un contexte pertinent.
- Ajustez le paramètre
temperatureentre 0.2 et 0.5 pour des réponses plus focalisées.