Déploiement local de modèles de langage sur Windows avec Ollama v0.32.5

Ollama est un outil open source conçu pour exécuter localement des modèles de langage de grande taille (LLM) sans dépendances complexes. Il simplifie radicalement le déploiement de modèles comme Qwen, Llama, Mistral ou Gemma sur ordinateur personnel, en particulier sous Windows.

Fonctionnalités clés

  • Exécution simplifiée : aucun besoin de gérer manuellement CUDA, Python ou bibliothèques de bas niveau — une seule commande suffit pour télécharger et lancer un modèle.
  • Accélération matérielle automtaique : détection native du GPU NVIDIA ou du chipset Apple Silicon (Metal/MLX), avec support transparent des formats quantifiés (GGUF, NVFP4).
  • API REST compatible OpenAI : point d’entrée HTTP à l’adresse http://localhost:11434, permettant l’intégration avec des applications existantes (LangChain, Dify, etc.).
  • Gestion intégrée des modèles : téléchargement, exécution, personnalisation via Modelfile, import de modèles GGUF, et gestion des contextes conversationnels.
  • Respect de la confidentialité : toutes les opérations restent strictement locales ; aucune donnée ni poids de modèle ne quittent la machine.

Mise à jour v0.32.5 : améliortaions ciblées

Cette version corrige spécifiquement une régression liée aux performances d’inférence sur les appareils équipés de puces Apple Silicon utilisant le backend MLX/Metal. Le correctif améliore la fidélité des sorties pour les modèles quantifiés en NVFP4, notamment ceux basés sur l’architecture Laguna.

Téléchargement du programme d’installation

Pour les utilisateurs situés dans des régions où l’accès direct à GitHub est limité, un package autonome est disponible :

Le fichier OllamaSetup.exe contient :

Windows-ollama-v0.32.5.zip
├── OllamaSetup.exe
├── README/
│   ├── README.md
│   └── README-zh.md
├── RELEASE-NOTES/
│   ├── RELEASE-NOTES.md
│   └── RELEASE-NOTES-zh.md
├── LICENSE
└── Windows-ollama-v0.32.5.pdf

Installation pas à pas

  1. Lancez OllamaSetup.exe en tant qu’administrateur.
  2. Suivez l’assistant d’installation (aucune option personnalisée requise par défaut).
  3. Une fois terminé, Ollama démarre automatiquement en tant que service Windows et affiche une icône dans la zone de notification.

Configuration recommandée après installation

Ouvrez l’application bureau Ollama, puis accédez aux paramètres avancés :

  • Accès réseau : activez « Exposer Ollama sur le réseau » si vous souhaitez y accéder depuis d’autres machines (ex. : application web distante).
  • Emplacement des modèles : remplacez le chemin par défaut (C:\Users\<user>\AppData\Local\Ollama) par un disque secondaire (ex. : D:\ollama\models) pour éviter l’épuisement de l’espace disque système.
  • Longueur du contexte : augmentez la valeur par défaut (4096 tokens) à 8192 pour supporter des échanges plus longs — cette modification impacte légèrement les performances d’inférence.

Utilisation pratique

Téléchargement et lancement d’un modèle

Pour tester avec le modèle qwen3.5:9b (version optimisée en chinois, 9 milliards de paramètres) :

  1. Ouvrez l’interface graphique Ollama.
  2. Dans la barre de recherche en bas à droite, saisissez qwen3.5:9b.
  3. Cliquez sur le résultat correspondant, puis envoyez un message tel que « Bonjour ».
  4. Le téléchargement (≈ 6,1 Go) démarre automatiquement ; une fois terminé, le modèle est prêt à répondre.

Surveillance des ressources

Pour vérifier l’utilisation GPU et l’état des modèles chargés :

# Afficher l’état du GPU NVIDIA
nvidia-smi

# Lister les modèles actifs en mémoire
ollama ps

La commande ollama ps indique notamment la taille occupée, la longueur du contexte configurée et le statut de chargement.

Interfaçage via API HTTP

Envoyez une requête POST au serveur local pour interroger le modèle :

curl -X POST http://localhost:11434/api/chat \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:9b",
    "messages": [
      {"role": "user", "content": "Présente-toi brièvement en français."}
    ],
    "stream": false
  }'

La réponse JSON contient le champ message.content, contenant la sortie générée par le modèle.

Étiquettes: Ollama Large-Language-Models local-ai Windows GGUF

Publié le 21 septembre à 07h45