[RTX 5090] → [Ollama] → [Open WebUI / API REST] → [Utilisateur / n8n / RAG pgvector]
Lors d'un diagnostic antérieur (analyse d'extinctions brutales sous certaines charges agentiques), la RTX 5090 a été plafonnée par logiciel à 400 W, au lieu de 600 W par défaut. Les essais ComfyUI et Ollama des 27–28 septembre 2026 ont ensuite été réalisés à 600 W, sur décision explicite. Aucun gain de stabilité durable ni comparaison de performance entre ces plafonds n'est établi.
Le plafond n'affecte ni la VRAM ni la taille des modèles. La procédure 400 W ci-dessous conserve la trace du diagnostic ; elle ne décrit plus l'état courant.
nvidia-smi \ --query-gpu=power.limit,power.default_limit \ --format=csv,noheader # → 600.00 W, 600.00 W
Valeur diagnostique (historique) : sudo nvidia-smi --power-limit=400 (non persistant). Retour au plafond
usine : sudo nvidia-smi --power-limit=600.
| Famille | Modèles | Usage |
|---|---|---|
| Meta | Llama 3.x | LLM généraliste haute qualité |
| Mistral AI | Mistral 7B/22B | LLM efficace, bon rapport perf/taille |
| Gemma 2 | LLM compact et rapide | |
| Microsoft | Phi-3 | LLM petit format |
| NousResearch | Hermes | Agent IA avancé — 🔵 validé (plateforme de conception) |
| Outil | Rôle | Version | Port |
|---|---|---|---|
| Ollama | Serveur d'inférence LLM local | 0.32.6 | 11434 |
| Open WebUI | Interface chat (type ChatGPT) + RAG | 0.11.0 | 3000 |
| n8n | Orchestration workflows IA | — | 5678 |
# Lister les modèles installés
ollama list
# Télécharger un modèle
ollama pull mistral
ollama pull llama3
# Inférence directe
ollama run mistral
# API REST
curl http://localhost:11434/api/generate \\
-d '{"model": "mistral", "prompt": "Résume en 3 points :", "stream": false}'- Hébergement local de LLM (infrastructure IA privée, sans cloud)
- Comparaison et sélection de modèles LLM selon les besoins
- Configuration Ollama (modèles, API, paramètres d'inférence)
- Déploiement Open WebUI comme interface utilisateur
- Intégration LLM dans des pipelines via API REST
- Architecture agents IA avec Hermes + n8n
Le nœud IA Linux (VM210) exécute ComfyUI 0.36.0 et Ollama sur la même RTX 5090 (32 Go). Cette section couvre la mémoire partagée entre les deux serveurs (coexistence, déchargement, télémétrie) ; le détail de la génération photographique (RealVisXL V5.0, résultats par résolution, incidents de workflow) est traité sur la page IA Image.
| Essai | Observation | Portée |
|---|---|---|
| Qwen3 8B + RealVisXL | 19 001 Mio de VRAM (échantillon) | Qwen 100 % GPU, contexte 40 960 |
| Déchargement ComfyUI | 7 376 → 742 Mio · HTTP 200 | Serveur conservé actif |
| Rechargement + génération 8 étapes | 7,40 s · retour à 7 376 Mio | Cycle complet sans redémarrage |
| Déchargement Qwen3 8B (ComfyUI arrêté) | Retour à 2 Mio | Service Ollama toujours disponible |
MODEL_FILE='<chemin-du-checkpoint>' EXPECTED_SHA256='<empreinte-publiee-du-checkpoint>' printf '%s %s\n' "$EXPECTED_SHA256" "$MODEL_FILE" | sha256sum --check nvidia-smi nvidia-smi --query-gpu=power.limit,power.default_limit --format=csv,noheader
L'empreinte attendue doit provenir du dépôt de confiance du modèle, pas du seul fichier téléchargé.
nvidia-smi \ --query-gpu=timestamp,temperature.gpu,power.draw,memory.used,utilization.gpu \ --format=csv,noheader --loop=1
Enseignements et limites
- Un graphe mélangeant RealVisXL avec des nœuds SD3/AuraFlow a été écarté ; le graphe SDXL adapté a ensuite fonctionné
- Une annulation bloquée a nécessité un redémarrage ciblé, sans établir la cause exacte du blocage
- Le réalisme anatomique, les poses et la qualité à grande échelle restent à évaluer — un portrait réussi ne suffit pas à les valider
- Intégrations agentiques/n8n, admission commune et politique de redémarrage après reboot restent des travaux ouverts
Résultats détaillés, besoin photographique et procédure d'accès complète sur la page IA Image. Inspection du conteneur et correctif de cache sur la page Docker.