Architecture : [RTX 5090] → [Ollama] → [Open WebUI / API REST] → [Utilisateur / n8n / RAG pgvector]
Ollama, Open WebUI et le RAG s'exécutent sur le nœud IA principal VM210 (Ubuntu Server 24.04 LTS · Docker Engine + NVIDIA Container Toolkit · RTX 5090), le RAG s'appuyant sur PostgreSQL/pgvector hébergé sur VM215. VM260 (Windows) est une machine alternative de POC / validation rapide, où des composants sont éprouvés avant d'être planifiés sur l'infra définitive. La RTX 5090 étant exclusive, un seul nœud GPU l'utilise à la fois.
⚡ Plafond électrique de la RTX 5090 — diagnostic passé

Lors d'un diagnostic antérieur (analyse d'extinctions brutales sous certaines charges agentiques), la RTX 5090 a été plafonnée par logiciel à 400 W, au lieu de 600 W par défaut. Les essais ComfyUI et Ollama des 27–28 septembre 2026 ont ensuite été réalisés à 600 W, sur décision explicite. Aucun gain de stabilité durable ni comparaison de performance entre ces plafonds n'est établi.

Le plafond n'affecte ni la VRAM ni la taille des modèles. La procédure 400 W ci-dessous conserve la trace du diagnostic ; elle ne décrit plus l'état courant.

contrôle du plafond actif / plafond par défaut
nvidia-smi \
  --query-gpu=power.limit,power.default_limit \
  --format=csv,noheader
# → 600.00 W, 600.00 W

Valeur diagnostique (historique) : sudo nvidia-smi --power-limit=400 (non persistant). Retour au plafond usine : sudo nvidia-smi --power-limit=600.

🤖 Modèles LLM déployés
FamilleModèlesUsage
MetaLlama 3.xLLM généraliste haute qualité
Mistral AIMistral 7B/22BLLM efficace, bon rapport perf/taille
GoogleGemma 2LLM compact et rapide
MicrosoftPhi-3LLM petit format
NousResearchHermesAgent IA avancé — 🔵 validé (plateforme de conception)
🖥️ Interfaces & Outils
OutilRôleVersionPort
OllamaServeur d'inférence LLM local0.32.611434
Open WebUIInterface chat (type ChatGPT) + RAG0.11.03000
n8nOrchestration workflows IA—5678
💻 Commandes Ollama
bash
# Lister les modèles installés
ollama list

# Télécharger un modèle
ollama pull mistral
ollama pull llama3

# Inférence directe
ollama run mistral

# API REST
curl http://localhost:11434/api/generate \\
  -d '{"model": "mistral", "prompt": "Résume en 3 points :", "stream": false}'
🎯 Compétences mises en œuvre
  • Hébergement local de LLM (infrastructure IA privée, sans cloud)
  • Comparaison et sélection de modèles LLM selon les besoins
  • Configuration Ollama (modèles, API, paramètres d'inférence)
  • Déploiement Open WebUI comme interface utilisateur
  • Intégration LLM dans des pipelines via API REST
  • Architecture agents IA avec Hermes + n8n
🖼️ Génération d'image locale — ComfyUI & partage du GPU

Le nœud IA Linux (VM210) exécute ComfyUI 0.36.0 et Ollama sur la même RTX 5090 (32 Go). Cette section couvre la mémoire partagée entre les deux serveurs (coexistence, déchargement, télémétrie) ; le détail de la génération photographique (RealVisXL V5.0, résultats par résolution, incidents de workflow) est traité sur la page IA Image.

observations de session — VRAM RTX 5090, mémoire partagée (pas un benchmark)
EssaiObservationPortée
Qwen3 8B + RealVisXL19 001 Mio de VRAM (échantillon)Qwen 100 % GPU, contexte 40 960
Déchargement ComfyUI7 376 → 742 Mio · HTTP 200Serveur conservé actif
Rechargement + génération 8 étapes7,40 s · retour à 7 376 MioCycle complet sans redémarrage
Déchargement Qwen3 8B (ComfyUI arrêté)Retour à 2 MioService Ollama toujours disponible
Ce sont des observations de session, sans protocole statistique ni garantie de latence. Un relevé en coexistence indique 539 W · 53 °C · 83 % GPU (plafond configuré 600 W) — à ne pas présenter comme une consommation constante ou un pic mesuré. De plus grands LLM, des contextes plus longs ou d'autres workflows peuvent dépasser la mémoire disponible. RealVisXL V5.0 est diffusé sous licence Open RAIL++ : des poids disponibles ne signifient pas l'absence de restrictions de licence.
Contrôle reproductible — vérification du checkpoint et du GPU
MODEL_FILE='<chemin-du-checkpoint>'
EXPECTED_SHA256='<empreinte-publiee-du-checkpoint>'
printf '%s  %s\n' "$EXPECTED_SHA256" "$MODEL_FILE" | sha256sum --check

nvidia-smi
nvidia-smi --query-gpu=power.limit,power.default_limit --format=csv,noheader

L'empreinte attendue doit provenir du dépôt de confiance du modèle, pas du seul fichier téléchargé.

Contrôle reproductible — télémétrie GPU pendant une génération (Ctrl+C pour arrêter)
nvidia-smi \
  --query-gpu=timestamp,temperature.gpu,power.draw,memory.used,utilization.gpu \
  --format=csv,noheader --loop=1

Enseignements et limites

  • Un graphe mélangeant RealVisXL avec des nœuds SD3/AuraFlow a été écarté ; le graphe SDXL adapté a ensuite fonctionné
  • Une annulation bloquée a nécessité un redémarrage ciblé, sans établir la cause exacte du blocage
  • Le réalisme anatomique, les poses et la qualité à grande échelle restent à évaluer — un portrait réussi ne suffit pas à les valider
  • Intégrations agentiques/n8n, admission commune et politique de redémarrage après reboot restent des travaux ouverts

Résultats détaillés, besoin photographique et procédure d'accès complète sur la page IA Image. Inspection du conteneur et correctif de cache sur la page Docker.

Pages liées

Références & Sources

CatégorieRessourceURL
Documentation officielleOllamagithub.com/ollama/ollama
Documentation officielleOpen WebUIdocs.openwebui.com
Versions utiliséesOllama 0.32.6 · Open WebUI 0.11.0 · Ubuntu Server 24.04 LTS (nœud VM210)—
LicenceOllama — MIT · Open WebUI — BSD-3-Clause—
Contenu de cette pagePartagé sous CC BY-SA 4.0creativecommons.org/licenses/by-sa/4.0