🖥️ Composants matériels
| Composant | Détail | Rôle |
|---|---|---|
| CPU | AMD Ryzen 9 9950X3D — 16 cœurs / 32 threads | Inférence IA · Virtualisation KVM |
| GPU | NVIDIA GeForce RTX 5090 | Inférence LLM · Génération image |
| RAM | 192 Go DDR5 (~186 Gio utilisables) | Mémoire VM multiples · modèles larges |
| Stockage | 2× SSD NVMe en miroir ZFS (~1,75 Tio utile) | Disques virtuels · datasets IA · résilience |
| Hyperviseur | Proxmox VE 9.2.2 | Virtualisation · affectation GPU |
| Réseau | Ethernet | Bridge Proxmox · accès LAN |
⚙️ BIOS/UEFI — valeur attestée
| Paramètre | État | Usage |
|---|---|---|
| IOMMU (AMD) | ✅ Activé et validé | GPU Passthrough VFIO |
Les autres valeurs du relevé BIOS (Above 4G Decoding, Re-Size BAR, Secure Boot…) ne sont pas publiées : seule l'activation de l'IOMMU est attestée (voir GPU / VFIO). Un passthrough fonctionnel ne remplace pas un relevé daté.
🎯 Compétences mises en œuvre
- Architecture serveur IA locale haute performance
- Sélection matérielle pour l'inférence GPU (VRAM, bande passante)
- Dimensionnement CPU / RAM pour hyperviseur multi-VM
- Configuration BIOS/UEFI pour la virtualisation et le passthrough PCIe
- Gestion stockage NVMe haute performance avec ZFS
🧩 Répartition des rôles — machines virtuelles
| VM | Rôle | Socle | Composants clés |
|---|---|---|---|
| VM200 | Reverse proxy — point d'entrée Web / publication HTTPS | Ubuntu Server 24.04 LTS · sans GPU | Nginx · Certbot (Let's Encrypt) · Fail2ban · pare-feu local |
| VM205 | Service de fichiers — Nextcloud | Ubuntu Server 24.04 LTS · sans GPU | Nextcloud + MariaDB (conteneurs Docker) · autodémarrage |
| VM210 | Nœud IA — charges GPU | Ubuntu Server 24.04 LTS · RTX 5090 (passthrough) | Docker + NVIDIA Container Toolkit · Ollama · Open WebUI |
| VM215 | Services communs — sans GPU | Ubuntu Server 24.04 LTS · disque ext4 dédié | PostgreSQL 18.4 · pgvector 0.8.6 (backend vectoriel du RAG) |
| VM300 | Consommateur IA — automatisation | Ubuntu Server 24.04 LTS · sans GPU | n8n (orchestration de workflows) · autodémarrage |
Principe : le GPU est affecté directement aux VM qui en ont besoin ; les charges GPU
(VM210) et les services communs CPU (VM215) sont séparés pour limiter les dépendances et faciliter la sauvegarde.
Industrialisation : les VM sont dérivées de templates génériques et CUDA, personnalisés par Cloud-Init ; leur reconstruction suit une procédure réversible (validation d'un clone de contrôle avant tout remplacement).
Limites : un plafond logiciel diagnostique de 400 W a été utilisé antérieurement (contre 600 W par défaut) ; les derniers essais ComfyUI/Ollama ont été réalisés à 600 W, sans garantie de stabilité à long terme ni comparaison de performance établie (procédure sur la page IA & LLM). Par ailleurs, les snapshots ZFS facilitent les retours techniques mais ne remplacent pas une sauvegarde indépendante — cette politique reste en cours de définition.
Industrialisation : les VM sont dérivées de templates génériques et CUDA, personnalisés par Cloud-Init ; leur reconstruction suit une procédure réversible (validation d'un clone de contrôle avant tout remplacement).
Limites : un plafond logiciel diagnostique de 400 W a été utilisé antérieurement (contre 600 W par défaut) ; les derniers essais ComfyUI/Ollama ont été réalisés à 600 W, sans garantie de stabilité à long terme ni comparaison de performance établie (procédure sur la page IA & LLM). Par ailleurs, les snapshots ZFS facilitent les retours techniques mais ne remplacent pas une sauvegarde indépendante — cette politique reste en cours de définition.