🖥️ Componentes de hardware
| Componente | Detalle | Función |
|---|---|---|
| CPU | AMD Ryzen 9 9950X3D — 16 núcleos / 32 hilos | Inferencia IA · Virtualización KVM |
| GPU | NVIDIA GeForce RTX 5090 | Inferencia LLM · Generación de imágenes |
| RAM | 192 GB DDR5 (~186 GiB utilizables) | Memoria para varias VM · modelos grandes |
| Almacenamiento | 2× SSD NVMe en espejo ZFS (~1,75 TiB útiles) | Discos virtuales · datasets de IA · resiliencia |
| Hipervisor | Proxmox VE 9.2.2 | Virtualización · asignación de GPU |
| Red | Ethernet | Puente Proxmox · acceso LAN |
⚙️ BIOS/UEFI — valor atestiguado
| Parámetro | Estado | Uso |
|---|---|---|
| IOMMU (AMD) | ✅ Activado y validado | GPU Passthrough VFIO |
Los demás valores del informe BIOS (Above 4G Decoding, Re-Size BAR, Secure Boot…) no se publican: solo está atestiguada la activación de la IOMMU (ver GPU / VFIO). Un passthrough funcional no sustituye un informe fechado.
🎯 Competencias aplicadas
- Arquitectura de servidor de IA local de alto rendimiento
- Selección de hardware para inferencia por GPU (VRAM, ancho de banda)
- Dimensionamiento de CPU / RAM para hipervisor multi-VM
- Configuración BIOS/UEFI para virtualización y passthrough PCIe
- Gestión de almacenamiento NVMe de alto rendimiento con ZFS
🧩 Distribución de roles — máquinas virtuales
| VM | Función | Base | Componentes clave |
|---|---|---|---|
| VM200 | Proxy inverso — punto de entrada Web / publicación HTTPS | Ubuntu Server 24.04 LTS · sin GPU | Nginx · Certbot (Let's Encrypt) · Fail2ban · firewall local |
| VM205 | Servicio de archivos — Nextcloud | Ubuntu Server 24.04 LTS · sin GPU | Nextcloud + MariaDB (contenedores Docker) · autoarranque |
| VM210 | Nodo de IA — cargas GPU | Ubuntu Server 24.04 LTS · RTX 5090 (passthrough) | Docker + NVIDIA Container Toolkit · Ollama · Open WebUI |
| VM215 | Servicios comunes — sin GPU | Ubuntu Server 24.04 LTS · disco ext4 dedicado | PostgreSQL 18.4 · pgvector 0.8.6 (backend vectorial del RAG) |
| VM300 | Consumidor de IA — automatización | Ubuntu Server 24.04 LTS · sin GPU | n8n (orquestación de workflows) · autoarranque |
Principio: la GPU se asigna directamente a las VM que la necesitan; las cargas de GPU (VM210) y los servicios comunes de CPU (VM215) se mantienen separados para limitar las dependencias y facilitar las copias de seguridad.
Industrialización: las VM se derivan de plantillas genéricas y CUDA, personalizadas mediante Cloud-Init; su reconstrucción sigue un procedimiento reversible (se valida un clon de control antes de cualquier sustitución).
Límites: anteriormente se usó un límite de software diagnóstico de 400 W (frente a 600 W por defecto); las últimas pruebas de ComfyUI/Ollama se realizaron a 600 W, sin garantía de estabilidad a largo plazo ni comparación de rendimiento establecida (procedimiento en la página IA y LLM). Además, los snapshots de ZFS facilitan las reversiones técnicas, pero no sustituyen una copia de seguridad independiente — esa política aún está en definición.
Industrialización: las VM se derivan de plantillas genéricas y CUDA, personalizadas mediante Cloud-Init; su reconstrucción sigue un procedimiento reversible (se valida un clon de control antes de cualquier sustitución).
Límites: anteriormente se usó un límite de software diagnóstico de 400 W (frente a 600 W por defecto); las últimas pruebas de ComfyUI/Ollama se realizaron a 600 W, sin garantía de estabilidad a largo plazo ni comparación de rendimiento establecida (procedimiento en la página IA y LLM). Además, los snapshots de ZFS facilitan las reversiones técnicas, pero no sustituyen una copia de seguridad independiente — esa política aún está en definición.