[RTX 5090] → [Ollama] → [Open WebUI / API REST] → [Utilisateur / n8n / RAG pgvector]
Durante un diagnóstico anterior (análisis de apagados bruscos bajo ciertas cargas agénticas), la RTX 5090 se limitó por software a 400 W, en lugar de los 600 W por defecto. Las pruebas de ComfyUI y Ollama del 27–28 de septiembre de 2026 se realizaron después a 600 W, por decisión explícita. No se ha establecido ninguna ganancia de estabilidad duradera ni comparación de rendimiento entre estos límites.
El límite no afecta ni a la VRAM ni al tamaño de los modelos. El procedimiento de 400 W siguiente conserva el rastro del diagnóstico; ya no describe el estado actual.
nvidia-smi \ --query-gpu=power.limit,power.default_limit \ --format=csv,noheader # → 600.00 W, 600.00 W
Valor de diagnóstico (histórico): sudo nvidia-smi --power-limit=400 (no persistente). Retorno al límite de fábrica: sudo nvidia-smi --power-limit=600.
| Familia | Modelos | Uso |
|---|---|---|
| Meta | Llama 3.x | LLM generalista de alta calidad |
| Mistral AI | Mistral 7B/22B | LLM eficiente, buena relación rendimiento/tamaño |
| Gemma 2 | LLM compacto y rápido | |
| Microsoft | Phi-3 | LLM de formato pequeño |
| NousResearch | Hermes | Agente de IA avanzado — 🔵 validado (plataforma de diseño) |
| Herramienta | Función | Versión | Puerto |
|---|---|---|---|
| Ollama | Servidor de inferencia LLM local | 0.32.6 | 11434 |
| Open WebUI | Interfaz de chat (tipo ChatGPT) + RAG | 0.11.0 | 3000 |
| n8n | Orquestación de workflows de IA | — | 5678 |
# Lister les modèles installés
ollama list
# Télécharger un modèle
ollama pull mistral
ollama pull llama3
# Inférence directe
ollama run mistral
# API REST
curl http://localhost:11434/api/generate \\
-d '{"model": "mistral", "prompt": "Résume en 3 points :", "stream": false}'- Alojamiento local de LLM (infraestructura de IA privada, sin nube)
- Comparación y selección de modelos LLM según las necesidades
- Configuración de Ollama (modelos, API, parámetros de inferencia)
- Despliegue de Open WebUI como interfaz de usuario
- Integración de LLM en pipelines mediante API REST
- Arquitectura de agentes de IA con Hermes + n8n
El nodo de IA Linux (VM210) ahora ejecuta ComfyUI 0.36.0 y Ollama en la misma RTX 5090 (32 GB). El modelo RealVisXL V5.0 (derivado SDXL fotorrealista) produjo retratos en 512×512 y 1024×1024. Se observó la coexistencia con qwen3:8b, y después se verificó la descarga de modelos sin detener los servidores. El reparto automático de solicitudes aún está por construir (por ahora, cambio manual).
| Prueba | Observación | Alcance |
|---|---|---|
| Retrato 512×512, 8 pasos | 8,03 s (incluyendo la carga inicial) | Validación funcional |
| Retrato 1024×1024, 30 pasos | Imagen obtenida (DPM++ SDE Karras) | Duración no atribuida con certeza |
| Qwen3 8B + RealVisXL | 19.001 MiB de VRAM (muestra) | Qwen 100% GPU, contexto 40.960 |
| Descarga de ComfyUI | 7.376 → 742 MiB · HTTP 200 | Servidor mantenido activo |
| Recarga + generación de 8 pasos | 7,40 s · retorno a 7.376 MiB | Ciclo completo sin reinicio |
| Descarga de Qwen3 8B (ComfyUI detenido) | Retorno a 2 MiB | Servicio Ollama sigue disponible |
MODEL_FILE='<chemin-du-checkpoint>' EXPECTED_SHA256='<empreinte-publiee-du-checkpoint>' printf '%s %s\n' "$EXPECTED_SHA256" "$MODEL_FILE" | sha256sum --check nvidia-smi nvidia-smi --query-gpu=power.limit,power.default_limit --format=csv,noheader
La huella esperada debe provenir del repositorio de confianza del modelo, no únicamente del archivo descargado.
nvidia-smi \ --query-gpu=timestamp,temperature.gpu,power.draw,memory.used,utilization.gpu \ --format=csv,noheader --loop=1
Aprendizajes y límites
- Se descartó un grafo que mezclaba RealVisXL con nodos SD3/AuraFlow; el grafo SDXL adaptado funcionó después
- Una cancelación bloqueada requirió un reinicio específico, sin establecer la causa exacta del bloqueo
- El realismo anatómico, las poses y la calidad a gran escala quedan por evaluar — un retrato exitoso no basta para validarlos
- Las integraciones agénticas/n8n, la admisión común y la política de reinicio tras un reboot siguen siendo trabajo abierto
Resultados detallados, la necesidad fotográfica y el procedimiento de acceso completo en la página IA Imagen. Inspección del contenedor y corrección de caché en la página Docker.