Architecture : [RTX 5090] → [Ollama] → [Open WebUI / API REST] → [Utilisateur / n8n / RAG pgvector]
Ollama, Open WebUI y el RAG se ejecutan en el nodo de IA principal VM210 (Ubuntu Server 24.04 LTS · Docker Engine + NVIDIA Container Toolkit · RTX 5090), y el RAG se apoya en PostgreSQL/pgvector alojado en VM215. VM260 (Windows) es una máquina alternativa de PoC / validación rápida, donde los componentes se prueban antes de planificarse en la infraestructura definitiva. Como la RTX 5090 es exclusiva, solo un nodo GPU la usa a la vez.
⚡ Límite eléctrico de la RTX 5090 — diagnóstico pasado

Durante un diagnóstico anterior (análisis de apagados bruscos bajo ciertas cargas agénticas), la RTX 5090 se limitó por software a 400 W, en lugar de los 600 W por defecto. Las pruebas de ComfyUI y Ollama del 27–28 de septiembre de 2026 se realizaron después a 600 W, por decisión explícita. No se ha establecido ninguna ganancia de estabilidad duradera ni comparación de rendimiento entre estos límites.

El límite no afecta ni a la VRAM ni al tamaño de los modelos. El procedimiento de 400 W siguiente conserva el rastro del diagnóstico; ya no describe el estado actual.

verificación del límite activo / límite por defecto
nvidia-smi \
  --query-gpu=power.limit,power.default_limit \
  --format=csv,noheader
# → 600.00 W, 600.00 W

Valor de diagnóstico (histórico): sudo nvidia-smi --power-limit=400 (no persistente). Retorno al límite de fábrica: sudo nvidia-smi --power-limit=600.

🤖 Modelos LLM desplegados
FamiliaModelosUso
MetaLlama 3.xLLM generalista de alta calidad
Mistral AIMistral 7B/22BLLM eficiente, buena relación rendimiento/tamaño
GoogleGemma 2LLM compacto y rápido
MicrosoftPhi-3LLM de formato pequeño
NousResearchHermesAgente de IA avanzado — 🔵 validado (plataforma de diseño)
🖥️ Interfaces y herramientas
HerramientaFunciónVersiónPuerto
OllamaServidor de inferencia LLM local0.32.611434
Open WebUIInterfaz de chat (tipo ChatGPT) + RAG0.11.03000
n8nOrquestación de workflows de IA—5678
💻 Comandos de Ollama
bash
# Lister les modèles installés
ollama list

# Télécharger un modèle
ollama pull mistral
ollama pull llama3

# Inférence directe
ollama run mistral

# API REST
curl http://localhost:11434/api/generate \\
  -d '{"model": "mistral", "prompt": "Résume en 3 points :", "stream": false}'
🎯 Competencias aplicadas
  • Alojamiento local de LLM (infraestructura de IA privada, sin nube)
  • Comparación y selección de modelos LLM según las necesidades
  • Configuración de Ollama (modelos, API, parámetros de inferencia)
  • Despliegue de Open WebUI como interfaz de usuario
  • Integración de LLM en pipelines mediante API REST
  • Arquitectura de agentes de IA con Hermes + n8n
🖼️ Generación de imágenes local — ComfyUI y uso compartido de la GPU

El nodo de IA Linux (VM210) ahora ejecuta ComfyUI 0.36.0 y Ollama en la misma RTX 5090 (32 GB). El modelo RealVisXL V5.0 (derivado SDXL fotorrealista) produjo retratos en 512×512 y 1024×1024. Se observó la coexistencia con qwen3:8b, y después se verificó la descarga de modelos sin detener los servidores. El reparto automático de solicitudes aún está por construir (por ahora, cambio manual).

observaciones de la sesión — VRAM de la RTX 5090 (no es un benchmark)
PruebaObservaciónAlcance
Retrato 512×512, 8 pasos8,03 s (incluyendo la carga inicial)Validación funcional
Retrato 1024×1024, 30 pasosImagen obtenida (DPM++ SDE Karras)Duración no atribuida con certeza
Qwen3 8B + RealVisXL19.001 MiB de VRAM (muestra)Qwen 100% GPU, contexto 40.960
Descarga de ComfyUI7.376 → 742 MiB · HTTP 200Servidor mantenido activo
Recarga + generación de 8 pasos7,40 s · retorno a 7.376 MiBCiclo completo sin reinicio
Descarga de Qwen3 8B (ComfyUI detenido)Retorno a 2 MiBServicio Ollama sigue disponible
Estas son observaciones de sesión, sin protocolo estadístico ni garantía de latencia. Una lectura en coexistencia indica 539 W · 53 °C · 83% GPU (límite configurado de 600 W) — no debe presentarse como un consumo constante ni un pico medido. LLM más grandes, contextos más largos u otros workflows pueden superar la memoria disponible. RealVisXL V5.0 se distribuye bajo la licencia Open RAIL++: que los pesos estén disponibles no significa ausencia de restricciones de licencia.
Control reproducible — verificación del checkpoint y de la GPU
MODEL_FILE='<chemin-du-checkpoint>'
EXPECTED_SHA256='<empreinte-publiee-du-checkpoint>'
printf '%s  %s\n' "$EXPECTED_SHA256" "$MODEL_FILE" | sha256sum --check

nvidia-smi
nvidia-smi --query-gpu=power.limit,power.default_limit --format=csv,noheader

La huella esperada debe provenir del repositorio de confianza del modelo, no únicamente del archivo descargado.

Control reproducible — telemetría de la GPU durante una generación (Ctrl+C para detener)
nvidia-smi \
  --query-gpu=timestamp,temperature.gpu,power.draw,memory.used,utilization.gpu \
  --format=csv,noheader --loop=1

Aprendizajes y límites

  • Se descartó un grafo que mezclaba RealVisXL con nodos SD3/AuraFlow; el grafo SDXL adaptado funcionó después
  • Una cancelación bloqueada requirió un reinicio específico, sin establecer la causa exacta del bloqueo
  • El realismo anatómico, las poses y la calidad a gran escala quedan por evaluar — un retrato exitoso no basta para validarlos
  • Las integraciones agénticas/n8n, la admisión común y la política de reinicio tras un reboot siguen siendo trabajo abierto

Resultados detallados, la necesidad fotográfica y el procedimiento de acceso completo en la página IA Imagen. Inspección del contenedor y corrección de caché en la página Docker.

Páginas relacionadas

Referencias y fuentes

CategoríaRecursoURL
Documentación oficialOllamagithub.com/ollama/ollama
Documentación oficialOpen WebUIdocs.openwebui.com
Versión utilizadaOllama 0.32.6 · Open WebUI 0.11.0 · Ubuntu Server 24.04 LTS (nœud VM210)—
LicenciaOllama — MIT · Open WebUI — BSD-3-Clause—
Contenido de esta páginaCompartido bajo CC BY-SA 4.0creativecommons.org/licenses/by-sa/4.0