Architecture : [RTX 5090] → [Ollama] → [Open WebUI / API REST] → [Utilisateur / n8n / RAG pgvector]
Ollama, Open WebUI и RAG работают на основном узле ИИ VM210 (Ubuntu Server 24.04 LTS · Docker Engine + NVIDIA Container Toolkit · RTX 5090), при этом RAG опирается на PostgreSQL/pgvector, размещённый на VM215. VM260 (Windows) — альтернативная машина для POC / быстрой проверки, где компоненты испытываются перед планированием на итоговой инфраструктуре. Поскольку RTX 5090 эксклюзивна, её одновременно использует только один GPU-узел.
⚡ Ограничение мощности RTX 5090 — диагностика в прошлом

В ходе более ранней диагностики (анализ резких отключений при некоторых агентных нагрузках) RTX 5090 была программно ограничена до 400 Вт вместо 600 Вт по умолчанию. Тесты ComfyUI и Ollama 27–28 сентября 2026 затем проводились при 600 Вт по явному решению. Устойчивый выигрыш в стабильности или сравнение производительности между этими ограничениями не установлены.

Ограничение не влияет ни на VRAM, ни на размер моделей. Приведённая ниже процедура для 400 Вт сохраняет след диагностики; она больше не описывает текущее состояние.

проверка активного ограничения / ограничения по умолчанию
nvidia-smi \
  --query-gpu=power.limit,power.default_limit \
  --format=csv,noheader
# → 600.00 W, 600.00 W

Диагностическое значение (историческое): sudo nvidia-smi --power-limit=400 (не сохраняется). Возврат к заводскому ограничению: sudo nvidia-smi --power-limit=600.

🤖 Развёрнутые модели LLM
СемействоМоделиНазначение
MetaLlama 3.xКачественная универсальная LLM
Mistral AIMistral 7B/22BЭффективная LLM, хорошее соотношение производительность/размер
GoogleGemma 2Компактная и быстрая LLM
MicrosoftPhi-3LLM малого размера
NousResearchHermesПродвинутый ИИ-агент — 🔵 проверено (платформа разработки)
🖥️ Интерфейсы и инструменты
ИнструментРольВерсияПорт
OllamaЛокальный сервер инференса LLM0.32.611434
Open WebUIЧат-интерфейс (в стиле ChatGPT) + RAG0.11.03000
n8nОркестрация ИИ-воркфлоу—5678
💻 Команды Ollama
bash
# Lister les modèles installés
ollama list

# Télécharger un modèle
ollama pull mistral
ollama pull llama3

# Inférence directe
ollama run mistral

# API REST
curl http://localhost:11434/api/generate \\
  -d '{"model": "mistral", "prompt": "Résume en 3 points :", "stream": false}'
🎯 Применённые компетенции
  • Локальный хостинг LLM (частная ИИ-инфраструктура, без облака)
  • Сравнение и выбор моделей LLM исходя из задач
  • Настройка Ollama (модели, API, параметры инференса)
  • Развёртывание Open WebUI в качестве пользовательского интерфейса
  • Интеграция LLM в конвейеры через REST API
  • Архитектура ИИ-агентов на базе Hermes + n8n
🖼️ Локальная генерация изображений — ComfyUI и совместное использование GPU

Linux-узел ИИ (VM210) теперь запускает ComfyUI 0.36.0 и Ollama на одной и той же RTX 5090 (32 ГБ). Модель RealVisXL V5.0 (фотореалистичное производное SDXL) сгенерировала портреты 512×512 и 1024×1024. Было проверено сосуществование с qwen3:8b, а затем — выгрузка моделей без остановки серверов. Автоматическое распределение запросов ещё предстоит реализовать (пока переключение вручную).

наблюдения сессии — VRAM RTX 5090 (не бенчмарк)
ТестНаблюдениеОбласть применимости
Портрет 512×512, 8 шагов8,03 с (включая начальную загрузку)Функциональная проверка
Портрет 1024×1024, 30 шаговИзображение получено (DPM++ SDE Karras)Длительность указана не с полной уверенностью
Qwen3 8B + RealVisXL19 001 МиБ VRAM (выборка)Qwen 100% GPU, контекст 40 960
Выгрузка ComfyUI7 376 → 742 МиБ · HTTP 200Сервер оставался активным
Перезагрузка + генерация за 8 шагов7,40 с · возврат к 7 376 МиБПолный цикл без перезапуска
Выгрузка Qwen3 8B (ComfyUI остановлен)Возврат к 2 МиБСервис Ollama по-прежнему доступен
Это наблюдения сессии, без статистического протокола или гарантии задержки. Замер при сосуществовании показывает 539 Вт · 53 °C · 83% GPU (настроенное ограничение 600 Вт) — не следует представлять это как постоянное потребление или измеренный пик. Более крупные LLM, более длинные контексты или другие workflow могут превысить доступную память. RealVisXL V5.0 распространяется по лицензии Open RAIL++: доступность весов не означает отсутствие лицензионных ограничений.
Воспроизводимая проверка — контроль чекпоинта и GPU
MODEL_FILE='<chemin-du-checkpoint>'
EXPECTED_SHA256='<empreinte-publiee-du-checkpoint>'
printf '%s  %s\n' "$EXPECTED_SHA256" "$MODEL_FILE" | sha256sum --check

nvidia-smi
nvidia-smi --query-gpu=power.limit,power.default_limit --format=csv,noheader

Ожидаемая контрольная сумма должна браться из доверенного репозитория модели, а не только из скачанного файла.

Воспроизводимая проверка — телеметрия GPU во время генерации (Ctrl+C для остановки)
nvidia-smi \
  --query-gpu=timestamp,temperature.gpu,power.draw,memory.used,utilization.gpu \
  --format=csv,noheader --loop=1

Выводы и ограничения

  • Граф, смешивающий RealVisXL с узлами SD3/AuraFlow, был отклонён; адаптированный граф SDXL затем сработал
  • Заблокированная отмена потребовала целевого перезапуска без установления точной причины блокировки
  • Анатомический реализм, позы и качество в большом масштабе ещё предстоит оценить — один удачный портрет недостаточен для их подтверждения
  • Агентные интеграции/n8n, общий контроль допуска и политика перезапуска после перезагрузки остаются открытыми задачами

Подробные результаты, потребность в фотогенерации и полная процедура доступа на странице ИИ Изображения. Проверка контейнера и исправление кэша на странице Docker.

Связанные страницы

Ссылки и источники

КатегорияРесурсURL
Официальная документацияOllamagithub.com/ollama/ollama
Официальная документацияOpen WebUIdocs.openwebui.com
Используемая версияOllama 0.32.6 · Open WebUI 0.11.0 · Ubuntu Server 24.04 LTS (nœud VM210)—
ЛицензияOllama — MIT · Open WebUI — BSD-3-Clause—
Содержимое этой страницыПубликуется под CC BY-SA 4.0creativecommons.org/licenses/by-sa/4.0