[RTX 5090] → [Ollama] → [Open WebUI / API REST] → [Utilisateur / n8n / RAG pgvector]
В ходе более ранней диагностики (анализ резких отключений при некоторых агентных нагрузках) RTX 5090 была программно ограничена до 400 Вт вместо 600 Вт по умолчанию. Тесты ComfyUI и Ollama 27–28 сентября 2026 затем проводились при 600 Вт по явному решению. Устойчивый выигрыш в стабильности или сравнение производительности между этими ограничениями не установлены.
Ограничение не влияет ни на VRAM, ни на размер моделей. Приведённая ниже процедура для 400 Вт сохраняет след диагностики; она больше не описывает текущее состояние.
nvidia-smi \ --query-gpu=power.limit,power.default_limit \ --format=csv,noheader # → 600.00 W, 600.00 W
Диагностическое значение (историческое): sudo nvidia-smi --power-limit=400 (не сохраняется). Возврат к заводскому ограничению: sudo nvidia-smi --power-limit=600.
| Семейство | Модели | Назначение |
|---|---|---|
| Meta | Llama 3.x | Качественная универсальная LLM |
| Mistral AI | Mistral 7B/22B | Эффективная LLM, хорошее соотношение производительность/размер |
| Gemma 2 | Компактная и быстрая LLM | |
| Microsoft | Phi-3 | LLM малого размера |
| NousResearch | Hermes | Продвинутый ИИ-агент — 🔵 проверено (платформа разработки) |
| Инструмент | Роль | Версия | Порт |
|---|---|---|---|
| Ollama | Локальный сервер инференса LLM | 0.32.6 | 11434 |
| Open WebUI | Чат-интерфейс (в стиле ChatGPT) + RAG | 0.11.0 | 3000 |
| n8n | Оркестрация ИИ-воркфлоу | — | 5678 |
# Lister les modèles installés
ollama list
# Télécharger un modèle
ollama pull mistral
ollama pull llama3
# Inférence directe
ollama run mistral
# API REST
curl http://localhost:11434/api/generate \\
-d '{"model": "mistral", "prompt": "Résume en 3 points :", "stream": false}'- Локальный хостинг LLM (частная ИИ-инфраструктура, без облака)
- Сравнение и выбор моделей LLM исходя из задач
- Настройка Ollama (модели, API, параметры инференса)
- Развёртывание Open WebUI в качестве пользовательского интерфейса
- Интеграция LLM в конвейеры через REST API
- Архитектура ИИ-агентов на базе Hermes + n8n
Linux-узел ИИ (VM210) теперь запускает ComfyUI 0.36.0 и Ollama на одной и той же RTX 5090 (32 ГБ). Модель RealVisXL V5.0 (фотореалистичное производное SDXL) сгенерировала портреты 512×512 и 1024×1024. Было проверено сосуществование с qwen3:8b, а затем — выгрузка моделей без остановки серверов. Автоматическое распределение запросов ещё предстоит реализовать (пока переключение вручную).
| Тест | Наблюдение | Область применимости |
|---|---|---|
| Портрет 512×512, 8 шагов | 8,03 с (включая начальную загрузку) | Функциональная проверка |
| Портрет 1024×1024, 30 шагов | Изображение получено (DPM++ SDE Karras) | Длительность указана не с полной уверенностью |
| Qwen3 8B + RealVisXL | 19 001 МиБ VRAM (выборка) | Qwen 100% GPU, контекст 40 960 |
| Выгрузка ComfyUI | 7 376 → 742 МиБ · HTTP 200 | Сервер оставался активным |
| Перезагрузка + генерация за 8 шагов | 7,40 с · возврат к 7 376 МиБ | Полный цикл без перезапуска |
| Выгрузка Qwen3 8B (ComfyUI остановлен) | Возврат к 2 МиБ | Сервис Ollama по-прежнему доступен |
MODEL_FILE='<chemin-du-checkpoint>' EXPECTED_SHA256='<empreinte-publiee-du-checkpoint>' printf '%s %s\n' "$EXPECTED_SHA256" "$MODEL_FILE" | sha256sum --check nvidia-smi nvidia-smi --query-gpu=power.limit,power.default_limit --format=csv,noheader
Ожидаемая контрольная сумма должна браться из доверенного репозитория модели, а не только из скачанного файла.
nvidia-smi \ --query-gpu=timestamp,temperature.gpu,power.draw,memory.used,utilization.gpu \ --format=csv,noheader --loop=1
Выводы и ограничения
- Граф, смешивающий RealVisXL с узлами SD3/AuraFlow, был отклонён; адаптированный граф SDXL затем сработал
- Заблокированная отмена потребовала целевого перезапуска без установления точной причины блокировки
- Анатомический реализм, позы и качество в большом масштабе ещё предстоит оценить — один удачный портрет недостаточен для их подтверждения
- Агентные интеграции/n8n, общий контроль допуска и политика перезапуска после перезагрузки остаются открытыми задачами
Подробные результаты, потребность в фотогенерации и полная процедура доступа на странице ИИ Изображения. Проверка контейнера и исправление кэша на странице Docker.