🖥️ Аппаратные компоненты
| Компонент | Характеристики | Роль |
|---|---|---|
| CPU | AMD Ryzen 9 9950X3D — 16 ядер / 32 потока | Инференс ИИ · Виртуализация KVM |
| GPU | NVIDIA GeForce RTX 5090 | Инференс LLM · Генерация изображений |
| RAM | 192 ГБ DDR5 (~186 ГиБ доступно) | Память для нескольких ВМ · крупные модели |
| Хранилище | 2× SSD NVMe в зеркале ZFS (~1,75 ТиБ полезных) | Виртуальные диски · датасеты ИИ · отказоустойчивость |
| Гипервизор | Proxmox VE 9.2.2 | Виртуализация · назначение GPU |
| Сеть | Ethernet | Мост Proxmox · доступ в LAN |
⚙️ BIOS/UEFI — подтверждённое значение
| Параметр | Состояние | Назначение |
|---|---|---|
| IOMMU (AMD) | ✅ Включён и проверен | GPU Passthrough VFIO |
Остальные значения BIOS (Above 4G Decoding, Re-Size BAR, Secure Boot…) не публикуются: подтверждено лишь включение IOMMU (см. GPU / VFIO). Работающий passthrough не заменяет датированный отчёт.
🎯 Применённые компетенции
- Архитектура высокопроизводительного локального ИИ-сервера
- Подбор аппаратного обеспечения для инференса на GPU (VRAM, пропускная способность)
- Расчёт CPU/RAM для гипервизора с несколькими ВМ
- Настройка BIOS/UEFI для виртуализации и PCIe passthrough
- Управление высокопроизводительным хранилищем NVMe на ZFS
🧩 Распределение ролей — виртуальные машины
| ВМ | Роль | Основа | Ключевые компоненты |
|---|---|---|---|
| VM200 | Обратный прокси — точка входа Web / публикация HTTPS | Ubuntu Server 24.04 LTS · без GPU | Nginx · Certbot (Let's Encrypt) · Fail2ban · локальный файрвол |
| VM205 | Файловый сервис — Nextcloud | Ubuntu Server 24.04 LTS · без GPU | Nextcloud + MariaDB (контейнеры Docker) · автозапуск |
| VM210 | Узел ИИ — нагрузки GPU | Ubuntu Server 24.04 LTS · RTX 5090 (passthrough) | Docker + NVIDIA Container Toolkit · Ollama · Open WebUI |
| VM215 | Общие сервисы — без GPU | Ubuntu Server 24.04 LTS · выделенный диск ext4 | PostgreSQL 18.4 · pgvector 0.8.6 (векторный бэкенд RAG) |
| VM300 | Потребитель ИИ — автоматизация | Ubuntu Server 24.04 LTS · без GPU | n8n (оркестрация workflow) · автозапуск |
Принцип: GPU напрямую назначается тем ВМ, которым он нужен; нагрузки на GPU (VM210) и общие сервисы CPU (VM215) разделены, чтобы уменьшить зависимости и упростить резервное копирование.
Индустриализация: ВМ создаются на основе типовых и CUDA-шаблонов, настраиваемых через Cloud-Init; их пересборка следует обратимой процедуре (перед любой заменой проверяется контрольный клон).
Ограничения: ранее использовалось программное диагностическое ограничение мощности 400 Вт (против 600 Вт по умолчанию); последние тесты ComfyUI/Ollama проводились при 600 Вт, без гарантии долгосрочной стабильности и без установленного сравнения производительности (методика — на странице ИИ и LLM). Снимки ZFS также облегчают технические откаты, но не заменяют независимое резервное копирование — эта политика пока в стадии определения.
Индустриализация: ВМ создаются на основе типовых и CUDA-шаблонов, настраиваемых через Cloud-Init; их пересборка следует обратимой процедуре (перед любой заменой проверяется контрольный клон).
Ограничения: ранее использовалось программное диагностическое ограничение мощности 400 Вт (против 600 Вт по умолчанию); последние тесты ComfyUI/Ollama проводились при 600 Вт, без гарантии долгосрочной стабильности и без установленного сравнения производительности (методика — на странице ИИ и LLM). Снимки ZFS также облегчают технические откаты, но не заменяют независимое резервное копирование — эта политика пока в стадии определения.