Хотите запускать SOTA-модели локально? Автор собрал систему с 4x NVIDIA RTX PRO 6000 (по 96GB VRAM каждая, итого 384GB) на базе старого EPYC-сервера с eBay. Вместо дорогих PCIe5/DDR5 он взял DDR4 и PCIe4-коммутатор от c-payne — это позволило GPU общаться напрямую через switch, минуя CPU. Результат: P2P-скорость 27.5 GB/s в одну сторону, 50.4 GB/s в обе, задержка 0.37–0.45 мкс — почти полная пропускная способность Gen4.
Бюджетный вариант — 2x RTX 3090 (48GB VRAM) для Qwen3.6-27B плюс whisper-large-v3 для локального распознавания речи. Автор считает его очень полезным и безопасным по сравнению с облачными сервисами. Для SOTA, близкого к Claude Opus, нужно 4x RTX 6000 Pro. Система обошлась в $5,587 (материнка ASRock Rack ROMED8-2T, CPU AMD EPYC 7313P, 128GB DDR4 ECC, корпус, блоки питания, switch) плюс ~$46k за сами GPU.
Чтобы всё заработало, пришлось повозиться с BIOS: принудительно выставить PCIe Link Speed Gen4 (иначе Blackwell-карты падали до Gen1), отключить ASPM, включить Re-Size BAR, выключить SR-IOV. Грубый параметр iommu=off и amd_iommu=off — иначе NCCL зависал при multi-GPU P2P. ACS отключают скриптом через setpci при каждой загрузке — иначе трафик шёл через CPU, а не через switch.
Автор не стал тянуть 220V и (неразумно) питает всё от одной 110V линии, но ограничил мощность карт до 350W через nvidia-smi (по умолчанию 600W). При полной нагрузке 4 карты + система ≈ 1.4 кВт. Для хранения весов — ZFS на двух 8TB NVMe, модели качаются через hf download, каждый запускается в отдельном Docker-контейнере с read-only монтированием. Доступ к моделям — через opencode на другой машине по HTTP.