Старые серверные видеокарты NVIDIA Tesla — один из последних источников дешёвой видеопамяти. K80 с 24 ГБ GDDR5 можно найти за 60 долларов, P100-16GB — примерно за 75, а V100-16GB — меньше чем за двести. Автор почти год собирал бенчмарки, чтобы понять, можно ли использовать такие карты в современном домашнем сервере, и потратил немало киловатт-часов, отапливая студию работающими GPU.
За основу он взял платформу X99 с процессорами Intel E5 — сейчас они стоят копейки. Например, E5-2690 c 56 потоками обойдётся в 40 долларов, а материнская плата Supermicro X10DRG-Q с двумя сокетами и семью PCIe слотами — около 200. Всё железо уже снято с производства, свежих драйверов для CUDA не будет, но это не проблема для домашней лаборатории. Можно легко собрать старый софт вроде llama.cpp из исходников, а через Docker всё запускается даже на архитектуре Kepler 2014 года. Да, энергоэффективность у старых карт хромает, но для круглосуточной работы домашний сервер всё равно не рассчитан — не нужен — выключил и сэкономил.
В тестах участвовали K80, M10, M40, M60, P40, P100, V100 и T40. Их гоняли на задачах компьютерного зрения, рендеринга в Blender, работы с LLM (Qwen2.5, Llama 3, MoE-модели), научных расчётах и транскрибации речи через Whisper. Инструмент тестирования опубликован на GitHub: бенчмарки завернуты в Docker-контейнеры и запускаются сначала на каждом GPU по отдельности, потом на всех сразу, а для multi-GPU тестов — с доступом ко всем ядрам.
Несколько неожиданных результатов: V100-16GB почти не уступает редкой и дорогой T40 во всех тестах. M60 за 50 долларов показала отличную производительность в Whisper — если нужно гонять транскрибацию, это отличный вариант. Для LLM люди не зря рекомендуют P40 вместо P100 — тесты это подтвердили. Масштабирование по числу GPU работает почти линейно, без заметных потерь на коммуникации, по крайней мере в пределах 4U-корпуса. А вот смешивать поколения не стоит: V100 в связке с P100 тормозится при работе с языковыми моделями.
Выбор процессора тоже важен. Более быстрые ядра дают прирост почти везде, особенно в Whisper и Vision Transformer (CAT ViT Attention). Для своего проекта streamarize (автоматическая обработка стримов с Twitch в ролики для YouTube) автор собирает узел из трёх V100, одного 8-ядерного E5-1680 на материнской плате Asus X99-WS и 10-гигабитной сетевой карты.