Step 3: GPU Integration & PCIe Risers — устанавливаем видеокарты правильно
Теперь у нас уже есть проверенная базовая платформа: оба процессора работают, память определяется полностью, сервер проходит POST без видеокарт. Только после этого имеет смысл переходить к GPU.
Видеокарты — самая дорогая и обычно самая доходная часть DePIN-сервера. Поэтому здесь особенно важно не превращать установку в принцип «воткнул четыре карты и надеюсь, что всё заработает». Наша задача — сделать так, чтобы каждая GPU была правильно подключена, надёжно закреплена, получала достаточное питание и воздух, а система видела все карты стабильно.
1. Почему в одном сервере лучше использовать одинаковые GPU
Идеальный вариант — четыре одинаковые видеокарты одной модели и с одинаковым объёмом VRAM. Например, четыре RTX 4090 или четыре RTX 3090.
Причина не в том, что разные карты физически не смогут работать вместе. Linux действительно может увидеть смесь разных моделей. Проблема начинается выше: DePIN-платформа может по-разному оценивать карты, назначать им разные задания, требовать определённый объём VRAM или считать машину как неоднородный ресурс.
Когда все GPU одинаковые, гораздо проще прогнозировать производительность, температуру, энергопотребление и поведение под нагрузкой. Если одна карта греется или работает иначе остальных, это сразу видно.
2. Что важнее названия GPU — VRAM и реальная совместимость
Для вычислительных задач важен не только сам GPU-чип, но и объём видеопамяти. VRAM — это собственная быстрая память видеокарты, в которой помещаются модели, рабочие данные и промежуточные результаты.
Например, карта может быть очень быстрой, но если конкретная задача требует больше памяти, чем на ней есть, задача просто не запустится. Поэтому при выборе GPU всегда смотрим требования сети, а не только общие рейтинги карт.
Старшая карта не всегда автоматически выгоднее. Иногда более дешёвая GPU с большим объёмом VRAM оказывается экономически разумнее для определённого рынка задач.
3. PCIe 3.0 — что это значит для нашей платформы
Supermicro X11DAi-N вместе с Xeon Gold 6230 работает на платформе PCIe 3.0. Это шина, через которую CPU и система общаются с видеокартами.
Современные GPU могут поддерживать PCIe 4.0 или 5.0, но это не проблема: стандарты обратно совместимы. Карта PCIe 4.0 может работать в слоте PCIe 3.0, просто скорость шины будет ограничена возможностями платформы.
Важно понимать: если купить очень дорогой riser с надписью «PCIe 5.0», сама X11DAi-N от этого не превратится в PCIe 5.0. Кабель должен быть качественным и совместимым, но скорость задаётся всей платформой.
4. Что такое PCIe-riser и зачем он нам
PCIe-riser — это удлинитель между слотом материнской платы и видеокартой. Он позволяет разместить GPU не прямо над материнской платой, а там, где её удобнее закрепить и охлаждать.
В многокарточном сервере это очень полезно. Четыре мощные видеокарты, поставленные вплотную, начинают душить друг друга по воздуху. Riser даёт возможность разнести карты, построить нормальный поток и оставить доступ к кабелям.
Для этой сборки используем полноразмерные экранированные PCIe x16 extension/riser cables хорошего качества.
5. Почему нельзя использовать дешёвые USB-riser от майнинга
В старых майнинговых фермах часто применяются переходники, где карта подключается к плате через узкий PCIe x1 и USB-подобный кабель. Для добычи криптовалюты это часто было достаточно: карта в основном считала локально и мало обменивалась данными с CPU.
В DePIN вычислительные задачи могут активно передавать данные между CPU, RAM и GPU. Узкое соединение становится бутылочным горлышком. Поэтому майнинговые x1-riser здесь использовать не нужно.
Нам нужен нормальный PCIe-канал, а не просто способ заставить систему «увидеть» карту.
6. Электрическая ширина слота и физический размер — не одно и то же
Разъём может выглядеть как полный x16, но фактически иметь меньше линий. Это называется электрическая ширина слота.
На двухпроцессорной плате часть PCIe-ресурсов также связана с конкретным CPU. Поэтому при установке четырёх GPU нужно сверяться с руководством X11DAi-N и распределением слотов, а не исходить только из их внешнего вида.
Для нас главное — получить предсказуемую конфигурацию, где все карты видны и работают без конфликтов.
7. Не ставим сразу четыре карты
Самый удобный способ собрать многокарточный сервер — добавлять GPU постепенно.
Сначала ставим одну карту, включаем сервер и убеждаемся, что система её видит. Потом добавляем вторую, снова проверяем. После этого третью и четвёртую.
Так, если после добавления очередной карты сервер перестал проходить POST или карта не определяется, мы сразу знаем, где искать: конкретный слот, riser, кабель, питание или сама GPU.
Если установить всё одновременно, потом приходится диагностировать десяток возможных причин сразу.
8. Как проверить б/у видеокарту до окончательной сборки
GPU с вторичного рынка может быть очень выгодной покупкой, но её нужно проверять до того, как она станет частью четырёхкарточной системы.
Смотрим состояние вентиляторов, разъёмов питания и корпуса. После установки запускаем нагрузочный тест, наблюдаем температуру ядра, памяти и стабильность. Карта не должна давать артефакты, отваливаться под нагрузкой или резко снижать частоты из-за перегрева.
Если одна из четырёх одинаковых карт ведёт себя заметно хуже остальных, проблему лучше решить сейчас, а не после подключения сервера к платной нагрузке.
9. Механическое крепление — GPU не должна висеть на кабеле
Современные видеокарты тяжёлые. Riser-кабель предназначен для передачи сигналов, а не для удержания веса карты.
Каждая GPU должна иметь отдельное механическое крепление к раме корпуса или специальному GPU-frame. Карта не должна болтаться при перемещении сервера и давить своим весом на разъём.
Особенно внимательно относитесь к питанию и riser-кабелям: не перегибайте их прямо у коннектора и не прижимайте к горячим радиаторам.
10. Охлаждение четырёх GPU
Наша цель — не добиться самой низкой температуры на холостом ходу, а обеспечить устойчивую температуру под длительной нагрузкой.
Если карты открытого типа, они выбрасывают горячий воздух внутрь корпуса. Значит, fan wall должен постоянно заменять этот воздух холодным. Между картами полезно оставить максимально возможный зазор.
Если одна карта находится в «кармане» горячего воздуха и стабильно горячее остальных, обычно причина именно в потоке, а не в самой GPU.
11. nvidia-smi — главный первый тест в Linux
После установки Ubuntu и драйвера NVIDIA у нас появится команда nvidia-smi. Она показывает, какие карты видит система, их модель, загрузку, температуру, использование памяти и версию драйвера.
Для четырёхкарточного сервера это первое место, куда мы смотрим после загрузки. Если установлено четыре GPU, а nvidia-smi показывает три, не запускаем DePIN-движок, пока не найдена причина.
12. Не смешиваем проблемы GPU и питания
Очень часто «нестабильная видеокарта» на самом деле оказывается проблемой питания: плохой кабель, перегруженный разъём, слабый PSU или неправильное распределение нагрузки между двумя блоками.
Поэтому на этом шаге мы физически устанавливаем карты и проверяем их обнаружение, а окончательную силовую схему разбираем в Step 4. Если карта исчезает именно под нагрузкой, питание проверяется одним из первых.
13. Когда четыре карты действительно не нужны
Сервер рассчитан максимум на четыре GPU, но это не означает, что начинать обязательно с четырёх. Можно запустить одну или две карты, проверить экономику и постепенно расширить систему.
Такой подход особенно разумен, если цены на GPU высокие или вы только проверяете конкретную сеть. Платформа уже готова к расширению, но деньги вкладываются постепенно.
Что должно быть готово в конце Step 3
- Выбраны одинаковые совместимые NVIDIA GPU с подходящим объёмом VRAM.
- Карты добавлялись и проверялись поэтапно, а не все сразу.
- Используются качественные полноразмерные PCIe-riser/extension cables, а не майнинговые USB x1.
- Каждая GPU жёстко закреплена и не висит на кабелях.
- Воздушный поток свободно проходит между картами.
- После установки драйвера все GPU одинаково и стабильно видны через nvidia-smi.
Если все карты определяются и механически установлены правильно, переходим к Step 4 — Power Supply и строим силовую систему, которая сможет безопасно питать этот сервер 24/7.