Выбор GPU-сервера для ML-задач — это не просто «взять побольше карт». Память, NVLink, объём RAM, хранилище и даже сетевые интерфейсы влияют на скорость обучения и стоимость. Разбираем по порядку, что важно, а на чём можно сэкономить.

1. Тип GPU: H100 или H200

Основной выбор в 2026 году — между NVIDIA H100 80GB и H200 141GB. Если ваша модель помещается в 80 ГБ, берите H100 — это дешевле. Если упираетесь в память при обучении больших моделей (70B+), H200 сокращает количество необходимых карт и часто оказывается выгоднее, несмотря на более высокую цену за единицу.

Подробное сравнение — в нашей статье H100 vs H200.

2. Количество GPU

Количество карт зависит от размера модели и типа задачи:

ЗадачаGPUПамять
Инференс 7B–13B1–280 ГБ
Файн-тюнинг 7B–13B (LoRA)1–280 ГБ
Обучение 7B–13B (full)480 ГБ
Обучение 30B–70B4–880–141 ГБ
Инференс 70B (квантование)2–480 ГБ
Обучение 70B+ (full)8141 ГБ

3. NVLink — критично для обучения

NVLink — это высокоскоростная шина между GPU (900 ГБ/с), которая в разы быстрее PCIe. При распределённом обучении (DDP, FSDP, DeepSpeed) GPU постоянно обмениваются градиентами. Без NVLink этот обмен идёт через PCIe (~64 ГБ/с), что замедляет обучение в 2–5 раз.

Правило: если обучаете на 2+ GPU, нужен NVLink. Для инференса одной модели NVLink не обязателен.

4. Объём оперативной памяти (CPU RAM)

RAM нужна для загрузки данных, препроцессинга и хранения модели перед передачей на GPU. Эмпирическое правило:

Например, для 4× H100 80GB (320 ГБ GPU) нужно минимум 320 ГБ RAM, оптимально — 512 ГБ. Все наши серверы оснащены 256 ГБ – 1 ТБ DDR5 ECC.

5. Хранилище: NVMe обязательно

Обучение ML-моделей — это I/O-интенсивная задача. Датасеты, чекпоинты, логи — всё это читается и пишется постоянно. HDD и SATA SSD — узкое место.

6. Сетевые интерфейсы

Если сервер один — достаточно 10G. Если кластер из нескольких серверов с распределённым обучением — нужен InfiniBand или 25G Ethernet (RoCE). Наши серверы ESC8000A оснащены ConnectX-6 Lx 25G + DAC SFP28.

7. Размещение: ЦОД или ваша площадка

GPU-серверы потребляют 2–10 кВт и требуют интенсивного охлаждения. Не каждый офисный серверный шкаф это потянет. Варианты:

Чек-лист выбора

ПараметрМинимумОптимально
GPUH100 80GBH100/H200 под задачу
NVLinkОбязательно для 2+ GPU
RAM1× GPU memory2× GPU memory
Хранилище1 ТБ NVMe2+ ТБ NVMe RAID
Сеть10G25G для кластеров
Питание2 кВт5–10 кВт
Опишите вашу задачу — мы подберём конфигурацию. Тел: +7 499 350-51-54, email: sales@tenzor.cloud