Выбор GPU-сервера для ML-задач — это не просто «взять побольше карт». Память, NVLink, объём RAM, хранилище и даже сетевые интерфейсы влияют на скорость обучения и стоимость. Разбираем по порядку, что важно, а на чём можно сэкономить.
1. Тип GPU: H100 или H200
Основной выбор в 2026 году — между NVIDIA H100 80GB и H200 141GB. Если ваша модель помещается в 80 ГБ, берите H100 — это дешевле. Если упираетесь в память при обучении больших моделей (70B+), H200 сокращает количество необходимых карт и часто оказывается выгоднее, несмотря на более высокую цену за единицу.
Подробное сравнение — в нашей статье H100 vs H200.
2. Количество GPU
Количество карт зависит от размера модели и типа задачи:
| Задача | GPU | Память |
|---|---|---|
| Инференс 7B–13B | 1–2 | 80 ГБ |
| Файн-тюнинг 7B–13B (LoRA) | 1–2 | 80 ГБ |
| Обучение 7B–13B (full) | 4 | 80 ГБ |
| Обучение 30B–70B | 4–8 | 80–141 ГБ |
| Инференс 70B (квантование) | 2–4 | 80 ГБ |
| Обучение 70B+ (full) | 8 | 141 ГБ |
3. NVLink — критично для обучения
NVLink — это высокоскоростная шина между GPU (900 ГБ/с), которая в разы быстрее PCIe. При распределённом обучении (DDP, FSDP, DeepSpeed) GPU постоянно обмениваются градиентами. Без NVLink этот обмен идёт через PCIe (~64 ГБ/с), что замедляет обучение в 2–5 раз.
Правило: если обучаете на 2+ GPU, нужен NVLink. Для инференса одной модели NVLink не обязателен.
4. Объём оперативной памяти (CPU RAM)
RAM нужна для загрузки данных, препроцессинга и хранения модели перед передачей на GPU. Эмпирическое правило:
- Минимум: 1× от общего объёма GPU-памяти
- Оптимально: 1,5–2× от общего объёма GPU-памяти
- Для даталоадинга: больше RAM = больше workers = быстрее загрузка батчей
Например, для 4× H100 80GB (320 ГБ GPU) нужно минимум 320 ГБ RAM, оптимально — 512 ГБ. Все наши серверы оснащены 256 ГБ – 1 ТБ DDR5 ECC.
5. Хранилище: NVMe обязательно
Обучение ML-моделей — это I/O-интенсивная задача. Датасеты, чекпоинты, логи — всё это читается и пишется постоянно. HDD и SATA SSD — узкое место.
- NVMe SSD — минимум для датасетов и чекпоинтов (3–7 ГБ/с)
- RAID1 — для надёжности (чекпоинты не должны теряться)
- RAID5 — для больших датасетов (объём + отказоустойчивость)
- Объём: 2 ТБ для небольших проектов, 20+ ТБ для больших датасетов и чекпоинтов
6. Сетевые интерфейсы
Если сервер один — достаточно 10G. Если кластер из нескольких серверов с распределённым обучением — нужен InfiniBand или 25G Ethernet (RoCE). Наши серверы ESC8000A оснащены ConnectX-6 Lx 25G + DAC SFP28.
7. Размещение: ЦОД или ваша площадка
GPU-серверы потребляют 2–10 кВт и требуют интенсивного охлаждения. Не каждый офисный серверный шкаф это потянет. Варианты:
- Наш ЦОД — мы обеспечиваем стойку, питание, охлаждение, интернет
- Ваша площадка — вы предоставляете стойку и питание, мы доставляем и монтируем сервер
Чек-лист выбора
| Параметр | Минимум | Оптимально |
|---|---|---|
| GPU | H100 80GB | H100/H200 под задачу |
| NVLink | — | Обязательно для 2+ GPU |
| RAM | 1× GPU memory | 2× GPU memory |
| Хранилище | 1 ТБ NVMe | 2+ ТБ NVMe RAID |
| Сеть | 10G | 25G для кластеров |
| Питание | 2 кВт | 5–10 кВт |
Опишите вашу задачу — мы подберём конфигурацию. Тел: +7 499 350-51-54, email: sales@tenzor.cloud