MetaX C588 или C600 — что даёт масштабирование до 256 карт
Чем различаются конфигурации MetaX C588 и C600, когда достаточно узла на восемь карт и что требуется от инфраструктуры при пуле из нескольких узлов.
Разница между MetaX C588 и C600 — это не разница в производительности одной карты, а разница в предельном размере пула, который из них собирается. C588 рассчитан на узел из восьми карт с общей памятью до 896 ГБ, C600 — на конструктив OAM 2.0 с масштабированием до 256 карт. Выбор между ними определяется тем, работает модель в пределах одного сервера или ей нужна связность между узлами.
Разберём, чем различаются конфигурации ускорителей MetaX, что даёт масштабирование до 256 карт и какие данные нужны для расчёта.
Линейка серии C
- C500 — исполнение PCIe, 64 ГБ памяти с коррекцией ошибок, соединение MetaXLink в конфигурациях на две и четыре карты.
- C500X — оптический MetaXLink, наращивание в пределах узла на 16–64 карты, 64 ГБ памяти с коррекцией ошибок, виртуализация ресурсов, потребление 350 Вт.
- C588 — конфигурация MetaXLink на восемь карт с суммарным объёмом памяти до 896 ГБ.
- C600 — конструктив OAM 2.0, 144 ГБ памяти с коррекцией ошибок на карту, MetaXLink совместно с Ethernet, масштабирование до 256 карт, воздушное и жидкостное охлаждение, потребление 1000 Вт.
Сравнение C588 и C600
| Параметр | C588 | C600 |
|---|---|---|
| Конструктив | модуль в составе узла на восемь карт | OAM 2.0 |
| Память на карту | до 112 ГБ при суммарных 896 ГБ на узел | 144 ГБ с коррекцией ошибок |
| Межкарточное соединение | MetaXLink в пределах узла | MetaXLink совместно с Ethernet между узлами |
| Предел масштабирования | восемь карт в узле | до 256 карт |
| Потребление | определяется конфигурацией узла | 1000 Вт на карту |
| Охлаждение | воздушное в серверном корпусе | воздушное или жидкостное |
Что даёт масштабирование до 256 карт
Предел масштабирования определяет верхнюю границу задач, которые можно посчитать без разбиения на независимые части. При обучении модель и состояния оптимизатора распределяются между картами, и объём совокупной памяти пула становится жёстким ограничением: модель либо помещается в пул целиком, либо требует схем распределения, которые заметно снижают эффективность.
Восемь карт с общей памятью до 896 ГБ закрывают обучение и дообучение значительной части прикладных моделей в пределах одного сервера — при этом весь обмен идёт по внутреннему соединению, без сетевой части. Пул до 256 карт нужен там, где одного узла не хватает: тогда к внутреннему соединению добавляется межузловая сеть, и её пропускная способность и задержки становятся частью расчёта наравне с самими ускорителями.
Когда достаточно узла на восемь карт
- Инференс под нагрузкой с несколькими моделями и разделением ресурсов между командами.
- Дообучение прикладных моделей на собственных данных.
- Инженерные расчёты и аналитика, где задача делится на независимые части.
- Потоковая обработка видео, детекция и распознавание в реальном времени.
В этих сценариях увеличение пула сверх одного узла усложняет эксплуатацию, но не даёт пропорционального выигрыша: узкое место находится в подготовке данных или в хранилище, а не в связности карт.
Когда нужен пул из нескольких узлов
Пул на десятки и сотни карт оправдан при обучении больших языковых моделей с нуля, при длительных циклах обучения, когда время расчёта напрямую переводится в срок вывода продукта, и при работе нескольких команд с общим ресурсом, распределяемым через виртуализацию. Здесь же появляется требование к охлаждению: при потреблении 1000 Вт на карту воздушное охлаждение накладывает ограничения на плотность стойки, и жидкостный контур становится не опцией, а условием реализуемости проекта.
Инфраструктура под пул ускорителей
- Подведённая мощность на стойку и схема распределения по вводам.
- Тип охлаждения: воздушный поток нужного напора либо жидкостный контур с теплообменником.
- Серверные платформы, блоки питания и корпуса, проверенные под выбранный конструктив.
- Межузловая сеть — пропускная способность и задержки определяют эффективность обучения на большом пуле.
- Хранилище: скорость подачи данных должна соответствовать скорости их обработки.
Программная часть и перенос нагрузки
Платформа MXMACA ориентирована на совместимость с распространёнными фреймворками, поэтому перенос типовых конвейеров обычно ограничивается настройкой окружения. При этом экосистема моложе привычной, часть библиотек требует адаптации, а производительность на конкретной задаче нужно проверять на своей нагрузке — по чужим замерам этот вопрос не закрывается.
Поэтому проект начинают с пилота: тестовый узел, прогон ваших моделей, замер и сравнение с текущим оборудованием. По результатам собирается спецификация под серию — с понятным ответом, нужен ли узел на восемь карт или пул из нескольких узлов. В исследовании МФТИ ускорители MetaX показали стабильный запуск популярных моделей, корректную работу ключевых фреймворков и предсказуемую производительность, в ряде сценариев превзойдя NVIDIA A100.
Что прислать для расчёта
- Модель или класс моделей, объём данных, режим работы — обучение, дообучение или инференс.
- Требуемую память и целевое время расчёта.
- Число команд и потребность в виртуализации ресурсов.
- Данные по площадке: подведённая мощность, тип охлаждения, свободное место в стойках.
Частые вопросы
Обязательно ли начинать с большого пула? Нет. Обычная схема — пилот на одном сервере с замером на ваших моделях, затем масштабирование до нужного размера.
Заработают ли модели без переписывания кода? Платформа MXMACA рассчитана на совместимость с привычными фреймворками; перенос типовых конвейеров обычно сводится к настройке окружения.
Нужен ли жидкостный контур для C600? Не всегда: поддерживается и воздушное охлаждение. Выбор зависит от допустимой плотности стойки и температуры воздуха в помещении.
Можно ли разделить ресурсы между командами? Да, виртуализация позволяет держать на одном сервере несколько параллельных задач с распределением мощностей.
Что мы делаем
Подбираем конфигурацию под сценарий, проверяем серверные платформы, блоки питания и корпуса, планируем виртуализацию ресурсов, выполняем инсталляцию, перенос конвейеров на MXMACA, обучение команды и сопровождение после ввода в работу. Подробнее о линейке — на странице направления ускорителей MetaX.
Расскажите о задаче — модель, объём данных, требуемая память и режим работы — на sale@tkasiatorg.ru. Подберём конфигурацию, посчитаем стоимость владения и сроки поставки, при необходимости соберём пилотный узел под замер.

