NVIDIA L40S или L4 — что взять под инференс и видеоаналитику
Чем различаются ускорители L40S и L4 по памяти, мощности и обработке видео, как считать объём памяти под модель и что проверить в стойке.
Под инференс и видеоаналитику ускоритель выбирают не по пиковой производительности, а по трём связанным величинам: объёму видеопамяти под модель, мощности на карту в пересчёте на стойку и числу аппаратных блоков обработки видео. По этим величинам L40S и L4 расходятся сильнее, чем по вычислительным характеристикам, и потому закрывают разные задачи.
Разберём, чем различаются ускорители NVIDIA L40S и L4, где проходит граница между ними и что нужно посчитать до закупки.
Две карты одного поколения с разным назначением
L40S — полноразмерный ускоритель двойной ширины с 48 ГБ видеопамяти GDDR6 с коррекцией ошибок и потреблением до 350 Вт. Он рассчитан на нагрузку, где нужен запас памяти: инференс крупных моделей без агрессивного квантования, дообучение моделей среднего размера, генеративные задачи, а также графические и рендерные сценарии.
L4 — низкопрофильная карта одинарной ширины с 24 ГБ видеопамяти GDDR6 и потреблением около 72 Вт. Питание берётся от слота, дополнительные силовые разъёмы не требуются. Такая карта ставится в узлы высокой плотности и рассчитана на массовый поток однотипных запросов: распознавание, детекция, транскодирование видео, инференс моделей, укладывающихся в 24 ГБ.
Сравнение по ключевым параметрам
| Параметр | L40S | L4 |
|---|---|---|
| Видеопамять | 48 ГБ GDDR6 с коррекцией ошибок | 24 ГБ GDDR6 |
| Потребление | до 350 Вт | около 72 Вт, питание от слота |
| Форм-фактор | полноразмерная, двойной ширины | низкопрофильная, одинарной ширины |
| Охлаждение | пассивное, требует продуваемого корпуса | пассивное, невысокий тепловой поток |
| Типовая задача | инференс крупных моделей, дообучение, генеративные и графические задачи | потоковая видеоаналитика, транскодирование, инференс компактных моделей |
| Плотность в узле | ограничена мощностью и шириной карты | высокая, много карт на юнит |
Как выбрать по объёму памяти
Первое ограничение — помещается ли модель в память карты вместе с рабочими буферами. Для инференса требуемый объём складывается из весов модели в выбранной точности, кэша контекста и служебных структур. Модель, которая формально занимает меньше 24 ГБ, на длинном контексте и при нескольких одновременных запросах может выйти за этот предел, и тогда карту приходится либо разгружать квантованием, либо менять на более ёмкую.
Практический подход: считать не «влезет ли модель», а «влезет ли модель при целевом числе одновременных запросов и целевой длине контекста». Если запас по памяти получается меньше 20–25 %, разумнее брать 48 ГБ.
Видеоаналитика и аппаратные кодеки
В задачах видеоаналитики нагрузка распадается на две части: декодирование потоков и собственно инференс. Декодирование выполняется аппаратными блоками, и именно их количество определяет, сколько камер обслужит одна карта. Обе модели содержат аппаратные кодеры и декодеры с поддержкой современных форматов, включая AV1, но соотношение блоков у них разное: L4 ориентирована на большое число параллельных декодируемых потоков, L40S — на смешанную нагрузку с более тяжёлой вычислительной частью.
Расчёт ведут от параметров потока: разрешение, частота кадров, кодек, число камер, частота срабатывания детектора. Из этого получают требуемое число декодируемых потоков и вычислительную нагрузку на карту, а уже потом выбирают модель.
Что считать по питанию и охлаждению стойки
Различие в 350 и 72 Вт на карту меняет проект стойки целиком. Узел с несколькими L40S требует блоков питания соответствующей мощности, продуваемого корпуса с достаточным напором вентиляторов и подведённой мощности на стойку; узел с картами L4 умещается в обычный бюджет питания и не требует пересмотра охлаждения.
- Подведённая мощность на стойку и распределение по вводам.
- Мощность блоков питания сервера с учётом резервирования.
- Тип охлаждения и допустимая температура воздуха на входе.
- Глубина шкафа и совместимость платформы с полноразмерными картами двойной ширины.
- Число линий шины PCI Express, доступных каждому слоту.
Совместимость с платформой
Карта должна не только физически встать в сервер, но и быть заявленной в списке поддерживаемых для конкретной платформы. Проверяются процессоры и платформа, матрица по блокам питания, тесты корпусов на тепловой режим. Отдельно смотрят требования к продуву: пассивные ускорители рассчитаны на серверный поток воздуха и в корпусах с недостаточным напором вентиляторов уходят в тепловое ограничение производительности.
Что прислать для подбора
- Задачу: инференс какой модели, дообучение, видеоаналитика, рендер.
- Для видеоаналитики — число камер, разрешение, кодек и частоту кадров.
- Требуемое число одновременных запросов и целевую задержку ответа.
- Модель серверной платформы, свободные слоты и подведённую мощность на стойку.
Частые вопросы
Можно ли обучать модели на L40S? Дообучение и обучение моделей среднего размера — да. Для обучения больших моделей рассматривают ускорители с памятью с высокой пропускной способностью и быстрым межкарточным соединением.
Что взять, если модель не помещается в 24 ГБ? Либо L40S с 48 ГБ, либо распределение модели между несколькими картами. Второй вариант усложняет эксплуатацию и требует проверки на вашей нагрузке.
Сколько карт L4 поместится в один сервер? Зависит от платформы: низкопрофильный форм-фактор и питание от слота позволяют собрать плотные конфигурации, но фактическое число определяется числом слотов и линий шины.
Предложите аналог, если сроки поставки не устраивают? Да, подберём ускорители MetaX как аналоги с расчётом того, что вы теряете и что выигрываете при переходе.
Что мы делаем
Подбираем ускоритель под задачу, проверяем совместимость с платформой, поставляем с документами и вводим в эксплуатацию. Перед отгрузкой фиксируем серийные номера, делаем фотографии и видео партии, пломбируем упаковку и прогоняем карты через нагрузочные испытания. Передаём договор и спецификацию, сертификаты соответствия и подтверждения происхождения. Подробнее — на странице направления ускорителей NVIDIA.
Опишите задачу и параметры нагрузки на sale@tkasiatorg.ru — посчитаем требуемый объём памяти и число карт, проверим совместимость с вашей платформой и подготовим спецификацию.

