Сколько видеопамяти нужно ускорителю под вашу модель
Что занимает память при инференсе и при обучении, ориентиры по размеру модели, способы снизить требование и когда объём перестаёт быть главным.
Объём памяти ускорителя определяет, поместится ли модель в один графический процессор или потребуется разбивать её на несколько устройств. От этого зависит и число ускорителей в сервере, и схема связи между узлами, и итоговая стоимость решения. Расчёт ведётся до закупки, по числу параметров модели и режиму работы.
Разберём, как считать требуемый объём памяти ускорителя NVIDIA для обучения и для инференса, что занимает память кроме весов модели, как влияет длина контекста и когда объём заменяется распределением по нескольким устройствам.
Что занимает память при инференсе
- Веса модели. Число параметров, умноженное на размер одного значения. В формате половинной точности — 2 байта на параметр, в восьмибитном — 1 байт, в четырёхбитном — около 0,5 байта.
- Кеш промежуточных состояний. Растёт линейно с длиной контекста и числом одновременных запросов. На длинных контекстах занимает больше места, чем сами веса.
- Активации текущего слоя. Зависят от размера пакета и ширины слоя, обычно небольшая доля.
- Служебные буферы. Рабочая память вычислительных библиотек и обмена, порядка 1–2 ГБ на устройство.
Практический ориентир для инференса: объём весов плюс 20–30 % на кеш и служебные структуры при коротком контексте. При длинном контексте и высокой нагрузке доля кеша растёт кратно, и её считают отдельно.
Что занимает память при обучении
- Веса модели. Как и при инференсе.
- Градиенты. Столько же, сколько весов.
- Состояния оптимизатора. Для распространённых алгоритмов — вдвое–вчетверо больше объёма весов.
- Активации для обратного прохода. Зависят от размера пакета, длины последовательности и числа слоёв; при полном сохранении становятся основной долей.
- Копия весов повышенной точности. При смешанной точности хранится отдельно.
Суммарно полное обучение требует памяти в 12–20 раз больше объёма весов в половинной точности. Дообучение с адаптерами, когда обновляется малая доля параметров, снижает требование в несколько раз: состояния оптимизатора и градиенты хранятся только для обучаемой части.
Ориентиры по размеру модели
| Размер модели | Веса в половинной точности | Инференс, короткий контекст | Дообучение с адаптерами | Полное обучение |
|---|---|---|---|---|
| 7–8 млрд параметров | ≈ 15 ГБ | 20–24 ГБ | 40–48 ГБ | от 160 ГБ |
| 13 млрд параметров | ≈ 26 ГБ | 32–40 ГБ | 64–80 ГБ | от 300 ГБ |
| 30–34 млрд параметров | ≈ 68 ГБ | 80 ГБ и более | 160 ГБ | от 700 ГБ |
| 70 млрд параметров | ≈ 140 ГБ | 2 × 80 ГБ | 4 × 80 ГБ | от 1,4 ТБ |
| 180 млрд параметров и выше | от 360 ГБ | от 8 устройств | от 8 устройств | кластер узлов |
Значения в таблице — ориентиры для предварительного расчёта. Точная величина зависит от архитектуры модели, формата хранения весов и параметров нагрузки.
Как снизить требование к памяти
- Квантование весов. Перевод в восьмибитный или четырёхбитный формат сокращает объём весов в два–четыре раза. Влияние на качество проверяется на своей выборке.
- Пересчёт активаций. При обучении часть промежуточных результатов не хранится, а вычисляется заново на обратном проходе: память сокращается за счёт роста времени.
- Дообучение с адаптерами. Обновляется малая доля параметров, полные состояния оптимизатора не хранятся.
- Разделение по устройствам. Модель разрезается по слоям или по тензорам между несколькими ускорителями.
- Вынос состояний в память узла. Состояния оптимизатора хранятся в оперативной памяти сервера; требует высокой пропускной способности шины.
- Ограничение длины контекста и числа одновременных запросов. Прямо уменьшает объём кеша промежуточных состояний.
Когда объём памяти перестаёт быть главным
- Пропускная способность памяти. При инференсе с малым размером пакета скорость определяется скоростью чтения весов, а не вычислениями.
- Связь между устройствами. При разделении модели обмен между ускорителями становится узким местом; шина внутри узла и сеть между узлами считаются отдельно.
- Питание и охлаждение. Восемь ускорителей в узле задают требования к стойке, которые проверяются до заказа.
- Совместимость с платформой. Число слотов, схема питания и профиль карты проверяются по модели сервера.
Что прислать для расчёта
- Число параметров модели и её архитектуру.
- Режим работы: обучение с нуля, дообучение или только инференс.
- Требуемую длину контекста и число одновременных запросов.
- Допустимый формат весов и требования к качеству ответа.
- Целевое время отклика или число обработанных запросов в секунду.
- Имеющуюся серверную платформу и параметры стойки по питанию и охлаждению.
Частые вопросы
Хватит ли одного ускорителя на 80 ГБ для модели на 70 млрд параметров? Для инференса в четырёхбитном формате — да, с ограничениями по контексту. В половинной точности одни только веса занимают около 140 ГБ, и требуется минимум два устройства.
Насколько квантование ухудшает качество? Зависит от модели и задачи. Восьмибитный формат обычно даёт незначительное расхождение, четырёхбитный требует проверки на своей выборке до перевода в работу.
Что важнее — объём памяти или её пропускная способность? Объём определяет, запустится ли модель вообще. Пропускная способность определяет скорость. Сначала проверяется объём, затем считается производительность.
Можно ли добрать объём несколькими картами меньшего размера? Да, но появляется обмен между устройствами. Для моделей, помещающихся в одну карту, единое устройство большего объёма работает быстрее.
Сколько памяти закладывать на рост? Ориентир — запас 30–50 % относительно текущей модели: рост длины контекста и числа одновременных запросов расходует память быстрее, чем увеличение самой модели.
Что мы делаем
Считаем требуемый объём памяти по параметрам модели и режиму работы, подбираем ускорители NVIDIA под обучение и инференс, проверяем совместимость с серверной платформой, считаем питание и охлаждение стойки, комплектуем узлы и связь между ними. При ограничениях по срокам и бюджету рассматриваем ускорители MetaX как альтернативу с проверкой совместимости на пилоте.
Пришлите описание модели, режим работы и требования к отклику на sale@tkasiatorg.ru — посчитаем требуемый объём памяти, подберём конфигурацию узла и дадим цены и сроки поставки.

