Локальный запуск LLM: сколько видеопамяти нужно | AI Радар
Главная / Статьи / Локальный запуск LLM
Гайд

Локальный запуск LLM: сколько видеопамяти нужно

Обновлено 6 октября 2026Александр ГригорьевГайд

Прежде чем покупать видеокарту для локального запуска LLM, стоит посчитать: сколько видеопамяти реально нужно под конкретный размер модели, и насколько квантование снижает эту планку. Разбираем математику, а не рекламируем конкретные карты.

6–8 ГБ
нужно на практике для модели 7–8B в 4-битном квантовании
7–14B
класс моделей, которые реально помещаются в потребительскую карту
80 ГБ+
нужно для открытых моделей 70B+ без квантования — датацентровый уровень
Цены на датацентровые GPU → Что такое квантование →

Сколько видеопамяти занимает модель: базовая математика

Размер модели в видеопамяти напрямую зависит от числа параметров и точности их хранения. При хранении в формате FP16 (16 бит на параметр, стандартная точность для инференса) модель занимает примерно 2 байта на каждый параметр. Модель на 7 млрд параметров — около 14 ГБ, на 13 млрд — около 26 ГБ, на 70 млрд — около 140 ГБ. Это чистый вес модели, без учёта контекста (KV-кеша) и промежуточных вычислений — на практике к этой цифре нужно добавлять ещё заметный запас.

Видеопамять по размеру модели: FP16 vs 4-битное квантование на практике

ГБ, с учётом реального оверхеда (контекст, framework) — не чистый теоретический вес модели
FP16 — теоретический расчёт (2 байта/параметр). 4-битное квантование — практические значения с учётом реального оверхеда инференса, radarii.ru, 2026

Квантование: тот же результат за меньшую память

Квантование снижает точность хранения весов — например, с 16 бит до 8 или 4 бит на параметр. Важный нюанс: на практике 4-битное квантование снижает требования к памяти не ровно в 4 раза, как в теории, а немного меньше — из-за служебных данных и контекста, которые тоже занимают память. Для модели на 7–8 млрд параметров в 4-битном квантовании (Q4) на практике нужно 6–8 ГБ, а не теоретические 3,5 ГБ — именно эту практическую цифру стоит закладывать при выборе железа, а не чистую математику.

Когда хватит потребительской карты, а когда нужен датацентровый уровень

Модели на 7–8 млрд параметров в 4-битном квантовании (6–8 ГБ) помещаются в карту с 8 ГБ видеопамяти. Модели на 13–14 млрд параметров (9–10 ГБ практически) комфортно работают на 12–16 ГБ. Модели класса 32–35 млрд параметров требуют уже 20–24 ГБ. Модели на 70 млрд параметров даже в квантовании требуют 40–48 ГБ — это либо одна карта такого объёма, либо две потребительские карты по 24 ГБ, объединённые программно. Открытые модели на 70+ млрд параметров без квантования (130+ ГБ) физически не помещаются ни в одну потребительскую карту — нужны карты датацентрового класса вроде A100 80GB или H100, либо несколько карт одновременно. Главный вывод здесь шире математики: для локальных LLM решающий параметр — именно объём видеопамяти, а не скорость вычислений GPU.

Мы сознательно не публикуем здесь конкретные розничные цены на потребительские игровые карты (RTX-серии) — они меняются слишком быстро и слишком сильно расходятся между продавцами, чтобы давать на сайте одну «верную» цифру. Актуальные цены на датацентровые карты (A100, H100, H200), которые реально нужны для серьёзного локального развёртывания, у нас есть и обновляются — на странице цен и рейтинга GPU.

Доступ к LLM без своего железа

Если считать железо нерентабельным — альтернатива локальному запуску — API конкретного провайдера с оплатой по токенам, без вложений в оборудование. Актуальные тарифы доступных в России провайдеров LLM API — в отдельной таблице.

Частые вопросы

Сколько видеопамяти нужно для локального запуска LLM?

Зависит от размера модели и квантования: модель на 7–8 млрд параметров в 4-битном квантовании на практике требует 6–8 ГБ, модель на 70 млрд параметров без квантования требует 130+ ГБ — уровень нескольких датацентровых карт.

Что такое квантование и зачем оно нужно для локального запуска?

Квантование снижает точность хранения весов модели (например, с 16 бит до 4 бит на параметр), что кратно уменьшает требования к видеопамяти ценой небольшой потери качества ответов.

Хватит ли одной потребительской видеокарты для локальной LLM?

Для небольших моделей (7–13 млрд параметров) в квантовании — как правило да. Для моделей от 30 млрд параметров и выше без квантования одной потребительской карты уже не хватит.

Когда нужна датацентровая карта вместо потребительской?

Когда модель не помещается в память потребительской карты (обычно 16–24 ГБ) даже после квантования — например, открытая модель на 70+ млрд параметров в полной точности. Тогда нужны карты вроде A100 80GB или H100 — у нас есть актуальные цены на них в России.

Как сослаться на эти данные
Radarii.ru, «Локальный запуск LLM: сколько видеопамяти нужно», обновлено 6 октября 2026. Ссылка: radarii.ru/articles/lokalnyy-zapusk-llm-skolko-pamyati-nuzhno