Прежде чем покупать видеокарту для локального запуска LLM, стоит посчитать: сколько видеопамяти реально нужно под конкретный размер модели, и насколько квантование снижает эту планку. Разбираем математику, а не рекламируем конкретные карты.
Размер модели в видеопамяти напрямую зависит от числа параметров и точности их хранения. При хранении в формате FP16 (16 бит на параметр, стандартная точность для инференса) модель занимает примерно 2 байта на каждый параметр. Модель на 7 млрд параметров — около 14 ГБ, на 13 млрд — около 26 ГБ, на 70 млрд — около 140 ГБ. Это чистый вес модели, без учёта контекста (KV-кеша) и промежуточных вычислений — на практике к этой цифре нужно добавлять ещё заметный запас.
Квантование снижает точность хранения весов — например, с 16 бит до 8 или 4 бит на параметр. Важный нюанс: на практике 4-битное квантование снижает требования к памяти не ровно в 4 раза, как в теории, а немного меньше — из-за служебных данных и контекста, которые тоже занимают память. Для модели на 7–8 млрд параметров в 4-битном квантовании (Q4) на практике нужно 6–8 ГБ, а не теоретические 3,5 ГБ — именно эту практическую цифру стоит закладывать при выборе железа, а не чистую математику.
Модели на 7–8 млрд параметров в 4-битном квантовании (6–8 ГБ) помещаются в карту с 8 ГБ видеопамяти. Модели на 13–14 млрд параметров (9–10 ГБ практически) комфортно работают на 12–16 ГБ. Модели класса 32–35 млрд параметров требуют уже 20–24 ГБ. Модели на 70 млрд параметров даже в квантовании требуют 40–48 ГБ — это либо одна карта такого объёма, либо две потребительские карты по 24 ГБ, объединённые программно. Открытые модели на 70+ млрд параметров без квантования (130+ ГБ) физически не помещаются ни в одну потребительскую карту — нужны карты датацентрового класса вроде A100 80GB или H100, либо несколько карт одновременно. Главный вывод здесь шире математики: для локальных LLM решающий параметр — именно объём видеопамяти, а не скорость вычислений GPU.
Мы сознательно не публикуем здесь конкретные розничные цены на потребительские игровые карты (RTX-серии) — они меняются слишком быстро и слишком сильно расходятся между продавцами, чтобы давать на сайте одну «верную» цифру. Актуальные цены на датацентровые карты (A100, H100, H200), которые реально нужны для серьёзного локального развёртывания, у нас есть и обновляются — на странице цен и рейтинга GPU.
Если считать железо нерентабельным — альтернатива локальному запуску — API конкретного провайдера с оплатой по токенам, без вложений в оборудование. Актуальные тарифы доступных в России провайдеров LLM API — в отдельной таблице.
Зависит от размера модели и квантования: модель на 7–8 млрд параметров в 4-битном квантовании на практике требует 6–8 ГБ, модель на 70 млрд параметров без квантования требует 130+ ГБ — уровень нескольких датацентровых карт.
Квантование снижает точность хранения весов модели (например, с 16 бит до 4 бит на параметр), что кратно уменьшает требования к видеопамяти ценой небольшой потери качества ответов.
Для небольших моделей (7–13 млрд параметров) в квантовании — как правило да. Для моделей от 30 млрд параметров и выше без квантования одной потребительской карты уже не хватит.
Когда модель не помещается в память потребительской карты (обычно 16–24 ГБ) даже после квантования — например, открытая модель на 70+ млрд параметров в полной точности. Тогда нужны карты вроде A100 80GB или H100 — у нас есть актуальные цены на них в России.