Первый разумный вопрос — а зачем вообще возиться с установкой, если ChatGPT, GigaChat или YandexGPT открываются в браузере за секунду и не требуют разбираться в терминале. Ответ короткий: облачная нейросеть — это чужой сервер. Всё, что вы вводите в чат, физически уходит на инфраструктуру компании-разработчика, обрабатывается там и, если явно не отключено в настройках, может использоваться для дальнейшего обучения модели или храниться в логах. Для черновика поста в соцсети это не проблема. Для текста договора с реальными именами и суммами, истории болезни пациента или фрагмента закрытого кода клиента — уже потенциальная проблема, причём не гипотетическая, а вполне конкретная с точки зрения обязательств компании перед своими клиентами.
Локальная нейросеть решает эту задачу буквально — данные никуда не уходят, потому что обработка происходит на том же устройстве, где вы печатаете запрос. Это же решает и вторую типичную боль российского пользователя — доступ. Часть зарубежных нейросетей ограничивает или усложняет доступ из России, что заставляет пользоваться VPN, платить зарубежной картой через посредников или мириться с перебоями. Открытая модель, однажды скачанная на диск, работает независимо от того, что происходит с доступностью сервиса в конкретный день, — она уже у вас на компьютере.
Третья причина куда прозаичнее — деньги и лимиты. Подписка на топовую облачную модель стоит от полутора до нескольких тысяч рублей в месяц, и у большинства тарифов есть лимиты на число запросов или объём текста. Локальная модель после установки не берёт денег за токены и не ограничивает число обращений в сутки — единственная валюта здесь электричество и время вашего процессора.
При этом честности ради: локальный ИИ — не бесплатный обмен «то же самое, но без денег». Плата другая — она в качестве ответов (компактная модель, которая помещается на обычный ноутбук, объективно слабее топовой облачной), в скорости (без мощной видеокарты генерация текста заметно медленнее привычного чата) и в том, что часть настройки придётся сделать самому, а не кликнуть по готовой кнопке в браузере. Дальше в этом гайде — как оценить, стоит ли для вас эта плата того.
С технической точки зрения разницы между «облачной» и «локальной» нейросетью почти нет — и там, и там работает одна и та же математика: модель, обученная на огромном массиве текста, предсказывает наиболее вероятное продолжение вашего запроса токен за токеном. Разница исключительно в том, где физически выполняются эти вычисления. У ChatGPT, GigaChat или Claude вычисления идут на серверах компании-разработчика в дата-центре — ваш браузер лишь отправляет текст запроса и получает готовый ответ. У локальной модели те же вычисления выполняет процессор или видеокарта вашего собственного компьютера — «сервер» в буквальном смысле помещается на столе.
Практическое следствие этой разницы в размере. Топовые облачные модели вроде GPT-5 или крупнейших версий Claude — это сотни миллиардов, а то и триллионы параметров, размазанные по кластерам из десятков и сотен видеокарт: воспроизвести это на домашнем компьютере физически невозможно. Модели, которые реально скачивают и запускают локально, — «открытые веса» (open weights) размером от нескольких миллиардов до максимум сотни с небольшим миллиардов параметров: их публикуют компании вроде Meta, Mistral AI, Alibaba (Qwen), DeepSeek и Google (Gemma) в открытом доступе, и любой человек может скачать файл с весами модели и запустить его на своём железе без разрешения и без передачи данных куда-либо.
Второе ключевое отличие — обновляемость. Облачная модель обновляется на стороне провайдера незаметно для пользователя: вчера вы разговаривали с одной версией GigaChat, сегодня, возможно, уже с чуть доработанной, и вы об этом даже не узнаете. Локальная модель — это конкретный файл на вашем диске, зафиксированный в момент скачивания. Она не станет умнее сама по себе; чтобы получить более новую версию, нужно вручную скачать её заново, когда разработчик модели выпустит апдейт.
Третье отличие — про то, что локальная модель «не знает» по умолчанию. У неё нет доступа к интернету, поиску, актуальным новостям и вашим личным файлам, если вы не подключили это отдельно через дополнительные инструменты (RAG-надстройки, поиск по документам). Это чистый офлайн-собеседник, обученный на данных до определённой даты, — и относиться к её ответам про «что происходит сейчас» нужно соответственно.
Ещё одна практическая деталь, которая роднит локальный и облачный ИИ технически: почти все инструменты для локального запуска открывают на вашем компьютере тот же самый API, что и у OpenAI, — набор адресов, к которым можно обращаться из стороннего кода или приложения. Это значит, что многие программы, изначально написанные для работы с ChatGPT через API (плагины для редакторов кода, надстройки для заметок, чат-боты в мессенджерах), можно направить на локальную модель, просто поменяв один адрес в настройках, — без переписывания самой программы. Это заметно снижает порог входа для тех, кто уже пользовался облачными интеграциями и хочет часть из них перевести на локальный контур.
«Локальная нейросеть» звучит как игрушка для энтузиастов, но на практике за этим стоят вполне конкретные и разные по мотивации группы пользователей. Ниже — обобщённые, иллюстративные портреты, а не описание реальных людей, но каждый построен на реальном и частом мотиве обращения к локальному ИИ.
Ключевой ресурс для локальной нейросети — не скорость процессора сама по себе, а объём оперативной памяти (RAM) или видеопамяти (VRAM), в которую целиком должна поместиться модель. Размер модели измеряется в количестве параметров — условных «настроек», из которых она состоит: 7B значит 7 миллиардов параметров, 70B — 70 миллиардов. Чем больше параметров, тем модель обычно умнее на сложных задачах, но и тем больше памяти ей нужно.
Здесь в игру вступает квантизация — техника, которая сжимает каждый параметр модели с полной точности (16 бит на параметр) до более грубого приближения — обычно 8, 4 или даже 2 бита. Огрубление параметров снижает точность модели, но не критично для большинства бытовых и рабочих задач, зато сокращает требования к памяти в несколько раз. Стандарт де-факто для домашнего использования — 4-битная квантизация (в названиях моделей она обычно помечена как Q4 или Q4_K_M): она даёт разумный баланс между качеством ответа и объёмом занимаемой памяти, обычно урезая объём модели в 3,5-4 раза по сравнению с полной точностью.
Таблица ниже — ориентировочные требования для самой ходовой 4-битной квантизации; для чуть более высокого качества (Q6-Q8) требования вырастут на 30-60%, для более грубой и заметно менее точной (Q2-Q3) — снизятся примерно во столько же.
| Размер модели | RAM / VRAM (Q4) | Что реально потянет |
|---|---|---|
| 3-4B (лёгкие модели) | ~3-4 ГБ | Практически любой современный ноутбук, включая слабые бюджетные |
| 7-8B (стартовый уровень) | ~6-8 ГБ | Обычный ноутбук с 16 ГБ RAM без видеокарты — 8-15 токенов/сек на CPU |
| 13-14B | ~10-12 ГБ | Ноутбук с 32 ГБ RAM, ощутимо быстрее с видеокартой от 8 ГБ VRAM |
| 32-34B | ~20-24 ГБ | Игровой ПК с GPU от 24 ГБ VRAM (RTX 4090) или Mac с unified memory от 32 ГБ |
| 70B (флагманский уровень) | ~40-45 ГБ | Рабочая станция с GPU 48 ГБ+ VRAM или Mac Studio с 64-128 ГБ unified memory |
Проверить, сколько памяти реально доступно на вашем компьютере, несложно: в Windows — «Диспетчер задач» → вкладка «Производительность», в macOS — значок Apple → «Об этом Mac», в Linux — команда free -h в терминале. Для видеокарты дополнительно важен именно объём выделенной видеопамяти (VRAM), а не общий объём оперативной памяти системы — у большинства ноутбуков без дискретной GPU видеопамяти в привычном смысле нет вовсе, и вся нагрузка ложится на CPU и обычную RAM. Стоит также учитывать скорость диска: модель весом 40+ ГБ на медленном жёстком диске будет заметно дольше загружаться в память при каждом запуске, чем на SSD, хотя на саму скорость генерации ответа после загрузки это уже не влияет.
Отдельно стоит сказать про Apple Silicon (чипы M1-M4 в Mac). Их особенность — единая память (unified memory), общая для процессора и видеоядра: даже недорогой Mac Mini с 16-24 ГБ такой памяти нередко запускает модели среднего размера комфортнее, чем Windows-ноутбук с формально таким же объёмом обычной RAM, потому что видеоядро Apple использует ту же память напрямую, без отдельной, куда более ограниченной видеопамяти дискретной GPU. Для Windows и Linux главный апгрейд для серьёзной работы с локальным ИИ — именно дискретная видеокарта с достаточным объёмом VRAM, а не более быстрый процессор.
Ollama — самый популярный инструмент для запуска локальных моделей, и не случайно: это бесплатная утилита с открытым кодом, которая берёт на себя всю техническую сложность — скачивание весов модели, оптимизацию под ваше железо и запуск фонового сервиса, к которому можно обращаться из терминала или из других программ. Работает на Windows, macOS и Linux, устанавливается одним файлом, а запуск новой модели — это одна команда вида ollama run имя-модели. Именно вокруг Ollama выстроена основная часть гайдов и интеграций с другими программами.
LM Studio — альтернатива для тех, кому некомфортно работать в терминале. Это приложение с полноценным графическим интерфейсом: встроенный каталог моделей с фильтрами по размеру и совместимости с вашим железом, чат в привычном формате мессенджера, наглядные настройки длины контекста и того, сколько слоёв модели выгрузить на видеокарту. На Apple Silicon LM Studio за счёт собственного движка MLX нередко выдаёт заметно более высокую скорость генерации, чем стандартный движок Ollama на том же железе. По сути выбор между ними — это выбор между консолью (Ollama) и приложением с окнами и кнопками (LM Studio); модели и итоговое качество ответов у обоих одинаковые, потому что оба в основе используют один и тот же движок инференса llama.cpp.
Из менее массовых, но рабочих альтернатив: GPT4All — тоже приложение с графическим интерфейсом, ориентированное на максимальную простоту для новичка; Jan — открытый аналог LM Studio с акцентом на приватность и подключаемые плагины; Msty — GUI-обёртка, которая умеет работать поверх уже установленной Ollama и добавляет удобные вкладки для нескольких параллельных диалогов. Для большинства читателей этого гайда разумная отправная точка — Ollama, если не пугает терминал, или LM Studio, если хочется сразу привычный интерфейс чата.
Про видеокарты и драйверы — важная техническая деталь, о которой часто забывают до первого запуска. Для ускорения на видеокарте NVIDIA нужны установленные драйверы с поддержкой CUDA, для AMD — стек ROCm (поддержка более ограничена и зависит от конкретной модели видеокарты), для Apple Silicon ускорение через Metal работает «из коробки» без дополнительной настройки. И Ollama, и LM Studio сами определяют, есть ли на компьютере поддерживаемая видеокарта, и используют её автоматически — если её нет или драйверы не установлены, программа тихо переключается на вычисления через CPU, что стоит иметь в виду, если генерация неожиданно оказалась медленнее, чем ожидалось по характеристикам компьютера.
Открытых семейств моделей, пригодных для локального запуска, на 2026 год несколько, и у каждого свой характер. Llama от Meta — самое узнаваемое имя, с очень длинным контекстным окном в старших версиях, что удобно для работы с объёмными документами; лицензия при этом не полностью «открытая» в строгом смысле — есть ограничения при крупном коммерческом масштабе использования, которые стоит проверять перед встраиванием в бизнес-процесс. Mistral — модели французской Mistral AI, традиционно сильные на европейских языках и в компактных версиях с хорошим соотношением качества и размера. Qwen от Alibaba — быстро развивающееся семейство с несколькими поколениями в год, распространяется под лицензией Apache 2.0 без ограничений на коммерческое использование, и особенно сильно на задачах, связанных с кодом. DeepSeek — семейство, известное «дистиллятами» (уменьшенными версиями, обученными повторять рассуждения крупной модели): такие дистилляты на базе Qwen или Llama дают заметно более качественное пошаговое рассуждение при том же размере, чем обычные модели сравнимого масштаба. Gemma от Google — компактные, хорошо оптимизированные модели, которые в младших версиях (4B и меньше) особенно бережно относятся к памяти и подходят для слабого железа.
Честное сравнение с облачными моделями общего назначения — GigaChat, YandexGPT, ChatGPT: на простых и типовых текстовых задачах (черновик письма, ответ по короткому документу, суммаризация) разница в качестве для нетехнического пользователя часто малозаметна, особенно если использовать модель среднего размера 13-32B. На сложных многошаговых рассуждениях, больших объёмах контекста, актуальных фактах и специфике российских реалий — открытые модели компактного размера заметно уступают: они не «знают» российское законодательство, региональные особенности и свежие события так же хорошо, как модели, целенаправленно дообученные под это, вроде GigaChat или YandexGPT. Открытые модели крупных размеров (70B и больше) сокращают этот разрыв, но требуют железа, недоступного подавляющему большинству частных пользователей.
Выбор конкретной модели разумно делать не «по названию», а по задаче. Для программирования и работы с кодом лучше показывают себя версии Qwen с пометкой Coder и модели семейства DeepSeek — они специально дообучены на большом массиве кода и точнее держат синтаксис языков программирования. Для связного текста на русском языке — художественного или делового — стоит проверить несколько моделей на своих типовых формулировках: качество русского языка у открытых моделей исторически заметно различается, и модель, показывающая отличный результат в англоязычных бенчмарках, не всегда одинаково хороша в русской орфографии и стилистике. Для задач с пошаговым рассуждением — расчёты, логические цепочки, разбор сложных условий — лучше подходят «рассуждающие» версии моделей (обычно помеченные reasoning или r1 в названии), которые перед финальным ответом проговаривают промежуточные шаги, жертвуя скоростью ради точности.
ollama -v. Если в ответ показалась версия программы — установка прошла успешно.ollama run llama3.2 (или любую другую модель среднего размера из каталога на сайте Ollama). При первом запуске программа скачает файл весов модели — это может занять от пары минут до получаса в зависимости от размера модели и скорости интернета./bye.ollama list покажет все скачанные модели и их размер на диске, ollama rm имя-модели — удалит ненужную и освободит место, повторный ollama pull имя-модели — скачает более новую версию, если разработчик её выпустил.Если после установки что-то пошло не так — пара типичных проблем и как их решить. Ошибка нехватки памяти при запуске модели (в логе обычно упоминается «out of memory») означает, что выбранная модель слишком велика для вашего железа — решение простое: скачать версию с более грубой квантизацией (Q4 вместо Q8) или модель меньшего размера. Если генерация идёт мучительно медленно на компьютере с видеокартой, стоит проверить в логах Ollama или в настройках LM Studio, действительно ли задействуется GPU, — иногда причина в устаревших видеодрайверах, которые стоит обновить отдельно от самой программы. Если модель на русском языке отвечает невпопад или сбивается на английский — попробуйте другую модель того же размера: устойчивость к русскому языку у разных открытых моделей заметно отличается даже в одном весовом классе.
Для бизнеса, работающего с чувствительными данными — персональными данными клиентов, медицинской информацией, условиями договоров, финансовыми деталями, — локальный ИИ стоит рассматривать не как замену GigaChat или YandexGPT целиком, а как дополнительный инструмент для конкретного узкого круга задач, где цена утечки данных высока, а сама задача не требует топового качества рассуждений. Классификация входящих обращений, первичное чтение внутренних документов, черновики типовых писем по шаблону — здесь компактная локальная модель, установленная на рабочий компьютер сотрудника или на сервер компании, снимает риск того, что фрагмент чувствительного текста уйдёт в публичный чат стороннего сервиса, о чём подробно говорится в статье «Безопасность данных при использовании ИИ».
Важная оговорка: локальный запуск снимает риск передачи данных стороннему провайдеру, но не снимает остальные требования к защите информации — доступ к самому устройству или серверу, шифрование диска, резервное копирование и политику того, кто из сотрудников и на каком оборудовании может работать с моделью, компании нужно обеспечивать самостоятельно, как и для любого другого корпоративного софта. Более полная карта юридических и репутационных рисков внедрения ИИ в бизнесе, включая работу с персональными данными, — в статье «Риски ИИ для бизнеса: полная карта и как от них защититься».
Для компаний, которые уже думают о переходе с зарубежных ИИ-инструментов на независимые от внешних провайдеров решения по соображениям регуляторики или доступности, локальные открытые модели — один из вариантов в общей картине импортозамещения, наряду с российскими облачными моделями вроде GigaChat и YandexGPT. Разница в компромиссе: облачная российская модель даёт более высокое и стабильное качество ответа и работу с российскими реалиями без затрат на собственное железо, а локальная открытая модель — полный контроль над тем, где физически находятся данные, ценой более скромного качества и затрат на инфраструктуру. Подробное сравнение вариантов миграции с зарубежных инструментов — в руководстве «Импортозамещение ИИ в бизнесе: чем заменить ChatGPT и Copilot».
На практике для среднего и крупного бизнеса разумная стратегия — гибридная: рутинные задачи с чувствительными данными обрабатывать локально или в защищённом корпоративном контуре, а сложные задачи, где нужна максимальная точность и нет ограничений по конфиденциальности данных, — через облачную модель с более высоким качеством. Выбор в пользу только локальных моделей «из принципа» для всей компании чаще создаёт больше трудозатрат на поддержку железа, чем экономит на подписках.
Стоит честно прикинуть и экономику такого решения. Компьютер или сервер, способный комфортно тянуть модель среднего размера (32B) с видеокартой от 24 ГБ VRAM, обойдётся в диапазоне от 200 000 до 400 000 ₽ в зависимости от конфигурации — это ощутимо больше, чем год корпоративной подписки на облачную модель для нескольких сотрудников. Экономический смысл в такой инвестиции появляется, если задача действительно объёмная (десятки тысяч обращений в месяц, где стоимость токенов в облаке накапливается ощутимо) или если ключевой мотив — не экономия, а требование не выпускать данные за периметр компании ни при каких условиях, когда стоимость решения оценивается не в рублях подписки, а в стоимости риска утечки. Для компании, которая просто хочет сэкономить на подписках при небольшом объёме использования, гораздо разумнее начать с готового бесплатного тарифа облачной модели — расходы на собственное железо в этом случае, скорее всего, не окупятся.