Локальные нейросети 2026: как запустить ИИ на компьютере без интернета и подписок | AI Радар
Большой гайд

Локальные нейросети: как запустить ИИ на своём компьютере без интернета и подписок

📅 Обновлено 19.08.2026 ✍️ Александр Григорьев🏷 Практические задачи
Локальная нейросеть — это модель, которая работает прямо на вашем компьютере, без обращения к серверам OpenAI, Сбера или Яндекса, без VPN и без ежемесячной подписки. Это руководство — не набор общих слов про «свободу от облака», а конкретная инструкция: что такое локальный ИИ, сколько памяти реально нужно для моделей разного размера, какой инструмент поставить в первую очередь и честно — где локальная модель проигрывает облачной, а где выигрывает вчистую.
16 ГБ
RAM — стартовый порог
для моделей 7-8B
9 млн+
пользователей Ollama
в мире, 2026
135 000+
открытых моделей в формате
GGUF на Hugging Face
0 ₽
за токены и подписку
после установки

Зачем запускать ИИ на своём компьютере, если есть облачные сервисы

Первый разумный вопрос — а зачем вообще возиться с установкой, если ChatGPT, GigaChat или YandexGPT открываются в браузере за секунду и не требуют разбираться в терминале. Ответ короткий: облачная нейросеть — это чужой сервер. Всё, что вы вводите в чат, физически уходит на инфраструктуру компании-разработчика, обрабатывается там и, если явно не отключено в настройках, может использоваться для дальнейшего обучения модели или храниться в логах. Для черновика поста в соцсети это не проблема. Для текста договора с реальными именами и суммами, истории болезни пациента или фрагмента закрытого кода клиента — уже потенциальная проблема, причём не гипотетическая, а вполне конкретная с точки зрения обязательств компании перед своими клиентами.

Локальная нейросеть решает эту задачу буквально — данные никуда не уходят, потому что обработка происходит на том же устройстве, где вы печатаете запрос. Это же решает и вторую типичную боль российского пользователя — доступ. Часть зарубежных нейросетей ограничивает или усложняет доступ из России, что заставляет пользоваться VPN, платить зарубежной картой через посредников или мириться с перебоями. Открытая модель, однажды скачанная на диск, работает независимо от того, что происходит с доступностью сервиса в конкретный день, — она уже у вас на компьютере.

Третья причина куда прозаичнее — деньги и лимиты. Подписка на топовую облачную модель стоит от полутора до нескольких тысяч рублей в месяц, и у большинства тарифов есть лимиты на число запросов или объём текста. Локальная модель после установки не берёт денег за токены и не ограничивает число обращений в сутки — единственная валюта здесь электричество и время вашего процессора.

При этом честности ради: локальный ИИ — не бесплатный обмен «то же самое, но без денег». Плата другая — она в качестве ответов (компактная модель, которая помещается на обычный ноутбук, объективно слабее топовой облачной), в скорости (без мощной видеокарты генерация текста заметно медленнее привычного чата) и в том, что часть настройки придётся сделать самому, а не кликнуть по готовой кнопке в браузере. Дальше в этом гайде — как оценить, стоит ли для вас эта плата того.

Что такое локальная нейросеть и чем она отличается от облачной

🧩Одна и та же математика, разное место исполнения

С технической точки зрения разницы между «облачной» и «локальной» нейросетью почти нет — и там, и там работает одна и та же математика: модель, обученная на огромном массиве текста, предсказывает наиболее вероятное продолжение вашего запроса токен за токеном. Разница исключительно в том, где физически выполняются эти вычисления. У ChatGPT, GigaChat или Claude вычисления идут на серверах компании-разработчика в дата-центре — ваш браузер лишь отправляет текст запроса и получает готовый ответ. У локальной модели те же вычисления выполняет процессор или видеокарта вашего собственного компьютера — «сервер» в буквальном смысле помещается на столе.

Практическое следствие этой разницы в размере. Топовые облачные модели вроде GPT-5 или крупнейших версий Claude — это сотни миллиардов, а то и триллионы параметров, размазанные по кластерам из десятков и сотен видеокарт: воспроизвести это на домашнем компьютере физически невозможно. Модели, которые реально скачивают и запускают локально, — «открытые веса» (open weights) размером от нескольких миллиардов до максимум сотни с небольшим миллиардов параметров: их публикуют компании вроде Meta, Mistral AI, Alibaba (Qwen), DeepSeek и Google (Gemma) в открытом доступе, и любой человек может скачать файл с весами модели и запустить его на своём железе без разрешения и без передачи данных куда-либо.

Второе ключевое отличие — обновляемость. Облачная модель обновляется на стороне провайдера незаметно для пользователя: вчера вы разговаривали с одной версией GigaChat, сегодня, возможно, уже с чуть доработанной, и вы об этом даже не узнаете. Локальная модель — это конкретный файл на вашем диске, зафиксированный в момент скачивания. Она не станет умнее сама по себе; чтобы получить более новую версию, нужно вручную скачать её заново, когда разработчик модели выпустит апдейт.

Третье отличие — про то, что локальная модель «не знает» по умолчанию. У неё нет доступа к интернету, поиску, актуальным новостям и вашим личным файлам, если вы не подключили это отдельно через дополнительные инструменты (RAG-надстройки, поиск по документам). Это чистый офлайн-собеседник, обученный на данных до определённой даты, — и относиться к её ответам про «что происходит сейчас» нужно соответственно.

Ещё одна практическая деталь, которая роднит локальный и облачный ИИ технически: почти все инструменты для локального запуска открывают на вашем компьютере тот же самый API, что и у OpenAI, — набор адресов, к которым можно обращаться из стороннего кода или приложения. Это значит, что многие программы, изначально написанные для работы с ChatGPT через API (плагины для редакторов кода, надстройки для заметок, чат-боты в мессенджерах), можно направить на локальную модель, просто поменяв один адрес в настройках, — без переписывания самой программы. Это заметно снижает порог входа для тех, кто уже пользовался облачными интеграциями и хочет часть из них перевести на локальный контур.

Кому это реально нужно

🎯Четыре типичных сценария

«Локальная нейросеть» звучит как игрушка для энтузиастов, но на практике за этим стоят вполне конкретные и разные по мотивации группы пользователей. Ниже — обобщённые, иллюстративные портреты, а не описание реальных людей, но каждый построен на реальном и частом мотиве обращения к локальному ИИ.

Разработчик и IT-специалист
Пишет код для закрытого коммерческого продукта и не хочет, чтобы фрагменты проприетарного кода уходили на сервер стороннего облачного ассистента — политика безопасности работодателя может прямо это запрещать. Локальная модель, подключённая к редактору кода как автодополнение или чат, даёт помощь без утечки исходников наружу — пусть и не такую точную, как топовый облачный ассистент для разработки.
Малый бизнес с чувствительными данными
Юридическая или бухгалтерская практика, частная клиника, кадровое агентство — везде на входе документы с персональными данными, номерами договоров, диагнозами. Ввод такого текста в бесплатный публичный чат — риск с точки зрения защиты персональных данных. Локальная модель на рабочем компьютере сотрудника снимает этот риск: текст обрабатывается и остаётся на устройстве компании.
Пользователь без стабильного доступа к зарубежным сервисам
Часть аудитории просто устала от VPN, блокировок по региону и оплаты через посредников. Скачанная один раз модель работает одинаково стабильно вне зависимости от того, что происходит с доступностью зарубежного сервиса в конкретный день, — и не требует объяснять бухгалтерии, почему нужно оплатить зарубежную подписку через третьи руки.
Энтузиаст и человек без стабильного интернета
Кто-то тестирует ИИ-инструменты просто из интереса, экономя на подписках при частом использовании; кто-то работает там, где интернет нестабилен или дорог — в дороге, в отдалённом регионе, в местах без покрытия. Для обеих групп офлайн-работа — не бонус, а единственный рабочий вариант.
AI Радар — Аналитический дашборд
Полная картина рынка ИИ России и мира
520 млрд ₽рынок ИИ России
+24%рост г/г
800+AI-компаний
$3.68 трлнпрогноз мир к 2030
На главную

Сколько нужно памяти: требования к железу по размеру модели

💾Главный фактор — не процессор, а память

Ключевой ресурс для локальной нейросети — не скорость процессора сама по себе, а объём оперативной памяти (RAM) или видеопамяти (VRAM), в которую целиком должна поместиться модель. Размер модели измеряется в количестве параметров — условных «настроек», из которых она состоит: 7B значит 7 миллиардов параметров, 70B — 70 миллиардов. Чем больше параметров, тем модель обычно умнее на сложных задачах, но и тем больше памяти ей нужно.

Здесь в игру вступает квантизация — техника, которая сжимает каждый параметр модели с полной точности (16 бит на параметр) до более грубого приближения — обычно 8, 4 или даже 2 бита. Огрубление параметров снижает точность модели, но не критично для большинства бытовых и рабочих задач, зато сокращает требования к памяти в несколько раз. Стандарт де-факто для домашнего использования — 4-битная квантизация (в названиях моделей она обычно помечена как Q4 или Q4_K_M): она даёт разумный баланс между качеством ответа и объёмом занимаемой памяти, обычно урезая объём модели в 3,5-4 раза по сравнению с полной точностью.

Таблица ниже — ориентировочные требования для самой ходовой 4-битной квантизации; для чуть более высокого качества (Q6-Q8) требования вырастут на 30-60%, для более грубой и заметно менее точной (Q2-Q3) — снизятся примерно во столько же.

Размер моделиRAM / VRAM (Q4)Что реально потянет
3-4B (лёгкие модели)~3-4 ГБПрактически любой современный ноутбук, включая слабые бюджетные
7-8B (стартовый уровень)~6-8 ГБОбычный ноутбук с 16 ГБ RAM без видеокарты — 8-15 токенов/сек на CPU
13-14B~10-12 ГБНоутбук с 32 ГБ RAM, ощутимо быстрее с видеокартой от 8 ГБ VRAM
32-34B~20-24 ГБИгровой ПК с GPU от 24 ГБ VRAM (RTX 4090) или Mac с unified memory от 32 ГБ
70B (флагманский уровень)~40-45 ГБРабочая станция с GPU 48 ГБ+ VRAM или Mac Studio с 64-128 ГБ unified memory
Ориентировочный объём памяти на модель при 4-битной квантизации
7-8B
~7 ГБ
13-14B
~11 ГБ
32-34B
~22 ГБ
70B
~43 ГБ

Проверить, сколько памяти реально доступно на вашем компьютере, несложно: в Windows — «Диспетчер задач» → вкладка «Производительность», в macOS — значок Apple → «Об этом Mac», в Linux — команда free -h в терминале. Для видеокарты дополнительно важен именно объём выделенной видеопамяти (VRAM), а не общий объём оперативной памяти системы — у большинства ноутбуков без дискретной GPU видеопамяти в привычном смысле нет вовсе, и вся нагрузка ложится на CPU и обычную RAM. Стоит также учитывать скорость диска: модель весом 40+ ГБ на медленном жёстком диске будет заметно дольше загружаться в память при каждом запуске, чем на SSD, хотя на саму скорость генерации ответа после загрузки это уже не влияет.

Отдельно стоит сказать про Apple Silicon (чипы M1-M4 в Mac). Их особенность — единая память (unified memory), общая для процессора и видеоядра: даже недорогой Mac Mini с 16-24 ГБ такой памяти нередко запускает модели среднего размера комфортнее, чем Windows-ноутбук с формально таким же объёмом обычной RAM, потому что видеоядро Apple использует ту же память напрямую, без отдельной, куда более ограниченной видеопамяти дискретной GPU. Для Windows и Linux главный апгрейд для серьёзной работы с локальным ИИ — именно дискретная видеокарта с достаточным объёмом VRAM, а не более быстрый процессор.

Инструменты для запуска: Ollama, LM Studio и другие

🛠️Раннер — программа, которая запускает модель

Ollama — самый популярный инструмент для запуска локальных моделей, и не случайно: это бесплатная утилита с открытым кодом, которая берёт на себя всю техническую сложность — скачивание весов модели, оптимизацию под ваше железо и запуск фонового сервиса, к которому можно обращаться из терминала или из других программ. Работает на Windows, macOS и Linux, устанавливается одним файлом, а запуск новой модели — это одна команда вида ollama run имя-модели. Именно вокруг Ollama выстроена основная часть гайдов и интеграций с другими программами.

LM Studio — альтернатива для тех, кому некомфортно работать в терминале. Это приложение с полноценным графическим интерфейсом: встроенный каталог моделей с фильтрами по размеру и совместимости с вашим железом, чат в привычном формате мессенджера, наглядные настройки длины контекста и того, сколько слоёв модели выгрузить на видеокарту. На Apple Silicon LM Studio за счёт собственного движка MLX нередко выдаёт заметно более высокую скорость генерации, чем стандартный движок Ollama на том же железе. По сути выбор между ними — это выбор между консолью (Ollama) и приложением с окнами и кнопками (LM Studio); модели и итоговое качество ответов у обоих одинаковые, потому что оба в основе используют один и тот же движок инференса llama.cpp.

Из менее массовых, но рабочих альтернатив: GPT4All — тоже приложение с графическим интерфейсом, ориентированное на максимальную простоту для новичка; Jan — открытый аналог LM Studio с акцентом на приватность и подключаемые плагины; Msty — GUI-обёртка, которая умеет работать поверх уже установленной Ollama и добавляет удобные вкладки для нескольких параллельных диалогов. Для большинства читателей этого гайда разумная отправная точка — Ollama, если не пугает терминал, или LM Studio, если хочется сразу привычный интерфейс чата.

Про видеокарты и драйверы — важная техническая деталь, о которой часто забывают до первого запуска. Для ускорения на видеокарте NVIDIA нужны установленные драйверы с поддержкой CUDA, для AMD — стек ROCm (поддержка более ограничена и зависит от конкретной модели видеокарты), для Apple Silicon ускорение через Metal работает «из коробки» без дополнительной настройки. И Ollama, и LM Studio сами определяют, есть ли на компьютере поддерживаемая видеокарта, и используют её автоматически — если её нет или драйверы не установлены, программа тихо переключается на вычисления через CPU, что стоит иметь в виду, если генерация неожиданно оказалась медленнее, чем ожидалось по характеристикам компьютера.

Какие модели выбрать в 2026 году

🧠Открытые семейства моделей

Открытых семейств моделей, пригодных для локального запуска, на 2026 год несколько, и у каждого свой характер. Llama от Meta — самое узнаваемое имя, с очень длинным контекстным окном в старших версиях, что удобно для работы с объёмными документами; лицензия при этом не полностью «открытая» в строгом смысле — есть ограничения при крупном коммерческом масштабе использования, которые стоит проверять перед встраиванием в бизнес-процесс. Mistral — модели французской Mistral AI, традиционно сильные на европейских языках и в компактных версиях с хорошим соотношением качества и размера. Qwen от Alibaba — быстро развивающееся семейство с несколькими поколениями в год, распространяется под лицензией Apache 2.0 без ограничений на коммерческое использование, и особенно сильно на задачах, связанных с кодом. DeepSeek — семейство, известное «дистиллятами» (уменьшенными версиями, обученными повторять рассуждения крупной модели): такие дистилляты на базе Qwen или Llama дают заметно более качественное пошаговое рассуждение при том же размере, чем обычные модели сравнимого масштаба. Gemma от Google — компактные, хорошо оптимизированные модели, которые в младших версиях (4B и меньше) особенно бережно относятся к памяти и подходят для слабого железа.

Честное сравнение с облачными моделями общего назначения — GigaChat, YandexGPT, ChatGPT: на простых и типовых текстовых задачах (черновик письма, ответ по короткому документу, суммаризация) разница в качестве для нетехнического пользователя часто малозаметна, особенно если использовать модель среднего размера 13-32B. На сложных многошаговых рассуждениях, больших объёмах контекста, актуальных фактах и специфике российских реалий — открытые модели компактного размера заметно уступают: они не «знают» российское законодательство, региональные особенности и свежие события так же хорошо, как модели, целенаправленно дообученные под это, вроде GigaChat или YandexGPT. Открытые модели крупных размеров (70B и больше) сокращают этот разрыв, но требуют железа, недоступного подавляющему большинству частных пользователей.

Выбор конкретной модели разумно делать не «по названию», а по задаче. Для программирования и работы с кодом лучше показывают себя версии Qwen с пометкой Coder и модели семейства DeepSeek — они специально дообучены на большом массиве кода и точнее держат синтаксис языков программирования. Для связного текста на русском языке — художественного или делового — стоит проверить несколько моделей на своих типовых формулировках: качество русского языка у открытых моделей исторически заметно различается, и модель, показывающая отличный результат в англоязычных бенчмарках, не всегда одинаково хороша в русской орфографии и стилистике. Для задач с пошаговым рассуждением — расчёты, логические цепочки, разбор сложных условий — лучше подходят «рассуждающие» версии моделей (обычно помеченные reasoning или r1 в названии), которые перед финальным ответом проговаривают промежуточные шаги, жертвуя скоростью ради точности.

42%
По оценкам опросов разработчиков 2026 года, около 42% из них хотя бы часть рабочих задач с ИИ выполняют полностью локально, не отправляя данные в облако.

Пошаговый гайд: установка Ollama и запуск первой модели

🚀От установки до первого ответа — 10-15 минут
1
Шаг 1
Скачать и установить Ollama
Зайдите на официальный сайт ollama.com, скачайте установщик под вашу систему (Windows — .exe, macOS — .dmg, Linux — команда установки одной строкой из терминала) и запустите его как обычную программу. Занимает 2-3 минуты.
2
Шаг 2
Проверить установку
Откройте терминал (в Windows — «Командная строка» или PowerShell, в macOS и Linux — «Терминал») и введите ollama -v. Если в ответ показалась версия программы — установка прошла успешно.
3
Шаг 3
Скачать и запустить первую модель
Введите команду вида ollama run llama3.2 (или любую другую модель среднего размера из каталога на сайте Ollama). При первом запуске программа скачает файл весов модели — это может занять от пары минут до получаса в зависимости от размера модели и скорости интернета.
4
Шаг 4
Пообщаться с моделью
После загрузки в терминале появится приглашение для ввода — печатайте вопрос как в обычном чате и нажимайте Enter. Чтобы выйти из диалога, введите /bye.
5
Шаг 5
При желании — подключить графический интерфейс
Ollama работает в фоне и открывает локальный адрес http://localhost:11434, к которому можно подключить стороннее приложение с чатом (например, Open WebUI) — тогда общение с моделью выглядит как в привычном веб-чате, а не в чёрном окне терминала.
6
Шаг 6
Управлять моделями
ollama list покажет все скачанные модели и их размер на диске, ollama rm имя-модели — удалит ненужную и освободит место, повторный ollama pull имя-модели — скачает более новую версию, если разработчик её выпустил.

Если после установки что-то пошло не так — пара типичных проблем и как их решить. Ошибка нехватки памяти при запуске модели (в логе обычно упоминается «out of memory») означает, что выбранная модель слишком велика для вашего железа — решение простое: скачать версию с более грубой квантизацией (Q4 вместо Q8) или модель меньшего размера. Если генерация идёт мучительно медленно на компьютере с видеокартой, стоит проверить в логах Ollama или в настройках LM Studio, действительно ли задействуется GPU, — иногда причина в устаревших видеодрайверах, которые стоит обновить отдельно от самой программы. Если модель на русском языке отвечает невпопад или сбивается на английский — попробуйте другую модель того же размера: устойчивость к русскому языку у разных открытых моделей заметно отличается даже в одном весовом классе.

Честно об ограничениях локальных моделей

01
Компактная модель заметно слабее топовой облачной. Модель, которая помещается в 16-32 ГБ памяти обычного компьютера, объективно уступает GPT-5, Claude или крупнейшим версиям GigaChat на сложных, многошаговых и творческих задачах — это плата за возможность запуска на бытовом железе, а не недостаток конкретного инструмента.
02
Без мощного железа — медленно. На CPU без видеокарты модели среднего размера выдают ответ со скоростью около 8-15 токенов в секунду — это заметно медленнее, чем привычный мгновенный ответ облачного чата, особенно на длинных текстах.
03
Модель не обновляется сама. В отличие от облачного сервиса, который дорабатывается на стороне провайдера незаметно для пользователя, локальная модель — зафиксированный файл; чтобы получить более новую и умную версию, нужно вручную скачать её заново, когда выйдет апдейт.
04
Нет доступа к интернету и актуальным данным. Локальная модель не может посмотреть свежие новости, курс валют или содержимое конкретного сайта, если это не подключено отдельно через дополнительные инструменты поиска по документам — из коробки это чистый офлайн-собеседник, обученный на данных до определённой даты.
05
Первая загрузка всё равно требует интернета и места на диске. Файл весов модели весит от нескольких до нескольких десятков гигабайт — офлайн-режим начинается только после того, как эта загрузка завершена, и каждая дополнительная модель добавляет ещё один такой файл на диск.
06
Длительная работа нагружает железо. Активная генерация текста ощутимо загружает процессор или видеокарту, увеличивает энергопотребление и нагрев ноутбука — для разовых запросов это не заметно, но для постоянной фоновой работы с локальным ИИ стоит закладывать это в планирование железа.

Локальный ИИ для бизнеса: приватность данных и юридические риски

🏢Альтернатива, а не замена облачным моделям

Для бизнеса, работающего с чувствительными данными — персональными данными клиентов, медицинской информацией, условиями договоров, финансовыми деталями, — локальный ИИ стоит рассматривать не как замену GigaChat или YandexGPT целиком, а как дополнительный инструмент для конкретного узкого круга задач, где цена утечки данных высока, а сама задача не требует топового качества рассуждений. Классификация входящих обращений, первичное чтение внутренних документов, черновики типовых писем по шаблону — здесь компактная локальная модель, установленная на рабочий компьютер сотрудника или на сервер компании, снимает риск того, что фрагмент чувствительного текста уйдёт в публичный чат стороннего сервиса, о чём подробно говорится в статье «Безопасность данных при использовании ИИ».

Важная оговорка: локальный запуск снимает риск передачи данных стороннему провайдеру, но не снимает остальные требования к защите информации — доступ к самому устройству или серверу, шифрование диска, резервное копирование и политику того, кто из сотрудников и на каком оборудовании может работать с моделью, компании нужно обеспечивать самостоятельно, как и для любого другого корпоративного софта. Более полная карта юридических и репутационных рисков внедрения ИИ в бизнесе, включая работу с персональными данными, — в статье «Риски ИИ для бизнеса: полная карта и как от них защититься».

Для компаний, которые уже думают о переходе с зарубежных ИИ-инструментов на независимые от внешних провайдеров решения по соображениям регуляторики или доступности, локальные открытые модели — один из вариантов в общей картине импортозамещения, наряду с российскими облачными моделями вроде GigaChat и YandexGPT. Разница в компромиссе: облачная российская модель даёт более высокое и стабильное качество ответа и работу с российскими реалиями без затрат на собственное железо, а локальная открытая модель — полный контроль над тем, где физически находятся данные, ценой более скромного качества и затрат на инфраструктуру. Подробное сравнение вариантов миграции с зарубежных инструментов — в руководстве «Импортозамещение ИИ в бизнесе: чем заменить ChatGPT и Copilot».

На практике для среднего и крупного бизнеса разумная стратегия — гибридная: рутинные задачи с чувствительными данными обрабатывать локально или в защищённом корпоративном контуре, а сложные задачи, где нужна максимальная точность и нет ограничений по конфиденциальности данных, — через облачную модель с более высоким качеством. Выбор в пользу только локальных моделей «из принципа» для всей компании чаще создаёт больше трудозатрат на поддержку железа, чем экономит на подписках.

Стоит честно прикинуть и экономику такого решения. Компьютер или сервер, способный комфортно тянуть модель среднего размера (32B) с видеокартой от 24 ГБ VRAM, обойдётся в диапазоне от 200 000 до 400 000 ₽ в зависимости от конфигурации — это ощутимо больше, чем год корпоративной подписки на облачную модель для нескольких сотрудников. Экономический смысл в такой инвестиции появляется, если задача действительно объёмная (десятки тысяч обращений в месяц, где стоимость токенов в облаке накапливается ощутимо) или если ключевой мотив — не экономия, а требование не выпускать данные за периметр компании ни при каких условиях, когда стоимость решения оценивается не в рублях подписки, а в стоимости риска утечки. Для компании, которая просто хочет сэкономить на подписках при небольшом объёме использования, гораздо разумнее начать с готового бесплатного тарифа облачной модели — расходы на собственное железо в этом случае, скорее всего, не окупятся.

📝 Материал носит справочный характер и обновляется по мере изменений на рынке открытых моделей и инструментов для локального запуска ИИ. Дата последнего обновления — 19.08.2026.

Частые вопросы

01Что нужно, чтобы запустить нейросеть на своём компьютере без интернета?
Программа-раннер вроде Ollama или LM Studio, свободное место на диске (от 4-5 ГБ на одну модель) и достаточно оперативной памяти — от 16 ГБ для стартовых моделей 7-8B. Интернет нужен один раз — скачать программу и веса модели; дальше можно работать полностью офлайн, хоть в самолёте.
02Какую модель установить новичку в первую очередь?
Для первого знакомства разумнее всего взять модель среднего размера 7-8B с 4-битной квантизацией — например, актуальную версию Llama, Qwen или Gemma. Она устанавливается одной командой в Ollama, весит 4-6 ГБ и работает на большинстве ноутбуков с 16 ГБ RAM без видеокарты, пусть и не мгновенно.
03Потянет ли обычный ноутбук без видеокарты локальную нейросеть?
Да, для моделей размером 7-8B — потянет, но со скоростью примерно 8-15 токенов в секунду на CPU, это заметно медленнее облачного чата, но вполне пригодно для текста. Модели крупнее 13B на слабом CPU уже будут генерировать ответ с ощутимой задержкой в несколько раз ниже.
04Чем Ollama отличается от LM Studio?
Ollama — это консольная утилита и фоновый сервис, рассчитанный на запуск моделей командой и подключение других программ через локальный API. LM Studio — приложение с графическим интерфейсом: каталог моделей, чат в стиле мессенджера и настройки в один клик без терминала. Модели и качество ответов у обоих одинаковые — разница только в удобстве и сценарии использования.
05Законно ли использовать зарубежные открытые модели вроде Llama, Mistral, Qwen или DeepSeek в России?
Технически скачивание и локальный запуск открытых весов не требует VPN и не относится к заблокированным сервисам — это файл, а не облачный сервис с региональными ограничениями. Стоит смотреть на лицензию конкретной модели: у части моделей есть условия по коммерческому использованию при крупном масштабе, которые стоит проверить перед встраиванием в бизнес-процесс.
06Насколько локальная модель слабее ChatGPT или GigaChat?
На сложных многошаговых рассуждениях, актуальных фактах и больших объёмах контекста — заметно слабее топовых облачных моделей, особенно в компактных версиях, которые тянет обычный компьютер. На типовых текстовых задачах — черновик письма, суммаризация, ответ по документу — разрыв в качестве куда менее заметен для нетехнического пользователя.
07Нужен ли интернет вообще, или он нужен только один раз?
Интернет нужен для установки программы и загрузки весов модели — это разовая операция на несколько гигабайт. После этого сама генерация ответов происходит полностью на вашем железе и работает без единого запроса наружу, что можно проверить, просто отключив Wi-Fi.
08Можно ли использовать локальную нейросеть для работы с конфиденциальными данными бизнеса?
Да, и это одна из главных причин, почему бизнес вообще смотрит в сторону локального ИИ: данные не покидают компьютер или сервер компании и не передаются стороннему провайдеру. Это не отменяет требований к самому устройству — доступ, шифрование диска и резервные копии остаются на ответственности компании.
09Сколько места на диске занимают локальные модели?
Модель 7-8B в 4-битной квантизации весит примерно 4-6 ГБ, 13-14B — около 8-10 ГБ, крупная модель 70B при той же квантизации — порядка 40-45 ГБ. Каждая дополнительная модель добавляется отдельным файлом, поэтому стоит скачивать только те версии, которыми реально планируете пользоваться.