Зачем запускать нейросеть локально
Облачные нейросети это удобно: зашёл на сайт, написал запрос, получил ответ. Но у такого подхода есть три проблемы. Первая: ваши данные уходят на чужие серверы. Вторая: без интернета всё, глухо. Третья: лимиты и платные подписки.
Локальная нейросеть работает на вашем компьютере. Не нужно отправлять текст в облако, не нужно платить за токены, не нужно ждать пока сервер ответит. И работает даже если интернет отвалился или вы в поезде без связи.
Минусы тоже есть. Нужен мощный компьютер с хорошей видеокартой. Модели занимают десятки гигабайт на диске. И настройка сложнее чем «зарегистрироваться и писать». Но если эти барьеры не пугают, локальный ИИ даёт свободу которую облачные сервисы не могут предложить.
Что нужно для запуска локальной нейросети
| Компонент | Минимум | Комфортно |
|---|---|---|
| Видеокарта | GTX 1060 6GB | RTX 3060 12GB и выше |
| Оперативка | 16 GB | 32 GB и выше |
| Место на диске | 20 GB | 100+ GB (несколько моделей) |
| Процессор | Любой современный 4-ядерный | 8+ ядер (для CPU-инференса) |
Видеокарта это главное. Нейросети считают на видеопамяти, и если её мало, модель просто не загрузится. Модель на 7 миллиардов параметров в 4-битном квантовании занимает около 4-5 ГБ видеопамяти. Модель на 70 миллиардов займёт уже под 40 ГБ и потребует либо RTX A6000 за безумные деньги, либо запуска на процессоре, что медленно.
Программы для запуска
LM Studio
Самый простой способ запустить нейросеть на Windows или Mac. Скачиваете программу, выбираете модель из каталога, жмёте Play и через пару минут у вас работает локальный чат-бот. Никакой командной строки и конфигов.
LM Studio сама подбирает модель под вашу видеокарту. Если памяти не хватает, предлагает квантованную версию поменьше. Встроенный поиск моделей на Hugging Face. Поддерживает GPU-ускорение на NVIDIA (CUDA) и Apple Silicon (Metal).
Есть режим локального сервера: LM Studio поднимает API совместимый с OpenAI, и вы можете подключить к ней локальные инструменты вроде Claude Code, Continue для VS Code или своих скриптов.
Ollama
Консольный инструмент, любимый разработчиками. Установка одной командой, запуск модели одной командой. Например, ollama run llama3.1 скачает и запустит Llama 3.1. Всё происходит в терминале.
Ollama тоже поднимает API и дружит с огромным количеством фронтендов: Open WebUI, Anything LLM, Continue. Если вы пишете код и привыкли к терминалу, Ollama будет удобнее LM Studio. Если нет, лучше начать с LM Studio.
llama.cpp
Движок на C++, который лежит в основе большинства инструментов для запуска локальных LLM. LM Studio и Ollama используют llama.cpp под капотом. Отдельно имеет смысл ставить если вам нужен тонкий контроль над параметрами инференса или вы запускаете модели на странном железе вроде Raspberry Pi или сервера без видеокарты.
Какие модели запускать локально
Выбор модели зависит от задачи и железа. Вот что работает в 2026 году:
| Модель | Размер (Q4) | Для чего |
|---|---|---|
| Llama 3.1 8B | ~5 GB | Общие задачи, русский язык. Легко заходит на 8 ГБ VRAM |
| Qwen 2.5 7B | ~5 GB | Код, логика, многоязычность |
| Gemma 2 9B | ~6 GB | Короткие точные ответы, компактность |
| Llama 3.1 70B | ~40 GB | Сложный анализ, творческие задачи. Нужна RTX 4090/A6000 |
| Qwen 2.5 32B | ~20 GB | Компромисс качество/размер. 24 ГБ VRAM |
| Mistral 7B | ~5 GB | Быстрый, для простых задач |
Для повседневных задач 7-9 миллиардов параметров хватает. Модели на 30-70 миллиардов нужны если вы пишете код целыми днями или генерируете сложные тексты. Большие модели на процессоре работают медленно, пара токенов в секунду. Для чата в реальном времени это некомфортно.
Локальная генерация изображений
Картинки тоже можно генерировать локально. Для этого есть Stable Diffusion и его интерфейсы. Самый популярный это ComfyUI: визуальный редактор где вы соединяете узлы-блоки как в Blender и собираете пайплайн генерации.
Для Stable Diffusion нужна видеокарта с 8 ГБ видеопамяти минимум. Модели весят 2-7 ГБ. Генерация одного изображения занимает от 2 до 30 секунд в зависимости от видеокарты и размера картинки.
Есть и облегчённые варианты. LCM-модели (Latent Consistency Models) генерируют картинку за 1-4 шага вместо 20-30, и результат поэто почти мгновенно. Качество чуть ниже, но для прототипов и быстрых итераций отлично.
Можно ли запустить нейросеть на телефоне
Можно, но с оговорками. На Android работают MLC Chat и ChatterUI. Они запускают маленькие модели вроде Gemma 2B или Phi-3 Mini прямо на процессоре телефона. Качество ответов ниже чем у больших моделей, но для простых вопросов хватает.
На iPhone вариантов меньше из-за ограничений iOS. LM Studio официально на iPhone нет, Ollama тоже. Работают через API: поднимаете сервер на компьютере, а с телефона подключаетесь по локальной сети через браузер или приложение.
Отдельная история это приложения которые маскируются под локальный ИИ а на самом деле отправляют запросы в облако. Настоящий локальный ИИ не требует интернета. Если приложение просит регистрацию и доступ в сеть, скорее всего оно просто прокси к ChatGPT.
Что локальный ИИ пока не умеет
Честно говоря, локальные нейросети пока отстают от облачных. Модель на 8 миллиардов параметров не сравнится с GPT-4 или Claude по качеству ответов. Поиск в интернете недоступен. Голосовой ввод и многомодальность работают хуже или не работают вообще.
Если вы журналист которому нужно накидать структуру статьи, локальной Llama 8B хватит. Если вы программист и вам нужен сложный рефакторинг или архитектурный совет, облачные модели пока впереди.
Но разрыв сокращается. Два года назад локальные модели выдавали бессвязный бред на русском. Сегодня та же Llama 3.1 8B пишет на русском грамотно и по делу. Через год-два локальный ИИ может догнать сегодняшний GPT-4.
Нейросеть без интернета: какое железо нужно
Для запуска Llama 3 8B нужна видеокарта с 8 ГБ VRAM (RTX 3060 за 30 000 руб.). Модель отвечает за 1-2 секунды, качество сравнимо с ChatGPT 3.5. Для Llama 3 70B нужна RTX 4090 с 24 ГБ за 150 000 руб., но такая конфигурация даёт качество близкое к GPT-4. Я пробовал запускать Llama 3 8B на MacBook Air M2 с 16 ГБ ОЗУ: работает, но отвечает 30-40 секунд на запрос. Для реальной работы нужно либо мощное железо либо смириться с медленной скоростью. Плюс: полная конфиденциальность. Минус: никакого поиска в интернете и распознавания картинок, модель знает только то на чём обучалась. Для 90% задач локальная нейросеть избыточна, проще пользоваться облачными. Но для работы с конфиденциальными данными или текстами которые нельзя отправлять на чужие серверы, локальный запуск единственный вариант.
Запустить нейросеть без интернета реально прямо сейчас. LM Studio и Ollama превращают установку из квеста в два клика. Главное чтобы видеокарта тянула. Для простых задач локальные модели уже хороши. Для сложных облачные пока выигрывают. Но если вам важна конфиденциальность или автономность, локальный ИИ это рабочий вариант.