Локальная нейросеть на своём ПК: ИИ-агент без подписки, VPN и интернета
Зачем запускать нейросеть на своём компьютере
Большинство людей пользуются нейросетями в браузере: ChatGPT, Gemini, Claude и т. д. Запрос уходит на сервер компании, обрабатывается там, а ответ возвращается вам. Это удобно, но у облачного подхода есть ограничения:
- лимиты на количество запросов;
- расширенные функции доступны только по подписке, которую ещё нужно как-то оплатить;
- ваши файлы и запросы уходят на чужие серверы.
Локальная нейросеть работает иначе: модель установлена на вашем ПК и использует его ресурсы. Не нужны ни подписка, ни VPN, а после скачивания модели не нужен и интернет. Файлы при этом не покидают компьютер.
Что такое ИИ-агент и почему облачные агенты стоят дорого
ИИ-агент — это не просто чат, а программа, которая сама выполняет задачи. Например:
- проанализировать таблицу;
- собрать HTML-страницу;
- просмотреть фото в папке и скопировать лучшие в отдельную.
Агент читает файлы, при необходимости ищет информацию в интернете, обрабатывает всё языковой моделью и выдаёт результат.
Работа оплачивается токенами. Один токен — это примерно 4 символа латиницы или 1–2 символа кириллицы. Токены расходуются не только на ответ, но и на весь процесс «размышления» над задачей, поэтому облачные агенты почти всегда платные, а сложные проекты могут обойтись в сотни и тысячи долларов.
Локальный агент выполняет рутинные задачи бесплатно, на мощностях вашего компьютера.
Как выбрать локальную модель под своё железо
Главное для локальной модели — видеокарта, а точнее объём её видеопамяти (VRAM). Чем больше памяти, тем умнее модель можно запустить.
Параметр B: размер модели
B — это миллиарды параметров:
| Размер | Уровень | Где работает |
|---|---|---|
| 1,5–3B | Базовые задачи | Ноутбук, планшет, иногда телефон |
| 7–8B | «Золотой стандарт» для дома | Обычный игровой ПК |
| 14–32B | Продвинутый: понимает контекст, неплохо пишет код | Хорошая видеокарта |
| 70B+ | Близко к облачным моделям | Очень мощные GPU с большой памятью |
Параметр Q: квантование
Квантование — это сжатие весов модели, чтобы она занимала меньше места:
- Q4 (4 бита) — оптимально для большинства: модель становится примерно втрое легче, а качество падает всего на 1–2%;
- Q8 (8 бит) — максимальное качество, но видеопамяти нужно почти вдвое больше.
Быстрое правило выбора
Упрощённо: число миллиардов параметров не должно превышать объём видеопамяти в гигабайтах. Например, с 16 ГБ VRAM комфортно работают модели примерно до 14B. Если сомневаетесь, отправьте характеристики своего ПК любой нейросети и спросите, потянет ли он конкретную модель.
Если отдельной видеокарты нет, всё решает оперативная память, а нагрузка ложится на процессор. На ноутбуке с 16 ГБ ОЗУ лучше не брать модели крупнее 4–6B, иначе работа будет очень медленной.
Облачные модели содержат сотни миллиардов параметров и заметно умнее, но разница проявляется в основном на сложных задачах. Для повседневной работы модели на 8–14B уже хороши и с каждым поколением становятся умнее.
Программы для запуска: LM Studio, Ollama и другие
Чтобы запустить модель, нужна программа-оболочка. Популярные варианты:
- Ollama — классика для локальных моделей;
- LM Studio — удобный интерфейс с каталогом моделей;
- Unsloth — в том числе модели для генерации изображений и видео (им нужна серьёзная видеокарта).
После установки LM Studio выбираете модель из встроенного каталога. При выборе обратите внимание на три пункта:
- Vision — модель умеет анализировать изображения. Это обязательно, если вы работаете с фото.
- Tool use — модель умеет пользоваться инструментами, то есть может работать как агент.
- Reasoning — есть режим рассуждения.
Формат модели: для Windows берите GGUF, для Mac — MLX, он оптимизирован под Apple Silicon.
Хороший выбор для ПК с 16 ГБ видеопамяти — мультимодальные модели семейства Gemma 4 и их аналоги подходящего размера. Новые модели выходят постоянно, так что перед установкой проверьте, что сейчас актуально.
Чат с нейросетью без интернета
Модель выбрана — и у вас появился «свой ChatGPT», который работает даже без подключения к сети. Он может:
- отвечать на вопросы;
- редактировать тексты;
- анализировать загруженные фото и файлы;
- писать несложный код.
Сам по себе чат в интернет не ходит, поэтому свежие новости он не расскажет. Это решается подключением MCP-серверов (см. ниже).
Локальный ИИ-агент для работы с файлами
Чтобы модель сама выполняла задачи, нужна агентная оболочка, которая умеет работать с файлами на компьютере. В видео для этого используется программа Bionic от разработчиков LM Studio. Модели, скачанные в LM Studio, подхватываются в ней автоматически.
Совет: сразу создайте отдельную рабочую папку для агента.
MCP: подключаем интернет и сервисы
MCP (Model Context Protocol) — протокол для подключения модели к внешним сервисам. С его помощью локальный агент может:
- загружать страницы из интернета (Fetch);
- просматривать и парсить сайты (скраперы);
- искать информацию через Tavily: сервис платный, но бесплатной квоты в месяц хватает для простых задач;
- анализировать видео, скачивать контент и многое другое.
Как подключить нужный MCP-сервер, можно спросить у самой нейросети.
Что умеет локальный агент: практические сценарии
Для фотографов:
- уменьшить все фото в папке до 1920 px по длинной стороне и сохранить в отдельную папку;
- сделать alt-тексты для сайта (можно указать город съёмки, чтобы описания были точнее);
- разобрать снимки «глазами профессионального фотографа». Творчество субъективно, но базовые ошибки вроде дорожного знака, растущего из головы героя, агент заметит;
- вытащить JPEG из RAW-файлов;
- прочитать EXIF и отсортировать снимки по фокусному расстоянию, сведя данные в таблицу;
- разложить по разным папкам кадры, где модель смотрит в камеру и где нет.
Для всех:
- собрать HTML-отчёт из таблиц со статистикой;
- сделать одностраничный сайт из текстов и фото;
- провести SEO-анализ сайта или скачать с него тексты (при подключённом интернете через MCP).
Навыки: повторяем задачу одной командой
Если задача повторяется, попросите агента создать навык (скилл). После этого достаточно вызвать навык и указать папку, описывать задачу заново не нужно.
Как работать с локальной моделью эффективно
- Давайте задачи по шагам. Команда «переведи 2000 RAW в JPEG, оцени каждое фото и выбери три лучших» перегрузит контекст, оперативную и видеопамять, и система зависнет. Разбейте её на этапы.
- Подбирайте модель под задачу. Одни модели лучше работают со структурированными данными, другие — с творческими задачами и анализом изображений.
- Для новой задачи открывайте новый диалог. Агент учитывает контекст предыдущих задач, и в новом чате он не будет путаться.
Превращаем ПК в сервер и общаемся с нейросетью через Telegram
Локальную модель можно сделать доступной откуда угодно:
- В настройках LM Studio включите локальный сервер и запишите его адрес.
- Установите агент Hermes. Он станет посредником между моделью и внешним миром.
- Укажите в Hermes адрес вашего сервера.
- Привяжите Hermes к Telegram.
Теперь можно писать своей нейросети из любого места: отправлять фото на оценку, давать задания и получать ответы. Hermes сам ищет информацию в интернете, а локальная модель её анализирует. Например: «Найди программу фотофестиваля, спикеров и темы, собери документ и сохрани». Когда вернётесь домой, файл уже будет лежать в папке.
Локальная или облачная нейросеть: что выбрать
| Локальная модель | Облачная (Claude, ChatGPT) | |
|---|---|---|
| Стоимость | Бесплатно (нужен мощный ПК) | Подписка, оплата токенов |
| Приватность | Файлы остаются на ПК | Данные уходят на серверы |
| Интеллект | Хватает для рутины | Выше на сложных задачах |
| Интернет | Не нужен (или через MCP) | Обязателен |
Это не конкуренция, а взаимодополнение: локальная модель берёт на себя рутину и конфиденциальные файлы, а облачная — сложные проекты.

Комментарии
Отправить комментарий