Локальная нейросеть на своём ПК: ИИ-агент без подписки, VPN и интернета

 





Зачем запускать нейросеть на своём компьютере

Большинство людей пользуются нейросетями в браузере: ChatGPT, Gemini, Claude и т. д. Запрос уходит на сервер компании, обрабатывается там, а ответ возвращается вам. Это удобно, но у облачного подхода есть ограничения:

  • лимиты на количество запросов;
  • расширенные функции доступны только по подписке, которую ещё нужно как-то оплатить;
  • ваши файлы и запросы уходят на чужие серверы.

Локальная нейросеть работает иначе: модель установлена на вашем ПК и использует его ресурсы. Не нужны ни подписка, ни VPN, а после скачивания модели не нужен и интернет. Файлы при этом не покидают компьютер.

Что такое ИИ-агент и почему облачные агенты стоят дорого

ИИ-агент — это не просто чат, а программа, которая сама выполняет задачи. Например:

  • проанализировать таблицу;
  • собрать HTML-страницу;
  • просмотреть фото в папке и скопировать лучшие в отдельную.

Агент читает файлы, при необходимости ищет информацию в интернете, обрабатывает всё языковой моделью и выдаёт результат.

Работа оплачивается токенами. Один токен — это примерно 4 символа латиницы или 1–2 символа кириллицы. Токены расходуются не только на ответ, но и на весь процесс «размышления» над задачей, поэтому облачные агенты почти всегда платные, а сложные проекты могут обойтись в сотни и тысячи долларов.

Локальный агент выполняет рутинные задачи бесплатно, на мощностях вашего компьютера.

Как выбрать локальную модель под своё железо

Главное для локальной модели — видеокарта, а точнее объём её видеопамяти (VRAM). Чем больше памяти, тем умнее модель можно запустить.

Параметр B: размер модели

B — это миллиарды параметров:

РазмерУровеньГде работает
1,5–3BБазовые задачиНоутбук, планшет, иногда телефон
7–8B«Золотой стандарт» для домаОбычный игровой ПК
14–32BПродвинутый: понимает контекст, неплохо пишет кодХорошая видеокарта
70B+Близко к облачным моделямОчень мощные GPU с большой памятью

Параметр Q: квантование

Квантование — это сжатие весов модели, чтобы она занимала меньше места:

  • Q4 (4 бита) — оптимально для большинства: модель становится примерно втрое легче, а качество падает всего на 1–2%;
  • Q8 (8 бит) — максимальное качество, но видеопамяти нужно почти вдвое больше.

Быстрое правило выбора

Упрощённо: число миллиардов параметров не должно превышать объём видеопамяти в гигабайтах. Например, с 16 ГБ VRAM комфортно работают модели примерно до 14B. Если сомневаетесь, отправьте характеристики своего ПК любой нейросети и спросите, потянет ли он конкретную модель.

Если отдельной видеокарты нет, всё решает оперативная память, а нагрузка ложится на процессор. На ноутбуке с 16 ГБ ОЗУ лучше не брать модели крупнее 4–6B, иначе работа будет очень медленной.

Облачные модели содержат сотни миллиардов параметров и заметно умнее, но разница проявляется в основном на сложных задачах. Для повседневной работы модели на 8–14B уже хороши и с каждым поколением становятся умнее.

Программы для запуска: LM Studio, Ollama и другие

Чтобы запустить модель, нужна программа-оболочка. Популярные варианты:

  • Ollama — классика для локальных моделей;
  • LM Studio — удобный интерфейс с каталогом моделей;
  • Unsloth — в том числе модели для генерации изображений и видео (им нужна серьёзная видеокарта).

После установки LM Studio выбираете модель из встроенного каталога. При выборе обратите внимание на три пункта:

  1. Vision — модель умеет анализировать изображения. Это обязательно, если вы работаете с фото.
  2. Tool use — модель умеет пользоваться инструментами, то есть может работать как агент.
  3. Reasoning — есть режим рассуждения.

Формат модели: для Windows берите GGUF, для Mac — MLX, он оптимизирован под Apple Silicon.

Хороший выбор для ПК с 16 ГБ видеопамяти — мультимодальные модели семейства Gemma 4 и их аналоги подходящего размера. Новые модели выходят постоянно, так что перед установкой проверьте, что сейчас актуально.

Чат с нейросетью без интернета

Модель выбрана — и у вас появился «свой ChatGPT», который работает даже без подключения к сети. Он может:

  • отвечать на вопросы;
  • редактировать тексты;
  • анализировать загруженные фото и файлы;
  • писать несложный код.

Сам по себе чат в интернет не ходит, поэтому свежие новости он не расскажет. Это решается подключением MCP-серверов (см. ниже).

Локальный ИИ-агент для работы с файлами

Чтобы модель сама выполняла задачи, нужна агентная оболочка, которая умеет работать с файлами на компьютере. В видео для этого используется программа Bionic от разработчиков LM Studio. Модели, скачанные в LM Studio, подхватываются в ней автоматически.

Совет: сразу создайте отдельную рабочую папку для агента.

MCP: подключаем интернет и сервисы

MCP (Model Context Protocol) — протокол для подключения модели к внешним сервисам. С его помощью локальный агент может:

  • загружать страницы из интернета (Fetch);
  • просматривать и парсить сайты (скраперы);
  • искать информацию через Tavily: сервис платный, но бесплатной квоты в месяц хватает для простых задач;
  • анализировать видео, скачивать контент и многое другое.

Как подключить нужный MCP-сервер, можно спросить у самой нейросети.

Что умеет локальный агент: практические сценарии

Для фотографов:

  • уменьшить все фото в папке до 1920 px по длинной стороне и сохранить в отдельную папку;
  • сделать alt-тексты для сайта (можно указать город съёмки, чтобы описания были точнее);
  • разобрать снимки «глазами профессионального фотографа». Творчество субъективно, но базовые ошибки вроде дорожного знака, растущего из головы героя, агент заметит;
  • вытащить JPEG из RAW-файлов;
  • прочитать EXIF и отсортировать снимки по фокусному расстоянию, сведя данные в таблицу;
  • разложить по разным папкам кадры, где модель смотрит в камеру и где нет.

Для всех:

  • собрать HTML-отчёт из таблиц со статистикой;
  • сделать одностраничный сайт из текстов и фото;
  • провести SEO-анализ сайта или скачать с него тексты (при подключённом интернете через MCP).

Навыки: повторяем задачу одной командой

Если задача повторяется, попросите агента создать навык (скилл). После этого достаточно вызвать навык и указать папку, описывать задачу заново не нужно.

Как работать с локальной моделью эффективно

  • Давайте задачи по шагам. Команда «переведи 2000 RAW в JPEG, оцени каждое фото и выбери три лучших» перегрузит контекст, оперативную и видеопамять, и система зависнет. Разбейте её на этапы.
  • Подбирайте модель под задачу. Одни модели лучше работают со структурированными данными, другие — с творческими задачами и анализом изображений.
  • Для новой задачи открывайте новый диалог. Агент учитывает контекст предыдущих задач, и в новом чате он не будет путаться.

Превращаем ПК в сервер и общаемся с нейросетью через Telegram

Локальную модель можно сделать доступной откуда угодно:

  1. В настройках LM Studio включите локальный сервер и запишите его адрес.
  2. Установите агент Hermes. Он станет посредником между моделью и внешним миром.
  3. Укажите в Hermes адрес вашего сервера.
  4. Привяжите Hermes к Telegram.

Теперь можно писать своей нейросети из любого места: отправлять фото на оценку, давать задания и получать ответы. Hermes сам ищет информацию в интернете, а локальная модель её анализирует. Например: «Найди программу фотофестиваля, спикеров и темы, собери документ и сохрани». Когда вернётесь домой, файл уже будет лежать в папке.

Локальная или облачная нейросеть: что выбрать

Локальная модельОблачная (Claude, ChatGPT)
СтоимостьБесплатно (нужен мощный ПК)Подписка, оплата токенов
ПриватностьФайлы остаются на ПКДанные уходят на серверы
ИнтеллектХватает для рутиныВыше на сложных задачах
ИнтернетНе нужен (или через MCP)Обязателен

Это не конкуренция, а взаимодополнение: локальная модель берёт на себя рутину и конфиденциальные файлы, а облачная — сложные проекты.

FAQ

Можно ли запустить нейросеть на компьютере бесплатно?
Да. Программы вроде LM Studio и Ollama бесплатны, как и многие открытые модели.

Какая видеокарта нужна для локальной нейросети?
Для моделей 7–8B хватит 8–12 ГБ VRAM, для 14B желательно 16 ГБ. Без видеокарты модели работают на процессоре, но медленнее.

Что лучше: Q4 или Q8?
Q4 — оптимальный баланс веса и качества. Q8 немного точнее, но требует почти вдвое больше видеопамяти.

Работает ли локальная нейросеть без интернета?
Да, после скачивания модели. Для поиска в сети подключаются MCP-серверы.

Как общаться с локальной моделью с телефона?
Включите локальный сервер в LM Studio и подключите его к Telegram через агент Hermes.

Комментарии

Популярные сообщения из этого блога

Чем заменить Suno в 2026: 4 альтернативы для генерации музыки нейросетью

Mozart AI: обзор альтернативы Suno со студией, слоями и персонами

Suno v6 и электронная музыка: тест UK Garage, Deep Dubstep, Dub Techno и Future Dub