Большинство нейросетей сегодня работают онлайн: вы открываете сайт, пишете запрос и получаете ответ с удаленного сервера. Но некоторые современные модели можно скачать на компьютер и запускать прямо на своем железе — даже без подключения к интернету.

Это называется локальным запуском нейросети. Вы скачиваете файлы модели, устанавливаете специальную программу и после этого общаетесь с ИИ примерно так же, как с обычным онлайн‑чатом.

Причем для этого не обязательно иметь игровой ПК за несколько тысяч долларов. Существуют компактные версии моделей, которые способны работать даже на обычных домашних компьютерах и ноутбуках.

Ниже я расскажу, как пользоваться нейросетями локально, но для начала приглашаю в наш Telegram‑канал. Там мы разбираем запуски стартапов, часто связанные с ИИ. Заходите, там интересно.

Это вообще законно?

Да.

Многие современные нейросети распространяются именно таким образом: разработчики публикуют веса моделей, которые можно скачать и запускать самостоятельно. Это не взлом и не какой‑то обход ограничений.

При этом у каждой модели есть собственная лицензия, поэтому перед использованием в коммерческих целях стоит проверить ее условия.

Главное отличие локальной нейросети от обычного онлайн‑сервиса в том, что модель работает не на серверах разработчика, а непосредственно на вашем компьютере.

Зачем это нужно? Все же работает онлайн…

На первый взгляд локальная нейросеть действительно кажется не особенно нужной. Зачем что‑то скачивать, если можно просто открыть ChatGPT или другой ИИ в браузере?

Причин несколько.

Можно работать без интернета. После установки модели подключение к сети для генерации ответов не требуется. Это удобно в поездках, на даче или просто там, где плохой интернет.

Ваши запросы не отправляются на сервер. Если вы работаете с конфиденциальными документами, кодом или другой чувствительной информацией, локальный запуск позволяет обрабатывать данные непосредственно на компьютере.

Не нужно платить за каждый запрос. После скачивания модели вы можете пользоваться ей без подписки и оплаты API.

Можно экспериментировать. Локальный запуск дает гораздо больше контроля: можно выбирать разные модели, версии и параметры их работы.

Есть и обратная сторона: локальные модели обычно слабее самых мощных облачных ИИ, а для крупных моделей требуется много оперативной памяти или мощная видеокарта.

Какие нейросети можно скачать?

Сегодня локально запускается уже огромное количество моделей. Среди наиболее известных:

  • DeepSeek — модели для общего общения, программирования и рассуждений.

  • Llama — семейство моделей Meta.

  • Qwen — семейство моделей Alibaba, хорошо подходящее для самых разных задач.

  • Gemma — компактные модели Google.

  • Mistral — модели французской компании Mistral AI.

  • Phi — небольшие модели Microsoft, рассчитанные в том числе на запуск на относительно слабом железе.

Причем одна и та же модель может существовать в нескольких вариантах. Например, условный DeepSeek на 7–8 млрд параметров будет гораздо менее требовательным к компьютеру, чем модель на десятки или сотни миллиардов параметров.

Для установки можно использовать специальные программы вроде LM Studio, которые превращают весь процесс в несколько простых шагов.

Как скачать нейросеть на компьютер

Рассмотрим весь процесс на примере DeepSeek и LM Studio.

В ней разберем, где скачать LM Studio, как найти DeepSeek, какую версию модели выбрать и сколько оперативной памяти потребуется для ее запуска.

Шаг 1

Сначала скачайте LM Studio с официального сайта.

Шаг 2

Установите программу и запустите ее. Ничего сложного здесь нет: установка проходит стандартным образом, без каких‑либо спорных или непонятных этапов.

Шаг 3

Откройте раздел поиска моделей — это кнопка с изображением лупы и робота.

Шаг 4

Введите в поисковую строку «DeepSeek» и выберите подходящую модель.

В результатах поиска будет несколько вариантов одной модели. В основном они различаются типом квантовки.

Квантовка позволяет уменьшить размер модели, благодаря чему ей требуется меньше памяти и вычислительных ресурсов, а работать на обычном компьютере она может быстрее. При этом более сильное сжатие потенциально приводит к некоторой потере качества.

Например:

Q2 → сильнее сжата → занимает меньше места → ниже требования к железу → потенциально больше потерь качества.

Наиболее распространенные варианты:

  • Q4_K_M — хороший компромисс между качеством и производительностью. Подойдет большинству пользователей и не требует слишком много памяти.

  • Q6_K — дает немного более высокое качество, однако требует больше оперативной памяти.

  • Q8_0 — обеспечивает максимальное качество среди квантованных вариантов, но одновременно предъявляет наиболее высокие требования к компьютеру.

Если вы не знаете, какой вариант выбрать, берите Q4_K_M. Для большинства обычных задач разница в качестве будет практически незаметна, зато модель будет работать быстрее и потребует меньше ресурсов.

Ориентировочные системные требования:

  • DeepSeek 8B — от 8 ГБ оперативной памяти и примерно 5–6 ГБ свободного пространства на диске.

  • DeepSeek 14B — желательно иметь 16 ГБ ОЗУ и около 10–12 ГБ свободного места.

  • DeepSeek 32B — потребуется от 32 ГБ ОЗУ и более 20 ГБ свободного пространства.

Отдельная мощная видеокарта не обязательна: модель способна работать непосредственно на процессоре. Но если в компьютере есть GPU с 8–12 ГБ видеопамяти, скорость генерации ответов будет значительно выше.

Для большинства домашних компьютеров разумным выбором будет версия 8B. Она предлагает удачное соотношение качества ответов и требований к системе.

Шаг 5

Дождитесь окончания загрузки модели, после чего откройте окно чата.

Готово — теперь DeepSeek можно использовать без подключения к интернету.

FAQ

А ChatGPT тоже можно скачать на компьютер?

Нет — по крайней мере официальные модели ChatGPT нельзя просто скачать и установить на домашний компьютер.

OpenAI предоставляет доступ к своим моделям через онлайн‑сервис ChatGPT и API, но не публикует веса актуальных моделей ChatGPT для свободного локального запуска.

Поэтому скачать на компьютер условный GPT-5 и пользоваться им полностью офлайн таким же способом, как локальным DeepSeek или Llama, нельзя.

Зато существуют модели других компаний, которые специально распространяются для локального запуска.

Нужен ли интернет после установки?

Для самой генерации ответов — нет. После того как программа и модель уже скачаны, нейросеть может работать полностью офлайн.

Интернет понадобится, например, чтобы скачать новую модель или обновить программу.

Обязательно ли нужна мощная видеокарта?

Нет.

Локальные модели могут работать непосредственно на процессоре, хотя это обычно значительно медленнее. Видеокарта с большим объемом VRAM позволяет существенно ускорить генерацию.

Для небольших моделей иногда достаточно обычного современного ноутбука.

Сколько места занимает нейросеть?

Зависит от конкретной модели и ее версии.

Небольшая квантованная модель может занимать несколько гигабайт, тогда как более крупные варианты требуют десятки гигабайт.

Кроме того, требования к диску и требования к оперативной памяти — не одно и то же. Даже если файл модели занимает, например, 5 ГБ, компьютеру может потребоваться заметно больше памяти для ее нормальной работы.

Что такое квантование?

Квантование — это способ уменьшить размер модели и требования к ресурсам компьютера.

Упрощенно: модель сжимают, благодаря чему она занимает меньше места и быстрее работает на обычном железе. При этом часть качества теряется.

Поэтому для одной и той же нейросети можно встретить варианты вроде Q4, Q6 и Q8. Чем выше число, тем обычно выше качество и требования к памяти.

Если вы только начинаете разбираться в локальных нейросетях, чаще всего имеет смысл выбирать вариант с разумным балансом между размером и качеством — например, Q4_K_M.

Можно ли скачать несколько нейросетей?

Да.

Можно установить несколько разных моделей и переключаться между ними в зависимости от задачи. Например, одну использовать для программирования, другую — для текстов, третью — для быстрых ответов.

Главное ограничение здесь — ресурсы компьютера и свободное место на диске.

Какая нейросеть лучше для слабого компьютера?

Универсального ответа нет: все зависит от процессора, объема оперативной памяти и видеокарты.

Но в целом для слабого компьютера лучше выбирать небольшие модели и более сильное квантование. Они будут работать быстрее и потребуют меньше памяти.

Если же компьютер мощный, можно запускать значительно более крупные модели с лучшим качеством ответов.

Если вам понравился этот гайд, приглашаю ваш в наш Telegram‑канал. Там мы разбираем запуски IT‑cтартапов, в том числе связанные с ИИ (например, ИИ‑переводчик и ИИ‑помощник для изучения английского). Заходите, там интересно.

Комментарии (18)


  1. Politura
    10.08.2026 15:45

    Почему все подобные статьи пишут люди далекие от темы, которым столь лениво самим разбираться, что выплевывают устаревшую на годы инфу? Что их заставляет так делать? И ведь даже не смутила надпись на скрине со списком моделей, что DeepSeek R1 0528 Qwen 8B был выложен 370 дней назад!

    • DeepSeek — модели для общего общения, программирования и рассуждений.

    • Llama — семейство моделей Meta.

    • Qwen — семейство моделей Alibaba, хорошо подходящее для самых разных задач.

    • Gemma — компактные модели Google.

    • Mistral — модели французской компании Mistral AI.

    • Phi — небольшие модели Microsoft, рассчитанные в том числе на запуск на относительно слабом железе.

    DeepSeek самая маленькая современная модель занимает 167Гб, она изначально с весами 4 бита, так что даже если квантовать агрессивно, нужен весьма продвинутый комп, чтоб запустить и погрустить от того, как оно медленно.

    llama - их последняя модель вышла в апреле 2025 и тоже была слишком большая для обычных компов, причем весьма посредственная, что привело к тому, что руководителя заменили и теперь Мета пилит закрытые модели с другим именем.

    Mistral - последний релиз в марте не задался, во-первых mistral small теперь на 116B параметров, что слишком много для обычных компов, во-вторых модель так себе, хуже конкурентов.

    Phi - последний релиз в декабре аж 2024, вроде по слухам команду распустили, кто-то уволился, кто-то перешел в другие отделы.


    1. AleGen
      10.08.2026 15:45

      Эту статью написал не людь. Нейрослоп однако.


  1. Moog_Prodigy
    10.08.2026 15:45

    Ага, а еще на смартфоны их ставить пытаются? Для чего? Ну даже топовый смарт не тянет слабенькие модельки. А это типа, потому что можем...Не, ну...модельку от карпатого можно даже на esp32 запустить спору нет, а зачем? Это как дум на тестах для беременности?


    1. allivut
      10.08.2026 15:45

      Gemma4 e4b вполне себе работает и вполне шустро


      1. alex09102026
        10.08.2026 15:45

        3-8 токенов в сек? или таки уже до 9+ токенов в сек разогнали?


        1. Prohoziy2202
          10.08.2026 15:45

          Если это ирония, то не уместна. 6-8 секунд это уже вполне комфортная скорость для многих задач.


        1. allivut
          10.08.2026 15:45

          у меня 10-12 tps. для большинства простых задач и правда хватает. ну оно и не для вайбкодинга или по каким вы там критериям оцениваете.
          да и смартфон у меня 4 летней давности...


  1. SkalolazOther
    10.08.2026 15:45

    Вот одна из самых маленьких: qwen3.5:0.8b 1.0GB 256K Text, Image, но на Iphone 16 запускал qwen3.5:4b. Вполне нормально отвечает и при том распознает изображения.


  1. NeoCode2
    10.08.2026 15:45

    Прежде чем всё это делать, нужен Шаг 0 - выбор, покупка и установка железа, на котором всю эту красоту запускать. Вот это гораздо интереснее обсудить. И вот с этим реально непонятно что делать:) Цены растут (и конца этому процессу не видно), слабое железо покупать не хочется, потому что оно и слабое недешевое, а результат будет хуже чем у онлайн моделей. А реально мощное железо стоит уже очень дорого.

    Также, концептуально есть мощные видеокарты Nvidia, под которые всё заточено (CUDA и т.д.). И есть новый класс устройств - UMA (Unified Memory Architecture) / APU (Accelerated Processing Unit), когда процессор и видеокарта объединены и используют общий пул памяти (причем памяти там больше чем у видеокарт). Скорость работы меньше чем у видеокарт, но зато памяти больше (128 гигов против 32...48). И это не огромная видеокарта, требующая десктопа, а самостоятельное портативное устройство. Apple с чипами M-серии или AMD Strix Halo.

    Но цены пока огромные и на карты, и на UMA/APU.


    1. Prohoziy2202
      10.08.2026 15:45

      Чего же непонятно)? Если достаточно небольших моделей, то видеокарта 3060 на 12гб, или система на ддр 5 в 2-х канале, или ддр4 в 4-х канале. Если надо большие модели, то тогда опять же 3060, серверная мать с 128+ гб ОЗУ ддр4, и МоЕ модели. Есть много вариантов с устаревшими серверами видеокартами, но я не поклонник этих решений.


  1. foxb
    10.08.2026 15:45

    А ChatGPT тоже можно скачать на компьютер?

    Да -> https://openai.com/index/introducing-gpt-oss/


  1. YaroslavKhmelev
    10.08.2026 15:45

    Для видеокарты с 8 ГБ памяти оптимальной является модель Ornith-1.0-9B. Перепробовал много, она самая сильная и быстрая (60-70 токенов/сек).


    1. Prohoziy2202
      10.08.2026 15:45

      Ну статья, как я понимаю, для НЕ программистов (люди работающие в сфере программирования знают куда больше автора), а обычным людям эта модель не поможет, т.к она для кодинга


    1. NeoCode2
      10.08.2026 15:45

      А что можно полезного запустить на 8Гб? Просто интересно, я вот сомневаюсь покупать ли 12Гб или просто тупо подождать пару-тройку лет и купить что-то нормальное, чтобы уже надолго хватило.


      1. economist75
        10.08.2026 15:45

        Имхо лучше не ждать, а докупить то, что сильно (вдвое) ускорит инференс и вчетверо расширит выбор моделей - Nvidia CMP 50HX 10 GB за 4 тыс. руб.


        1. Moog_Prodigy
          10.08.2026 15:45

          Ну не ускорит. Там еще жосткие пляски с бубном нужны. И даже так не ускорит. https://habr.com/ru/articles/948396/

          Имхо уже года 2 есть тенденция "llm на cpu", медленно но качественно. И даже с нынешней ценой RAM оно все равно дешевле остается. Скорость не ахти. Но смотря что делать. А карты как взлетели при майнинге, так особо и не дешевеют, еще и ИИ рынок вскипятил.


          1. economist75
            10.08.2026 15:45

            Спасибо за ссылку, полезная статья. На CPU/RAM с 2-5 t/s уж очень сильно сбивается привычный ритм разработки, надо тщательнее планировать и сегментировать задачи. Агент не совсем тонко понимает людские настроения. Хотя, наверно, это зависит и от самой задачи, и от цейтнота при ее решении.


      1. YaroslavKhmelev
        10.08.2026 15:45

        8 гБ есть смысл менять на 24 гб только.