Как развернуть ИИ на компьютере

Проще всего поставить LM Studio и уже из него качать модели. Минимум действий, без Docker и прочей возни. Но ожидать чудес от локального запуска не стоит. У меня 5070 Ti 16 GB VRAM, 7800X3D, 64 GB DDR5 6000. Все, что из "топового" реально лезло локально, ради интереса пробовал. Рука-лицо. Жизни там особо нет, не с такими мощностями. Локально поиграться можно, но это не уровень нормальных облачных моделей.
Алиса, Гигачат и подобное это вообще не показатель уровня нейросетей. По ним судить всю тему странно. Нормальные модели есть, просто они обычно не в таких бытовых ассистентах. У меня Codex от OpenAI сам через COM залил FluidNC на MKS DLC32 v2.1 вместо GRBL. Я только дал настройки с GRBL и тип станка, подтвердил, что оси и концевики определены верно. Хотелось попробовать по Wi-Fi и лень было вникать. Забывчивость во многом зависит от контекстного окна. Чем оно меньше, тем быстрее модель теряет нить. Поэтому не надо устраивать длинные обсуждения на сотни сообщений и потом удивляться, что в конце она тупит. На бесплатных тарифах это еще заметнее. С галлюцинациями тоже стало лучше. Раньше модели часто были заточены на выдачу результата любой ценой. Если точного ответа не было, они могли уверенно сгенерировать правдоподобную чушь. Сейчас нормальные модели чаще признают, что точно не знают. Но в узких темах проверка все равно обязательна. И важно не путать разные вещи. Генератор изображений и чат-бот это разные модели. Чат-бот с рассуждениями и обычный чат-бот тоже ведут себя по-разному.
 
Приподниму тему. В свете новых данных, Максим был недалек от истины. Оказывается можно локально развернуть искина на личном компутере:
Да, абсолютно. Более того, это не просто теория — это то, что вы можете сделать на своём домашнем компьютере прямо сейчас, в 2026 году.
Вам не нужен суперкомпьютер или постоянный интернет, чтобы развернуть такую систему локально. Вся индустрия разработки ИИ последние годы шла именно к этому: сделать ИИ автономным, локальным и компактным.
Вот как эта схема выглядит на вашем домашнем ПК на практике:

1. Как распределяется память на вашем диске

Чтобы всё это работало без интернета, вам действительно понадобятся две вещи, но общий объём будет далеко не «терабайты»:

  • Исполняемый движок (та самая программка на 50 МБ): Вы скачиваете крошечную скомпилированную утилиту (например, популярнейший софт с открытым исходным кодом llama.cpp или приложение Ollama). Она написана на чистом C/C++ и весит как раз около 30–50 мегабайт. Это и есть «мотор», который умеет управлять процессором и видеокартой.
  • Файл модели (Файлы «мозгов»): Вы скачиваете один файл весов (например, современную легкую модель Llama 3 8B или Gemma 2). За счёт технологии квантования (умного сжатия математических данных) этот файл весит всего от 4 до 8 гигабайт. Он легко поместится на любой современный жесткий диск или SSD.

2. Как это будет работать с вашими файлами (Архитектура RAG)

Технология, о которой вы говорите («выдавать нужные данные с винчестера и обсчитывать параметры по справочникам»), в индустрии называется RAG (Retrieval-Augmented Generation) — генерация с привлечением контекста.
На вашем домашнем ПК это работает в автоматическом цикле:

  1. Индексация: Вы указываете программе папку на вашем винчестере, где лежат ваши личные файлы, справочники, PDF-книги или таблицы Excel. Программа один раз «пробегает» по ним и создаёт скрытый индекс (своего рода умное оглавление).
  2. Ваш запрос: Вы пишете локальному ИИ: «Найди в справочнике по металловедению коэффициент расширения для стали марки 45 и посчитай, насколько удлинится вал длиной 2 метра при нагреве на 50 градусов».
  3. Поиск и расчёт:
    • Программка в 50 МБ мгновенно «ныряет» в ваш индекс на винчестере.
    • Вытаскивает оттуда точную строчку из справочника с нужным коэффициентом.
    • Подставляет этот коэффициент в файл «мозгов» нейросети.
    • Нейросеть генерирует правильную математическую формулу и выдаёт вам готовый расчёт.

В чём главный плюс для вас?


  • 100% приватность: Ваши личные данные, справочники и чертежи не отправляются ни на какие серверы в США или Китай. Всё происходит внутри вашего системного блока.
  • Работа без интернета: Вы можете выдернуть сетевой провод из компьютера, уехать в тайгу, и система будет работать точно так же быстро.
  • Скорость: На современном домашнем компьютере (особенно если есть видеокарта от NVIDIA хотя бы среднего уровня) такая связка выдаёт текст со скоростью пулемёта.
Вы можете прямо сегодня превратить свой домашний ПК в изолированную лабораторию для того самого «любознательного помощника», архитектуру которого мы с вами обсуждали.
Если вы хотите попробовать настроить это у себя, скажите:

  • Какая у вас операционная система (Windows, Linux) и есть ли видеокарта (NVIDIA или встроенная)?
  • Какие типы справочников и данных (текст, таблицы, PDF) вы хотите ей скормить в первую очередь?
Я могу дать вам простую пошаговую инструкцию, какой софт скачать (он полностью бесплатный и без вирусов), чтобы запустить такую систему за 15 минут.
 
А можно ИИ на VDS развернуть?
Просто там не будет же мощностей от видео карты?
Только проц и память...

прошу прощения, но ответ получил от дежурного ИИ :)

Да, ИИ можно развернуть на VDS — но возможности зависят от задачи и ресурсов сервера.

Что обычно запускают на VDS

  • локальную LLM для чата;
  • RAG-поиск по своим документам;
  • embeddings и векторную базу;
  • распознавание речи;
  • небольшие модели классификации или генерации текста;
  • API для доступа к модели из сайта или приложения.

Без GPU

На обычном VDS можно запускать небольшие квантованные модели через:

  • Ollama;
  • llama.cpp;
  • GPT4All;
  • Docker + Open WebUI.
Ориентировочно:

МодельМинимальная RAM
3B–4B4–8 ГБ
7B–8B8–16 ГБ
13B–14B16–32 ГБ
30B и больше64 ГБ+
Без GPU ответы будут медленнее, но для личного чат-бота или API это вполне подходит.

Например, на Ubuntu:

Bash
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.2:3b

Можно также использовать модели Qwen, Mistral и другие в квантованном формате.

С GPU

Для быстрой работы или больших моделей нужен VDS/VPS с NVIDIA GPU и поддержкой CUDA. Важен объём видеопамяти:

  • 8 ГБ VRAM — небольшие модели;
  • 16–24 ГБ — 7B–14B с хорошей скоростью;
  • больше — для крупных моделей и параллельных запросов.
Обычный VDS чаще всего GPU не имеет. В таком случае подойдут GPU-серверы или облачные GPU-инстансы.

Что потребуется дополнительно

  • 4–8 vCPU для небольшой модели;
  • SSD от 20–50 ГБ;
  • Linux, обычно Ubuntu 22.04/24.04;
  • Docker или Ollama;
  • Nginx и HTTPS;
  • авторизация, если API будет доступно из интернета.
Полноценное обучение больших моделей на обычном VDS практически нереально. Для inference, чат-бота, RAG или небольшого AI-сервиса — вполне возможно.
 
Андрей, я пробовал локально, как писали выше, это слёзы. Даже имея слабый интернет облачные в десятки раз быстрее.
 
Андрей, я пробовал локально, как писали выше, это слёзы. Даже имея слабый интернет облачные в десятки раз быстрее.
А если торопиться некуда? Утром задал ему вопрос и пошел на работу. Вечером пришел, он уже последнюю букву допечатывает. Нормально.
 
Сверху Снизу