Локальная модель на своём железе: запуск за полчаса

Обновлено 17.08.2026 Уровень: средний 40 минут 0 ₽

Локальный запуск — единственный способ работать с ИИ так, чтобы код физически не покидал ваш компьютер. Разберём, какое железо нужно, какую версию выбрать и как подключить модель к редактору.

40 мин на настройку
0 ₽ после покупки железа
5 шагов

Шаг 1. Оценить своё железо

Главный ограничитель — объём видеопамяти. Ориентир: 8 ГБ хватает на младшие версии, 12–16 ГБ дают приемлемое качество, 24 ГБ и выше открывают старшие модели. На процессоре без видеокарты запустить можно, но отвечать модель будет так медленно, что пользоваться этим не захочется.

Шаг 2. Поставить среду запуска

Проще всего использовать готовый локальный сервер моделей: он ставится одной командой, сам скачивает веса и поднимает совместимый с привычным API адрес. Ничего собирать вручную не нужно.

Терминал
# установка среды запуска
# затем — загрузка модели нужного размера
ollama pull qwen2.5-coder:7b
ollama run qwen2.5-coder:7b

Шаг 3. Выбрать размер модели

Правило простое: берите самую большую версию, которая помещается в видеопамять с запасом. Модель, которая едва влезла, будет работать медленно. Если сомневаетесь — начните с младшей, оцените скорость, потом пробуйте следующую.

Шаг 4. Подключить к редактору

Локальный сервер отдаёт совместимый адрес, поэтому большинство инструментов подключаются штатно: в настройках указывается свой адрес вместо облачного. После этого агент работает как обычно, только запросы никуда не уходят.

Шаг 5. Сверить ожидания

Локальная модель на потребительской видеокарте — это не замена флагману. Она хорошо справляется с типовыми задачами: объяснить код, написать функцию, набросать тест. На сложном многофайловом рефакторинге разница с облачными моделями будет заметной, и это нормально.

Использовали в гайде

DeepSeek — открытые веса

Какая видеокарта нужна?
Минимально приемлемо — 8 ГБ видеопамяти, комфортно — от 12–16 ГБ. Чем больше, тем крупнее версия модели и выше качество.
Можно ли запустить на ноутбуке без дискретной видеокарты?
Технически да, младшие версии запустятся. Практически — скорость ответа будет такой, что работать станет неудобно.
Насколько это хуже облачной модели?
На простых задачах разница умеренная, на сложных — заметная. Взамен вы получаете нулевые расходы и полную приватность.