Локальная модель на своём железе: запуск за полчаса
Локальный запуск — единственный способ работать с ИИ так, чтобы код физически не покидал ваш компьютер. Разберём, какое железо нужно, какую версию выбрать и как подключить модель к редактору.
Шаг 1. Оценить своё железо
Главный ограничитель — объём видеопамяти. Ориентир: 8 ГБ хватает на младшие версии, 12–16 ГБ дают приемлемое качество, 24 ГБ и выше открывают старшие модели. На процессоре без видеокарты запустить можно, но отвечать модель будет так медленно, что пользоваться этим не захочется.
Шаг 2. Поставить среду запуска
Проще всего использовать готовый локальный сервер моделей: он ставится одной командой, сам скачивает веса и поднимает совместимый с привычным API адрес. Ничего собирать вручную не нужно.
# установка среды запуска # затем — загрузка модели нужного размера ollama pull qwen2.5-coder:7b ollama run qwen2.5-coder:7b
Шаг 3. Выбрать размер модели
Правило простое: берите самую большую версию, которая помещается в видеопамять с запасом. Модель, которая едва влезла, будет работать медленно. Если сомневаетесь — начните с младшей, оцените скорость, потом пробуйте следующую.
Шаг 4. Подключить к редактору
Локальный сервер отдаёт совместимый адрес, поэтому большинство инструментов подключаются штатно: в настройках указывается свой адрес вместо облачного. После этого агент работает как обычно, только запросы никуда не уходят.
Шаг 5. Сверить ожидания
Локальная модель на потребительской видеокарте — это не замена флагману. Она хорошо справляется с типовыми задачами: объяснить код, написать функцию, набросать тест. На сложном многофайловом рефакторинге разница с облачными моделями будет заметной, и это нормально.