Локальные модели: как запустить LLM на своём компьютере с нуля
29 мая 2026 г. · 7 мин чтения · Максим Космов

Содержание
- Зачем запускать AI локально
- Что такое Ollama
- Требования к железу
- Шаг 1: установка Ollama
- Шаг 2: выбор и загрузка модели
- Шаг 3: запуск и первый диалог
- Полезные команды Ollama
- Ollama как API
- Как подключить красивый интерфейс
- Несколько моделей: кто что умеет
- Создание Modelfile: кастомизация модели
- Параметры генерации
- Итог: когда что использовать
Языковую модель можно запустить прямо на своём ноутбуке или стационарном компьютере. Без интернета, без подписки, без отправки данных куда-либо. Ollama делает это настолько просто, что весь процесс от установки до первого ответа занимает около 10 минут.
В этом гайде - как установить, какую модель выбрать под ваше железо и как начать работать.
Зачем запускать AI локально
Четыре причины почему люди выбирают локальные модели:
Конфиденциальность. Никакие данные не уходят на серверы компании. Можно работать с чувствительными документами, корпоративными данными, личными заметками без риска утечки.
Стоимость. После однократной загрузки модель работает бесплатно без лимитов. При интенсивном использовании API это экономия нескольких сотен долларов в год.
Офлайн-работа. Нет интернета - модель всё равно работает. Самолёт, дача, командировка.
Кастомизация. Локальную модель можно дообучить на своих данных (fine-tune), изменить поведение, встроить в собственное приложение.
Ограничения: качество ответов ниже чем у GPT-4 или Claude - особенно для сложных задач. Нужно достаточно памяти (от 8 GB RAM). Первая загрузка модели занимает время.
Что такое Ollama
Ollama - это инструмент который скрывает техническую сложность запуска языковых моделей. Без него нужно было бы возиться с Python, зависимостями, конфигурационными файлами.
С Ollama: одна команда в терминале - и модель запущена. Интерфейс - либо командная строка, либо через HTTP API, либо через сторонние приложения.
Ollama работает на macOS (включая M1/M2/M3/M4), Windows 10/11, Linux. На Mac с чипами Apple Silicon модели работают особенно быстро - Apple Neural Engine используется эффективно.
Требования к железу
Ключевой параметр - объём оперативной памяти. Модель должна полностью поместиться в память.
8 GB RAM: модели до 7B параметров в 4-битном квантовании. Llama 3.2 3B (2 GB), Phi-3 mini 3.8B (2.3 GB), Gemma 2 2B (1.6 GB). Хорошо для простых задач: ответить на вопрос, написать текст.
16 GB RAM: модели 7B-8B. Llama 3.1 8B (4.7 GB), Mistral 7B (4.1 GB), Gemma 2 9B (5.4 GB). Хороший баланс - большинство задач решаются качественно.
32 GB RAM: модели 13B-14B. Llama 3.1 13B (7.4 GB), Qwen 2.5 14B (8.2 GB). Заметно лучше качество для сложного анализа, кода.
64+ GB RAM или видеокарта 24+ GB VRAM: модели 32B-70B. Llama 3.1 70B (~40 GB). Приближаются к GPT-4 по качеству.
Видеокарта ускоряет генерацию, но не обязательна. На CPU с 16 GB RAM Llama 8B генерирует примерно 5-15 токенов в секунду - медленнее облака, но вполне пригодно.
Шаг 1: установка Ollama
Для macOS и Windows: зайдите на ollama.com, нажмите "Download", установите как обычную программу.
Для Linux выполните в терминале:
curl -fsSL https://ollama.com/install.sh | sh
После установки Ollama работает в фоне. На Mac - иконка в строке меню. На Windows - в системном трее. Никаких дополнительных настроек не нужно.
Проверьте установку. Откройте терминал (Terminal на Mac, Command Prompt или PowerShell на Windows) и введите:
ollama --version
Должно вывестись что-то вроде ollama version 0.9.2.
Шаг 2: выбор и загрузка модели
Полный список моделей на ollama.com/library. Есть строка поиска.
Для первого запуска рекомендуется выбрать одну из этих моделей:
Если 8 GB RAM:
ollama pull llama3.2:3b
Скачает примерно 2 GB. Быстрая, неплохое качество для базовых задач.
Если 16 GB RAM:
ollama pull llama3.1:8b
Скачает примерно 4.7 GB. Хорошее соотношение качества и скорости. Рекомендуемый вариант для большинства.
Если 32 GB RAM:
ollama pull qwen2.5:14b
Скачает примерно 9 GB. Хорошо понимает русский язык.
Скачивание идёт с серверов Meta/Google/Alibaba (в зависимости от модели). Скорость зависит от интернета. Для 5 GB при скорости 50 Мбит/с - около 15 минут.
Шаг 3: запуск и первый диалог
Запустите модель в интерактивном режиме:
ollama run llama3.1:8b
Откроется диалог в терминале:
>>> Привет! Расскажи что ты умеешь?
Напишите вопрос и нажмите Enter. Через несколько секунд получите ответ.
Для выхода: /bye или Ctrl+D.
На первый запуск после скачивания Ollama загружает модель в память - это занимает 5-15 секунд. Последующие запуски быстрее.
Полезные команды Ollama
Список загруженных моделей:
ollama list
Удалить модель:
ollama rm llama3.1:8b
Информация о модели:
ollama show llama3.1:8b
Копировать модель под другим именем (для кастомизации):
ollama cp llama3.1:8b my-custom-model
Запустить модель и сразу передать вопрос (без интерактивного режима):
ollama run llama3.1:8b "Переведи на английский: Добрый день"
Ollama как API
Ollama автоматически поднимает HTTP API по адресу http://localhost:11434. Это позволяет использовать её из любого приложения.
Простой запрос через curl:
curl http://localhost:11434/api/chat -d '{"model":"llama3.1:8b","messages":[{"role":"user","content":"Привет!"}]}'
API совместим с форматом OpenAI - это значит что многие инструменты для работы с ChatGPT можно переключить на Ollama, просто сменив URL и убрав API-ключ.
Как подключить красивый интерфейс
Командная строка удобна для тестов, но для постоянной работы нужен чат-интерфейс.
Open WebUI - самый популярный. Устанавливается через Docker:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main
Откройте http://localhost:3000. Интерфейс похож на ChatGPT: история чатов, загрузка файлов, переключение между моделями.
AnythingLLM (описан в гайде про RAG) тоже подключается к Ollama и добавляет функцию работы с документами.
Для Mac существует нативное приложение Enchanted - бесплатное, красивое, устанавливается как обычная программа.
Несколько моделей: кто что умеет
Llama 3.1 (Meta) - хорошая универсальная модель. Хорошо понимает инструкции, генерирует код, пишет тексты. Есть версии 8B, 70B, 405B.
Mistral (Mistral AI) - компактная и быстрая. 7B параметров, хорошо работает на 8 GB RAM. Хороша для задач с умеренной сложностью.
Gemma 2 (Google) - хороша для диалога и коротких задач. Версия 2B работает даже на 4-6 GB RAM.
Qwen 2.5 (Alibaba) - хорошо понимает русский язык. Версия 7B качественнее аналогов при одинаковом размере. Хороший выбор для русскоязычных задач.
Phi-3/Phi-4 (Microsoft) - очень компактная. 3.8B параметров, но по качеству обгоняет многие 7B модели. Хороший выбор если мало памяти.
CodeLlama - специализирована на программировании. Если нужна помощь с кодом - лучше обычного Llama.
DeepSeek-Coder - ещё одна модель для кода, часто превосходит CodeLlama.
Создание Modelfile: кастомизация модели
Ollama позволяет создать собственный профиль модели через Modelfile. Это текстовый файл с инструкциями: на основе какой модели, какой системный промпт, какие параметры генерации.
Пример Modelfile для модели-помощника по русскому языку:
FROM llama3.1:8b
SYSTEM "Ты помощник. Отвечай кратко, по-русски. Без лишних вступлений."
PARAMETER temperature 0.3
PARAMETER num_predict 512
Сохраните файл как Modelfile, запустите:
ollama create my-assistant -f Modelfile
ollama run my-assistant
Теперь my-assistant запускается с вашими настройками по умолчанию. Такие профили удобно создавать для разных задач: один профиль для редактуры текстов (низкая температура), другой для мозгового штурма (высокая).
Параметры генерации
При запуске модели можно менять параметры через Modelfile или через API.
Temperature (0-2): насколько «творчески» модель генерирует. 0 - детерминированно, один и тот же ответ на один запрос. 0.7 - умеренное разнообразие. 1.5+ - больше случайности. Для точных задач (код, факты) - ниже. Для творческих текстов - выше.
Num predict: максимальная длина ответа в токенах. По умолчанию -1 (без ограничений).
System prompt: инструкция для модели, задающая её роль. «Ты опытный юрист...» или «Ты помощник по программированию...».
Итог: когда что использовать
Локальные модели через Ollama подходят для:
- Повседневных задач: ответить на вопрос, написать текст, помочь с кодом
- Конфиденциальных данных: документы которые нельзя отправлять в облако
- Эксперименты и обучение без ограничений по запросам
- Интеграции в собственные приложения
Облачные модели (ChatGPT, Claude) лучше когда:
- Нужна максимальная точность на сложных задачах
- Нужен поиск в интернете
- Нет мощного железа
Гибридный подход тоже работает: используйте локальную модель для повседневных задач и конфиденциальных данных, а облачную - для сложных аналитических запросов. Это снижает расходы на API без потери качества там где оно нужно.
Пример распределения нагрузки: написать черновик письма, ответить на простой вопрос, отформатировать текст - локальная модель. Сложный анализ юридического документа, написание кода с нуля на незнакомом языке, многошаговые вычисления - облако.
Минимальный стек для старта: Ollama + модель на 7B + Open WebUI. Это бесплатно, устанавливается за 20 минут, работает без интернета.
Разборы свежих AI-новостей - в канале AI Компас.
Больше гайдов - guides.kosmoslab.dev/guides.
Читайте дальше
RAG дома: подключаем свою базу знаний к локальной модели
Пошаговая инструкция: устанавливаем Ollama, поднимаем AnythingLLM, загружаем свои документы и получаем AI-ассистента который знает вашу базу знаний.
Что такое AI-агенты простым языком: чем агент отличается от чат-бота
Объясняем что такое AI-агенты, как они работают и чем принципиально отличаются от ChatGPT. Реальные примеры без технического жаргона.
Fine-tune vs RAG vs промпт-инжиниринг: когда что выбирать и сколько это стоит
Три способа адаптировать AI под свои задачи - сравниваем по стоимости, сложности и подходящим сценариям. Когда достаточно промпта, когда нужен RAG, а когда без дообучения не обойтись.