Локальная LLM на одной видеокарте: что работает, что нет
2 июня 2026 г. · 13 мин чтения · Максим Космов

Содержание
- TL;DR
- Зачем вообще лезть в локальную LLM
- Какая видеокарта реально нужна
- Какие модели реально работают на 8 ГБ
- Ollama: как поднять локальный API за час
- Python-обвязка на 200 строк
- Экономика: где локально дешевле
- Когда локальная LLM не нужна
- FAQ
- Локальная LLM на GTX 1080: что выясняется за полгода
- Какая карта реально нужна
- Какие модели работают на 8 ГБ
- Ollama за час
- Python-обвязка
- Экономика
- Когда не нужно
- Что выбрать новичку
TL;DR
Полгода тестирования локальных моделей на домашней машине с GTX 1080 на борту показывают вполне рабочий расклад. Восемь гигабайт VRAM, не самая свежая карта, типичный игровой вариант. Главный вопрос: можно ли на ней реально работать с LLM или это игрушка для блогпостов.
Краткий вывод: можно, но выбор моделей маленький. Из всего зоопарка с Hugging Face нормально заводится ровно одна рабочая модель, Mistral 7B без квантования, скорость около 30 токенов в секунду. LLaMA 13B не влезает в память даже с агрессивным квантом. Mixtral требует карту получше. GPT-2 работает, но это уровень 2019 года, на серьёзных задачах бесполезен.
По деньгам выходит дешевле облака уже на втором месяце активного использования. Типовая нагрузка около 10 000 запросов в месяц через скрипт-обвязку. Через OpenAI API на gpt-4o-mini это $200 в месяц. Локально это $0 плюс электричество. Если карта уже куплена под игры, амортизация нулевая.
Дальше по тексту: какая карта реально нужна для старта, какие модели работают на 8 ГБ VRAM, как поднять Ollama за час, как написать REST-обвязку на Python на 200 строк, и в каких случаях локальная LLM не нужна совсем.
Зачем вообще лезть в локальную LLM
Первый мотив банально шкурный, экономия. Когда счёт за OpenAI API переваливает за $150 в месяц на задачах вроде «классифицировать письма» и «суммаризовать длинные документы», становится обидно. Половина задач не требует качества GPT-4. Их сделает любой средний open-source. Платишь по сути за бренд.
Второй мотив, приватность. Скрипт, который читает рабочие письма и сортирует по проектам, неприятно заливать в облако. Локальная модель решает вопрос: данные не выходят за пределы машины.
Третий мотив, доступность. Облако падает, лимиты режут, цены меняются. Локальная модель будет работать ровно так же завтра и через год. Никто не отключит её на сервере OpenAI без предупреждения.
Какая видеокарта реально нужна
Минимум, на котором что-то работает, 6 ГБ VRAM. На таком железе живут только мелкие модели до 3B параметров. Качество там слабое, годится для классификаторов и тегеров.
Sweet spot для домашнего использования, 8-12 ГБ VRAM. GTX 1080 на 8 ГБ, нижняя граница этого диапазона. Сюда влезают 7B модели в полной точности fp16 или 13B с квантованием Q4. Это уже рабочий уровень: модели справляются с переводами, суммаризацией, кодом, классификацией.
Топовый домашний вариант, 24 ГБ VRAM (RTX 3090, 4090). Туда лезет 30B модель без квантования или 70B с Q4. Качество близко к GPT-3.5, на специфичных задачах сравнимо с GPT-4. Но карта стоит как поддержанный автомобиль.
Для старта нет смысла покупать карту специально. Если у тебя уже есть GTX 1070/1080/1660 или любая RTX, попробуй на ней. Если зайдёт, и упрёшься в потолок, тогда смотри в сторону апгрейда. На практике 1080 закрывает около 90% задач, апгрейд не окупается.
Про CPU-only режим скажем честно: работает, но скорость 1-3 токена в секунду на 7B модели. Это медленнее, чем читать. Для интерактива не годится, для фоновых батч-задач можно потерпеть.
Какие модели реально работают на 8 ГБ
За полгода тестирования прошло больше двадцати моделей. Ниже список тех, что выжили в шорте.
Mistral 7B Instruct, основной выбор. В fp16 занимает 14 ГБ, не влезает. В Q5_K_M (это компромиссный квант), 5.5 ГБ, остаётся запас на контекст. Скорость 28-32 токена в секунду на GTX 1080. Качество выше LLaMA 2 7B на большинстве бенчмарков, а с русским языком справляется на удивление прилично.
Qwen 2.5 7B, вторая по используемости. Заметно лучше Mistral на коде и математике. На русском чуть хуже, на английском и китайском заметно лучше. Скорость та же, 28-30 токенов в секунду в Q5.
Phi-3 Mini (3.8B), микро-модель от Microsoft. Удивительно умная для своего размера. В fp16 влезает целиком, скорость 60+ токенов в секунду. Подходит для быстрых задач, где не нужен максимум качества.
LLaMA 3 8B, работает, но без преимуществ. Качество близко к Mistral, скорость чуть ниже, лицензия странная (требует регистрации и согласия с EULA). Не вижу смысла держать её, если есть Mistral.
Из того, что НЕ заработало или плохо заработало:
- LLaMA 13B (любая версия): в Q4 еле влезает, контекст 2к токенов максимум, скорость падает до 10 т/с. Качество не сильно лучше Mistral 7B, чтобы оправдать тормоза.
- Mixtral 8x7B: требует минимум 24 ГБ VRAM. На 8 ГБ даже не пытайся.
- GPT-2: работает мгновенно, но качество уровня 2019 года. Бесполезна.
- StarCoder 15B: для кода неплох, но в 8 ГБ не лезет.
Вывод: для 8 ГБ VRAM рабочий набор, Mistral 7B, Qwen 2.5 7B, Phi-3 Mini. Этого хватает на 95% задач.
Ollama: как поднять локальный API за час
Ollama, это обёртка над llama.cpp, которая даёт удобный CLI и REST API. Из трёх фреймворков (text-generation-webui, vLLM, Ollama) практичнее всего последний. Причина простая: ставится одной командой, работает без головной боли.
Установка на Linux:
curl -fsSL https://ollama.com/install.sh | sh
На Windows есть инсталлятор exe, на Mac, dmg. Всё одинаково просто.
Скачать Mistral:
ollama pull mistral
Размер модели около 4.4 ГБ. Качается из репозитория Ollama, не нужно регистрироваться на Hugging Face. Через 5-10 минут модель готова.
Запуск интерактивного чата:
ollama run mistral
Это уже работает. Можно задавать вопросы, получать ответы. Но интерактив для серьёзной работы не нужен, нужен API.
Ollama по умолчанию поднимает HTTP-сервер на localhost:11434. Запрос выглядит так:
curl http://localhost:11434/api/generate -d '{
"model": "mistral",
"prompt": "Объясни, что такое REST API в двух предложениях.",
"stream": false
}'
Ответ приходит JSON-ом, в поле response лежит сгенерированный текст. Это всё. Никаких ключей, токенов, аутентификации, лимитов. Чистый локальный сервис.
Первый раз настройка занимает 3-4 часа, потому что обязательно что-то пойдёт не так: драйверы CUDA не той версии, нет места на диске, что-то с системными зависимостями. Второй раз поднимается за 15 минут.
Python-обвязка на 200 строк
Голый Ollama API хорош для прототипа, но в реальном проекте нужна обёртка: ретраи, логирование, парсинг структурированных ответов, кэширование. Пишется небольшой клиент. Архитектура простая.
Структура файлов:
local_llm/
client.py # ~80 строк, обёртка над requests
prompts.py # ~40 строк, шаблоны промптов
cache.py # ~30 строк, SQLite-кэш
tasks/
classify.py # классификация писем
summarize.py # суммаризация документов
Сердце клиента выглядит примерно так:
import requests
class LocalLLM:
def __init__(self, model="mistral", host="http://localhost:11434"):
self.model = model
self.host = host
def generate(self, prompt, max_tokens=500, temperature=0.3):
resp = requests.post(
f"{self.host}/api/generate",
json={
"model": self.model,
"prompt": prompt,
"stream": False,
"options": {
"num_predict": max_tokens,
"temperature": temperature,
},
},
timeout=120,
)
resp.raise_for_status()
return resp.json()["response"]
Дальше добавляется SQLite-кэш на основе хеша промпта (одинаковые запросы не считаются повторно), exponential backoff на ошибки сети, и простой rate limiter (на случай, если несколько процессов одновременно лезут в Ollama).
Итого получается около 200 строк кода. Этого хватает, чтобы заменить OpenAI-клиент в любом скрипте: меняешь openai.ChatCompletion.create на local_llm.generate, и всё работает.
Экономика: где локально дешевле
Прикинем на реальных цифрах. Скрипт классификации писем гоняет около 10 000 промптов в месяц. Средний промпт 500 токенов на вход, 100 на выход.
Через gpt-4o-mini: input $0.15/M токенов, output $0.60/M токенов. Итого: 10000 × 500 × $0.15/M + 10000 × 100 × $0.60/M = $0.75 + $0.60 = $1.35. Это мелочи.
Но рядом ещё стоит скрипт-суммаризатор. Он жуёт длинные документы, 5000 токенов вход, 1000 выход, 2000 раз в месяц. Через gpt-4o-mini: 2000 × 5000 × $0.15/M + 2000 × 1000 × $0.60/M = $1.5 + $1.2 = $2.7.
Плюс пилот-проект на gpt-4o (а не mini): 1000 длинных запросов в месяц, по 5000 токенов вход и 2000 выход. Через gpt-4o ($2.50/M input, $10/M output): $12.5 + $20 = $32.5.
Плюс эмбеддинги, плюс пилоты, плюс эксперименты. В итоге летний счёт за месяц вышел $189. И это при том, что mini берётся везде, где возможно.
Локально тот же объём это $0 на API. Плюс электричество. Карта под нагрузкой кушает 180 Вт. Если она работает 4 часа в день, это 0.72 кВт/ч × 30 = 21.6 кВт/ч в месяц. Тариф 5 рублей за киловатт, итого 108 рублей в месяц, около $1.2. Округлим до $2 с учётом тепла и роста цен.
Чистая экономия: $187 в месяц. За год это $2244. На эти деньги можно купить RTX 4060 Ti 16GB и сделать локальный сетап ещё мощнее.
Когда локальная LLM не нужна
Не стоит уговаривать всех на локальный сетап. Есть честные кейсы, где он не нужен.
Малые объёмы. Если у тебя 100-500 запросов в месяц, API стоит копейки, локально настраивать дольше окупится никогда. Проще платить OpenAI и не страдать.
Топ-качество. Если задача требует именно GPT-4 уровня (сложный анализ, креатив, тонкое понимание контекста), локальные 7B модели не вытянут. Тут или платить за облако, или ставить карту на 24 ГБ и крутить 70B.
Без видеокарты. На CPU модели работают слишком медленно для интерактива. Если у тебя только ноут с интегрированной графикой, не мучайся, иди в API.
Скорость старта. Локальная LLM требует времени на настройку: установка драйверов, выбор модели, написание обвязки. Это 1-2 дня работы. Если задача срочная, быстрее через API.
Сильно меняющиеся задачи. Если каждую неделю переключаешься между «классифицируй на 50 категорий», «напиши SQL», «реши задачу по физике», локальные специализированные модели не вытянут, нужна универсальность облака.
FAQ
Можно ли крутить локально что-то уровня GPT-4? На домашней карте до 24 ГБ, нет. На 24 ГБ можно поднять LLaMA 70B в Q4, и на отдельных задачах оно близко к GPT-4. Но универсальность хуже: на одних задачах круто, на других провал.
Какой Linux лучше для локальной LLM? Любой современный с NVIDIA-драйверами. На Ubuntu 22.04 всё работает. На Arch и Fedora тоже жалоб не было. Главное, актуальная версия CUDA (12.x на момент написания).
Что с русским языком? Mistral и Qwen говорят по-русски прилично, но не идеально. Иногда срываются на английский, иногда строят неуклюжие фразы. Для классификации и базовой суммаризации хватает. Для художественного текста на русском лучше использовать специально дообученные модели вроде Saiga или брать облако.
Сколько контекста влезает в 8 ГБ? Зависит от модели. Mistral 7B в Q5 с 8 ГБ VRAM держит около 8к токенов контекста. Если нужно больше, либо квант поагрессивнее (теряем качество), либо карта побольше.
Что выбрать первым делом для старта? Поставь Ollama, скачай Mistral, попробуй пару дней. Если зайдёт, дальше копай в сторону квантов и обвязки. Если разочаруешься в качестве, возвращайся в API без жалости. На эксперименте теряешь день, не больше.
📌 Dzen (~900 слов)
Локальная LLM на GTX 1080: что выясняется за полгода
Полгода тестирования локальных моделей на домашней машине с GTX 1080 даёт чёткую картину. Восемь гигабайт VRAM, карта куплена ещё под игры. Главный вопрос: можно ли на ней реально работать с LLM или это игрушка для блогпостов.
Краткий вывод: можно, но выбор моделей маленький. Из всего зоопарка с Hugging Face нормально заводится ровно одна рабочая модель, Mistral 7B без квантования, скорость около 30 токенов в секунду. LLaMA 13B не влезает в память. Mixtral требует карту получше. GPT-2 работает, но качество уровня 2019 года.
По деньгам выходит дешевле облака уже на втором месяце активного использования. Типовая нагрузка около 10 000 запросов в месяц. Через OpenAI API это $200. Локально это $0 плюс электричество.
Какая карта реально нужна
Минимум для запуска, 6 ГБ VRAM. На таком железе живут только мелкие модели до 3B параметров. Sweet spot для дома, 8-12 ГБ VRAM. GTX 1080 на 8 ГБ, нижняя граница. Сюда влезают 7B модели в fp16 или 13B с квантованием Q4. Топовый домашний вариант, 24 ГБ VRAM (RTX 3090, 4090). Туда лезет 30B без квантования или 70B с Q4, качество близко к GPT-3.5.
Для старта не нужно покупать карту специально. Если есть GTX 1070/1080/1660 или любая RTX, попробуй на ней. Если зайдёт и упрёшься в потолок, тогда смотри апгрейд. На практике 1080 закрывает 90% задач.
Про CPU-only скажем честно: работает, но скорость 1-3 токена в секунду. Это медленнее, чем читать. Для интерактива не годится.
Какие модели работают на 8 ГБ
За полгода тестирования прошло больше двадцати моделей. Ниже выжившие.
Mistral 7B Instruct, основной выбор. В Q5_K_M занимает 5.5 ГБ, скорость 28-32 токена в секунду. Качество выше LLaMA 2 7B, с русским справляется прилично.
Qwen 2.5 7B, заметно лучше Mistral на коде и математике. На русском чуть хуже, скорость та же.
Phi-3 Mini (3.8B) от Microsoft, удивительно умная для размера. Влезает в fp16, скорость 60+ т/с. Подходит для быстрых задач.
Что не заработало: LLaMA 13B в Q4 еле влезает, контекст максимум 2к, скорость падает до 10 т/с. Mixtral 8x7B требует 24 ГБ. GPT-2 работает мгновенно, но бесполезна. StarCoder 15B не лезет.
Вывод: для 8 ГБ рабочий набор, Mistral 7B, Qwen 2.5 7B, Phi-3 Mini.
Ollama за час
Ollama, обёртка над llama.cpp с удобным CLI и REST API. Из text-generation-webui, vLLM и Ollama практичнее всего последний. Ставится одной командой, работает без головной боли.
Установка:
curl -fsSL https://ollama.com/install.sh | sh
Скачать Mistral:
ollama pull mistral
4.4 ГБ, скачивается за 5-10 минут. Запуск чата:
ollama run mistral
Ollama по умолчанию поднимает HTTP-сервер на localhost:11434. Запрос:
curl http://localhost:11434/api/generate -d '{
"model": "mistral",
"prompt": "Что такое REST?",
"stream": false
}'
Никаких ключей, токенов, лимитов. Чистый локальный сервис. Первый раз настройка займёт 3-4 часа (драйверы CUDA, версии, зависимости). Второй раз поднимается за 15 минут.
Python-обвязка
Голый Ollama API хорош для прототипа, но в реальном проекте нужна обёртка: ретраи, логирование, кэширование. Пишется клиент на 200 строк.
Структура:
local_llm/
client.py # обёртка над requests
prompts.py # шаблоны
cache.py # SQLite-кэш
tasks/ # конкретные задачи
Сердце клиента:
class LocalLLM:
def generate(self, prompt, max_tokens=500):
resp = requests.post(
"http://localhost:11434/api/generate",
json={"model": "mistral", "prompt": prompt, "stream": False},
timeout=120,
)
return resp.json()["response"]
Добавляешь SQLite-кэш на хеше промпта, exponential backoff, простой rate limiter. Этого хватает, чтобы заменить OpenAI-клиент в любом скрипте. Меняешь openai.ChatCompletion.create на local_llm.generate, и всё работает.
Экономика
Скрипт классификации писем гоняет 10 000 промптов в месяц. Плюс суммаризатор на 2000 длинных запросов. Плюс пилоты на gpt-4o. В сумме счёт за лето был $189.
Локально тот же объём это $0 на API плюс электричество. Карта под нагрузкой кушает 180 Вт. Если работает 4 часа в день, это 21.6 кВт/ч в месяц, около $2 по бытовому тарифу. Чистая экономия: $187 в месяц, $2244 в год.
Когда не нужно
Малые объёмы. 100-500 запросов в месяц через API стоят копейки, локально настраивать дольше окупится.
Топ-качество. Если нужен именно GPT-4 уровень, локальные 7B модели не вытянут. Тут либо облако, либо 24 ГБ карта с 70B моделью.
Без видеокарты. На CPU слишком медленно для интерактива.
Срочные задачи. Локальная LLM требует 1-2 дня настройки. Если задача горит, быстрее через API.
Сильно разные задачи. Если переключаешься между классификацией, SQL, физикой и креативом каждую неделю, нужна универсальность облака.
Что выбрать новичку
Поставь Ollama, скачай Mistral, попробуй пару дней. Если зайдёт, копай в сторону квантов и обвязки. Если разочаруешься, возвращайся в API без жалости.
И ещё важная мысль. Локальная LLM не делает тебя независимым от прогресса. Каждые два-три месяца выходят новые модели, и приходится обновлять свой зоопарк. Поэтому полностью отказываться от облака не стоит: держи OpenAI-ключ для пилотов и для задач, где локальные модели не тянут. Локальный сетап покрывает 80-90% рутины, облако, оставшиеся проценты сложных кейсов.
Если у тебя уже стоит средняя или мощная видеокарта и счёт за API больше $50 в месяц, смело пробуй. Скорее всего, окупится за два-три месяца, а дальше работает в плюс. Карту не жалко: даже если разочаруешься в LLM, она остаётся под игры и видеомонтаж.
📲 TG (600-900 символов)
Полгода тестов локальных LLM на старой GTX 1080 (8 ГБ VRAM) дали чёткий расклад. Рабочая связка: Mistral 7B в кванте Q5_K_M, занимает 5.5 ГБ памяти, выдаёт стабильно 28-32 токена в секунду. Qwen 2.5 7B заметно лучше на коде. Phi-3 Mini 3.8B бьёт 60+ токенов в секунду на простых задачах. LLaMA 13B в 8 ГБ еле дышит, Mixtral вообще не лезет, ему нужно 24 ГБ.
Стек простой: Ollama ставится одной командой curl, поднимает REST API на localhost:11434, без ключей и лимитов. Сверху Python-обвязка на 200 строк с SQLite-кэшем и ретраями, и можно менять openai.ChatCompletion на локальный вызов один в один.
Экономика: 10 000 промптов в месяц через gpt-4o-mini плюс суммаризатор плюс пилоты на gpt-4o выходят $189. Локально тот же объём $0 плюс $2 электричества. Чистая экономия $2244 в год, хватает на RTX 4060 Ti 16GB.
Читайте дальше
RAG или fine-tuning: когда какой выбрать на реальных задачах
Есть 500 документов компании и одна задача: научить LLM отвечать на вопросы по ним. Стандартная корпоративная история, инструкции, регламенты, FAQ по продукту, технические доки на
Как собрать SMM-машину на n8n и LLM: реальный кейс 60 постов в месяц за $5
Полгода назад картина выглядела так: пять Telegram-каналов и хроническое чувство вины. Каждый день нужно выкатывать по два поста в каждом, итого десять постов в сутки. Кто-то пишет
Длинный контекст в 1 млн токенов: как загрузить весь проект
Два месяца практики с Claude Opus 4.7 в режиме 1 миллиона токенов контекста показывают любопытную картину. Загружаешь целые репозитории, читаешь длинные документы, прогоняешь аудит