Как выбрать LLM: open-source vs closed-source

7 июня 2026 г. · 13 мин чтения · Максим Космов

Как выбрать LLM: open-source vs closed-source
Содержание

TL;DR

Рабочая практика на 2026 год, держать пять моделей одновременно: Claude Opus 4.7, GPT-5, DeepSeek V2.5, LLaMA 3 70B и Mistral 7B локально. Это не понты, а способ платить меньше при качестве выше.

Раньше типичный пользователь сидел на одной GPT-4 и платил $50 в месяц. Сейчас при пяти моделях под разные задачи счёт падает до $15 в месяц. Скорость работы при этом растёт, потому что каждая модель делает то, что у неё получается лучше.

Закрытые модели от OpenAI и Anthropic берут $0.01-0.03 за запрос, но дают качество, на котором можно делать продакшн-код, длинный анализ и сложный креатив. Открытые модели вроде DeepSeek V2.5 и LLaMA 3 берут копейки или работают бесплатно локально, и закрывают 70% бытовых задач без потери смысла.

Главный принцип: сначала смотри на задачу, потом выбирай модель. Не наоборот. Большинство людей берут одну модель и пытаются ей решать всё, переплачивая в три раза и теряя в скорости.

В тексте: где открытые модели реально работают, где закрытые незаменимы, как поделить задачи между пятью моделями, сколько на этом экономится, и почему мульти-моделный подход уже стал стандартом у людей, которые работают с LLM каждый день.

Закрытые модели: за что платят

GPT-5 и Claude Opus 4.7 крутятся через API. Это закрытые модели, их веса не публикуют, файнтюнить их нельзя, гонять локально невозможно. Зато они дают то, ради чего стоит платить.

Качество. Когда надо разобрать чужой код на 800 строк и найти в нём логическую дыру, открытая модель не вытянет. Claude Opus 4.7 видит контекст до миллиона токенов и держит логику на длинном диалоге. Никакая открытая модель размером с одну видеокарту так не умеет. Это физика, а не вкусовщина.

Скорость. Закрытые модели крутятся в дата-центрах на тысячах GPU. Локальная LLaMA 3 70B на средней машине выдаёт 8 токенов в секунду, GPT-5 через API выдаёт 80. Когда код пишется в режиме «вопрос-ответ», это разница между «работаю» и «жду».

Регулярные апдейты. Anthropic в среднем выкатывает новую версию Claude раз в три-четыре месяца. Ничего переустанавливать не нужно, просто меняется строка в конфиге. Open-source модели тоже обновляются, но раскатывать их у себя на сервере, тестировать новые квантования, искать совместимые сэмплеры, это часы работы.

Поддержка. Если API упал, идёшь к Anthropic, тебе говорят что чинят, и срок известен. С open-source ты сам себе админ.

За это платишь. Запрос в Claude через API стоит $0.01-0.03 в зависимости от длины. Месячный счёт за серьёзные задачи около $8. До перехода на мульти-моделный подход всё гонялось через одну закрытую модель за $50.

Открытые модели: где они выигрывают

Open-source модели, это LLaMA 3 от Meta, Mistral от французского стартапа, DeepSeek V2.5 от китайцев, Qwen от Alibaba. Их веса лежат на Hugging Face. Скачал, запустил, работает.

Цена. DeepSeek V2.5 через их собственный API стоит $0.0002 за тысячу токенов. Это в 50 раз дешевле GPT-5. Mistral 7B локально стоит $0, кроме амортизации железа. Когда поток из 5000 простых запросов в день, разница между $50 и $0.50, это уже не экономия, это другая бизнес-модель.

Контроль. Возьми скрипт, который читает рабочие письма и сортирует по проектам. Эти письма не должны уходить в облако. Запускаешь Mistral 7B локально через Ollama, письма никогда не покидают машину. С закрытой моделью так не получится.

Файнтюнинг. На LLaMA 3 можно дотренировать модель на своих данных. Типовой кейс, классифицировать тикеты поддержки по 14 категориям. Делаешь датасет на 2000 примеров, дообучаешь LLaMA 3 8B за два часа на одной видеокарте. Точность 94%. С закрытой моделью пришлось бы либо платить за дорогой fine-tuning от OpenAI, либо вечно подкладывать примеры в промпт.

Нет vendor lock-in. Если завтра Anthropic поднимет цены вдвое или закроет API, ты зависим. Если завтра Meta перестанет выкладывать LLaMA, у тебя уже лежит на диске последняя версия, она будет работать всегда.

Минусы у open-source реальные. Качество на сложных задачах ниже. Когда LLaMA 3 70B получает тот же код на 800 строк, что давался Claude, она половину деталей упускает. Скорость локально низкая. Файнтюнинг требует знаний и железа. Если что-то не работает, разбираешься сам.

Когда что брать: рабочая сетка

Модель выбирают не по идеологии, а по задаче.

Сложный код, длинный анализ, креатив на серьёзный продакшн. Claude Opus 4.7. Цена $0.01-0.03 за задачу, качество окупает любую разницу с открытыми. Когда надо написать архитектуру, разобрать legacy, написать длинный лонгрид, это сюда.

Маркетинговые тексты средней сложности, постинг в соцсети, email-рассылки. GPT-5. Дешевле Claude, на креативе чуть слабее, но для шаблонных задач разница незаметна.

Простые вопросы, фильтрация, классификация, перевод коротких текстов. DeepSeek V2.5. Берёт копейки, качество для таких задач избыточное. Когда надо прогнать тысячу заголовков через классификатор «спам / не спам / нейтрально», это сюда.

Локально без интернета, на конфиденциальных данных. Mistral 7B через Ollama. Скорость 30 токенов в секунду на средней GTX 1080. Бесплатно. Письма, медицинские данные, личные заметки, всё, что не должно покидать машину.

Эксперименты и файнтюнинг. LLaMA 3 70B. Когда надо дотренировать модель на специфичных данных, или поиграться с весами, или попробовать новый подход.

Цена: как платить $15 вместо $50

До перехода на мульти-моделный подход был один счёт от OpenAI на $50 в месяц. Всё в одной модели, удобно, дорого.

Рабочая раскладка такая:

  • Claude API, $8 в месяц. Серьёзные задачи, 200-300 запросов.
  • DeepSeek API, $3 в месяц. Фильтрация, классификация, простые ответы. Около 50 000 запросов.
  • GPT-5 API, $4 в месяц. Маркетинговые тексты, средняя нагрузка.
  • Mistral локально, $0. Электричество не считаем, карта стоит и так.
  • LLaMA 3 локально, $0. Файнтюнинг и эксперименты.

Итого $15 в месяц. Объём работы вырос примерно вдвое от того, что тянулось на одной GPT-4. Скорость интерактивных запросов выросла, потому что простые задачи идут в DeepSeek и отрабатывают за секунду вместо трёх.

Главная экономия не в копеечной цене, а в том, что ты не платишь премиум за вещи, которые не требуют премиума. Когда нужно отфильтровать «это вопрос или утверждение», это работа на $0.0001, а не на $0.01.

Приватность: что куда уходит

Это вторая причина уходить с одной модели. С GPT-5 каждый запрос уходит в OpenAI. Большая часть запросов нечувствительна, но процентов 10, это рабочая переписка, финансовые цифры, чужой код по NDA. Заливать это всё в облако не стоит.

Рабочее правило: всё, что под NDA или внутреннее, идёт в локальную Mistral. Закрытые API получают только публичные данные или абстрактные задачи без специфики.

Это не паранойя. Это понимание, что любой облачный сервис при достаточном давлении регулятора, суда или хакера отдаст данные. Локально на машине таких рисков нет.

Мульти-модельный подход: почему это уже стандарт

Раньше идея «использовать пять моделей» казалась оверкиллом. Сейчас это уже мейнстрим у людей, которые работают с LLM каждый день.

Причина простая: рынок дифференцировался. Каждая модель оптимизирована под свою нишу. Claude сильна в длинном контексте и кодинге. GPT в общении и шаблонных текстах. DeepSeek, в дешёвой классификации и фильтрации. Mistral, в локальной приватной работе. LLaMA, в файнтюнинге.

Платить премиум-цену за универсального солдата, когда есть пять специалистов дешевле и быстрее, это нерационально. Это как купить один швейцарский нож за $200, когда отвёртка, нож и пинцет по отдельности стоят $30 и работают лучше.

Что нужно для перехода: один аккаунт у каждого провайдера, локальный Ollama для Mistral, простой роутер на 50 строк кода, который смотрит на тип задачи и кидает запрос в нужную модель. Роутер пишется за вечер.

Топ-5 моделей по задачам в 2026

  1. Claude Opus 4.7, флагман для серьёзного кода и длинных задач. Контекст до миллиона токенов. $0.01-0.03 за запрос. Незаменим.
  2. GPT-5, рабочая лошадка для маркетинга и общих задач. Дешевле Claude, шире распространён, проще интегрировать.
  3. DeepSeek V2.5, лучшая дешёвая модель на 2026. Качество близко к GPT-4o-mini, цена в 50 раз ниже. Для фильтрации и классификации, идеально.
  4. Mistral 7B, локальный фаворит. 30 токенов в секунду на средней карте, бесплатно, приватно. Закрывает 60% бытовых задач.
  5. LLaMA 3 70B, для файнтюнинга и экспериментов. Локально на 24 ГБ карте идёт нормально. Если нужна своя дотренированная модель, без вариантов.

FAQ

Стоит ли вообще держать пять моделей или хватит двух? Минимум, две: одна закрытая премиум (Claude или GPT) и одна дешёвая (DeepSeek или локальный Mistral). На двух уже экономия видна. Пять, это когда задачи разные и хочется выжать максимум по каждой.

Какая модель лучше для русского языка? По практическим замерам Claude Opus 4.7 и GPT-5 одинаково сильны на русском. Из открытых, DeepSeek V2.5 заметно лучше LLaMA 3 на русских текстах. Mistral 7B локально на русском средне, но для простых задач хватает.

Open-source модели когда-нибудь догонят закрытые? На простых и средних задачах уже догнали. LLaMA 3 70B на бенчмарках уровня GPT-4o. На сложных задачах с длинным контекстом и тонким рассуждением закрытые впереди и пока этот разрыв держится.

Файнтюнинг сложно настроить? Базовый файнтюнинг через LoRA на готовом датасете, пара часов работы. Если есть видеокарта на 24 ГБ и базовое знание Python, делается по гайдам с Hugging Face. Сложности начинаются, когда нужна высокая точность или специфичная задача.

Что выбрать если бюджет $0? Mistral 7B через Ollama локально плюс DeepSeek через бесплатные кредиты на старте. На этих двух можно закрыть 80% типовых задач без оплаты.

📌 Dzen (~900 слов)

Как перестать платить $50 за одну LLM и начать платить $15 за пять

Полгода назад типичный сценарий выглядел так: $50 в месяц OpenAI за один доступ к GPT-4. Через одну модель гоняют всё подряд: код, маркетинг, классификацию писем, переводы, ответы на простые вопросы. Удобно. Дорого.

Сейчас пять моделей под разные задачи. Счёт упал до $15 в месяц. Скорость работы выросла. Качество на серьёзных задачах не просто не упало, а выросло, потому что для сложного кода вместо GPT теперь Claude, который для этого приспособлен лучше.

Разберём как к этому приходят и что у такого пользователя сейчас в работе.

Почему одна модель, это всегда переплата

Рынок LLM в 2026 году выглядит так. Есть закрытые модели уровня GPT-5 и Claude Opus 4.7. Они дорогие, $0.01-0.03 за запрос, но качество высочайшее. Есть открытые модели вроде LLaMA 3, Mistral, DeepSeek V2.5. Они либо бесплатные (локально), либо в 50 раз дешевле закрытых через API.

Если сидишь на одной модели, либо переплачиваешь за простые задачи (когда у тебя премиум-модель), либо мучаешься с качеством на сложных (когда у тебя дешёвая). Третий путь, взять разные модели под разные задачи.

Сначала это казалось перегрузом. Сейчас видно, что это просто здравый смысл. Покупаешь дорогой инструмент только когда он реально нужен, а на бытовые мелочи берёшь дешёвый.

Что в работе сейчас

Пять моделей, под пять разных типов задач.

Claude Opus 4.7, для серьёзного кода и длинного анализа. Контекст до миллиона токенов, держит логику на длинном диалоге. Когда надо разобрать чужой код на 800 строк или написать длинный аналитический текст, идёт сюда. Цена $0.01-0.03 за запрос, в месяц набегает около $8.

GPT-5, для маркетинга и общих текстов. Email-рассылки, посты в соцсети, описания продуктов. Чуть дешевле Claude, на креативе слабее, но для шаблонных задач разница незаметна. Около $4 в месяц.

DeepSeek V2.5, для фильтрации и классификации. Когда надо прогнать тысячу заголовков через классификатор «спам / не спам» или ответить на простые вопросы, идёт сюда. Стоит копейки. Около 50 000 запросов в месяц на $3.

Mistral 7B, локально на средней машине через Ollama. 30 токенов в секунду на средней видеокарте. Бесплатно. Используется для всего, что связано с приватными данными: рабочие письма, личные заметки, чужой код по NDA.

LLaMA 3 70B, для экспериментов и файнтюнинга. Когда нужно дотренировать модель на специфичных данных. Локально на 24 ГБ карте.

Итого $15 в месяц на API плюс ноль за локальные модели.

Где открытые модели реально хороши

Цена. DeepSeek V2.5 в 50 раз дешевле GPT-5. Когда у тебя поток из тысяч простых запросов в день, разница между $50 и $0.50, это другая бизнес-модель.

Контроль. Скрипт, который читает рабочие письма и сортирует по проектам. Письма не должны уходить в облако. Mistral локально решает эту задачу без компромиссов.

Файнтюнинг. На LLaMA 3 дотренировывают модель на своих данных для классификации тикетов поддержки. 2000 примеров, два часа обучения на одной видеокарте, точность 94%. С закрытой моделью пришлось бы либо платить за дорогой fine-tuning, либо вечно подкладывать примеры в промпт.

Нет vendor lock-in. Если завтра Anthropic поднимет цены или закроет API, ты сидишь с проблемой. Если завтра Meta перестанет выкладывать LLaMA, последняя версия уже лежит на диске и будет работать всегда.

Где открытые проигрывают

Сложные задачи с длинным контекстом. Когда LLaMA 3 70B получает тот же код, что Claude разбирает спокойно, она половину деталей упускает. Это видно сразу, лечится только переходом на закрытую модель.

Скорость. Локальная LLaMA на средней машине даёт 8 токенов в секунду, Claude через API, 80. Когда работаешь интерактивно, это разница между «работаю» и «жду».

Регулярные апдейты. Закрытые модели обновляются автоматически. Менять локальную модель на новую версию, это часы тестирования, проверки совместимости, перенастройки.

Поддержка. С API звонишь в Anthropic если что-то сломалось. С локальной моделью разбираешься сам.

Главный принцип

Сначала задача, потом модель. Не наоборот. Большинство людей выбирают одну модель и пытаются ей решать всё, переплачивая в три раза и теряя в скорости.

Работает это так. Прилетела задача, смотришь что она требует. Сложный код? Claude. Маркетинг? GPT. Простая классификация? DeepSeek. Конфиденциальные данные? Mistral локально. Файнтюнинг? LLaMA.

Простой роутер на 50 строк кода смотрит на тип задачи и кидает запрос в нужную модель. Пишется за вечер. Окупается за неделю.

Что советуют на старте

Если только начинаешь работать с LLM серьёзно, возьми две модели. Одну закрытую (Claude или GPT) для серьёзных задач. Одну дешёвую (DeepSeek через API или Mistral локально) для всего остального. На двух уже видна экономия и понятна логика разделения.

Третью добавляй, когда видишь конкретную задачу, которую первые две решают плохо или дорого. Типовой третий добор, LLaMA 3 для файнтюнинга. Четвёртый, Mistral локально для приватных данных. Пятый, GPT-5 для маркетинга, когда становится ясно что для этого Claude избыточен.

Главное, не пытаться сразу собрать зоопарк. Иди от реальных задач, а не от моды.

Примеры из реальной работы

Конкретные кейсы за рабочую неделю, чтобы было понятнее.

Понедельник: чужой код на 600 строк на Python, надо найти баг. Идёт в Claude Opus 4.7. Один длинный диалог, контекст держится, баг найден за 15 минут. Стоимость запроса $0.04. На GPT-5 ушло бы в полтора раза больше итераций, на открытой модели баг не нашёлся бы вообще.

Вторник: 1200 заголовков рекламных объявлений надо разложить по 8 категориям. Прогон через DeepSeek V2.5. 1200 запросов, общая стоимость $0.30. Точность по выборочной проверке 91%. На Claude вышло бы $24, точность поднялась бы максимум до 94%. Не окупается.

Четверг: обработка рабочей переписки за неделю, разбор по проектам. Идёт в локальный Mistral 7B. Письма не покидают машину. 300 писем, обработка за полтора часа в фоне. Стоимость $0.

Пятница: эксперимент с файнтюнингом LLaMA 3 8B на датасете собственных текстов, цель получить модель, которая пишет в нужном стиле. Локально на 24 ГБ карте. Три часа обучения, результат пока сырой, но направление понятное.

Это и есть мульти-моделный подход в реальной работе. Не теория, а ежедневная практика.

Главный вывод

Покупка одной модели на все случаи, это покупка швейцарского ножа за $200, когда отвёртка и нож по отдельности стоят $30 и работают лучше. Дифференциация рынка зашла так далеко, что универсальный солдат всегда проигрывает специалисту по цене или по качеству.

Бери две модели на старте. Через месяц-два сам поймёшь, где нужна третья. Главное, считай деньги и смотри на задачу, а не на бренд.

📲 TG (600-900 символов)

Рабочая раскладка LLM на 2026 год: вместо одной модели за $50 в месяц держи пять под разные задачи и плати $15. Claude Opus 4.7 ($8/мес) на серьёзный код и длинные тексты с контекстом до миллиона токенов. GPT-5 ($4/мес) на маркетинг и шаблонные тексты. DeepSeek V2.5 ($3/мес) на фильтрацию и классификацию, в 50 раз дешевле GPT-5. Mistral 7B локально через Ollama, бесплатно, для рабочих писем и конфиденциальных данных по NDA. LLaMA 3 70B локально для файнтюнинга на 24 ГБ карте.

Простой роутер на 50 строк кода смотрит на тип задачи и кидает запрос в нужную модель. Пишется за вечер, окупается за неделю. Главный принцип: сначала задача, потом модель. Премиум платишь только там, где он реально нужен.

Читайте дальше