Маленькие LLM до 8B: почему размер не главное, а главное - дисциплина

29 мая 2026 г. · 3 мин чтения · Максим Космов

Маленькие LLM до 8B: почему размер не главное, а главное - дисциплина
Содержание

Маленькие LLM до 8B: почему размер не главное, а главное - дисциплина

Гонять локальную модель на своём железе соблазнительно. Бесплатно, приватно, без лимитов, никакой счёт за токены не прилетит. И первый инстинкт при выборе - взять которая побольше и поумнее. Логика понятная: чем выше в рейтинге интеллекта, тем лучше. На практике эта логика ломается ровно там, где модель должна работать не болтушкой, а исполнителем.

Если вы строите агента - то есть модель, которая дёргает инструменты, ходит в поиск, читает файлы, возвращает структурированный ответ - то решающая характеристика не размер и не IQ на бенчмарке. Решающая характеристика - надёжность вызова инструментов. Насколько стабильно модель выдаёт корректный формат, а не красивый текст вокруг сломанного JSON.

Где именно ломаются маленькие агенты

Самое контринтуитивное наблюдение: websearch-агенты на малых моделях падают не на поиске. Поиск они выполняют нормально. Падают они на финальном шаге - когда нужно упаковать результат в структуру. Модель сходила в интернет, нашла факты, а потом выдала JSON с лишней запятой, с комментарием внутри, с обёрткой из "вот ваш ответ" перед открывающей скобкой. Парсер давится, агент умирает.

То есть проблема не в умении думать, а в умении заткнуться и выдать ровно тот формат, который просили. Большая модель это делает на автомате. Маленькая - только если её жёстко за руку держать.

Что с этим делать

Лечится это не апгрейдом модели, а дисциплиной промпта. Правило простое: для агентских задач на локальных моделях явный constraint на формат вывода важнее любых уговоров быть умной.

Конкретно:

  • Прямо в системном промпте писать, что ответ должен быть валидным JSON и ничем больше. Без преамбулы, без markdown-обёртки, без пояснений.
  • Давать схему ожидаемого вывода прямо в промпте, как пример. Маленькая модель копирует образец охотнее, чем сочиняет по описанию.
  • Где можно - включать режим структурированного вывода на стороне движка (grammar/JSON mode), чтобы формат гарантировался не уговорами, а технически.
  • Тестировать модель не на загадках и не на знании столиц, а на своей реальной цепочке инструментов. Бенчмарк интеллекта вам ничего не скажет про то, развалится ли агент на третьем шаге.

Скорость против надёжности

Ещё один момент, который всплывает при сравнении малых моделей: между скоростью и надёжностью есть размен. Самая быстрая модель не всегда самая дисциплинированная, и наоборот. Для интерактивного ассистента вы готовы потерпеть лишнюю секунду ради стабильного формата. Для фонового конвейера, где важна пропускная способность, выбор может быть другим. Это нормально - просто выбирайте под задачу, а не под место в рейтинге.

Вывод

Маленькая локальная модель - это не уменьшенная копия большой. Это другой инструмент с другими слабыми местами. Размер тут вторичен. Первично то, насколько надёжно модель делает скучную работу: вызывает нужный инструмент и возвращает ровно тот формат, который от неё ждут. Выбирайте по дисциплине, а ум подкручивайте промптом.

Читайте дальше