Маленькие LLM до 8B: почему размер не главное, а главное - дисциплина
29 мая 2026 г. · 3 мин чтения · Максим Космов

Маленькие LLM до 8B: почему размер не главное, а главное - дисциплина
Гонять локальную модель на своём железе соблазнительно. Бесплатно, приватно, без лимитов, никакой счёт за токены не прилетит. И первый инстинкт при выборе - взять которая побольше и поумнее. Логика понятная: чем выше в рейтинге интеллекта, тем лучше. На практике эта логика ломается ровно там, где модель должна работать не болтушкой, а исполнителем.
Если вы строите агента - то есть модель, которая дёргает инструменты, ходит в поиск, читает файлы, возвращает структурированный ответ - то решающая характеристика не размер и не IQ на бенчмарке. Решающая характеристика - надёжность вызова инструментов. Насколько стабильно модель выдаёт корректный формат, а не красивый текст вокруг сломанного JSON.
Где именно ломаются маленькие агенты
Самое контринтуитивное наблюдение: websearch-агенты на малых моделях падают не на поиске. Поиск они выполняют нормально. Падают они на финальном шаге - когда нужно упаковать результат в структуру. Модель сходила в интернет, нашла факты, а потом выдала JSON с лишней запятой, с комментарием внутри, с обёрткой из "вот ваш ответ" перед открывающей скобкой. Парсер давится, агент умирает.
То есть проблема не в умении думать, а в умении заткнуться и выдать ровно тот формат, который просили. Большая модель это делает на автомате. Маленькая - только если её жёстко за руку держать.
Что с этим делать
Лечится это не апгрейдом модели, а дисциплиной промпта. Правило простое: для агентских задач на локальных моделях явный constraint на формат вывода важнее любых уговоров быть умной.
Конкретно:
- Прямо в системном промпте писать, что ответ должен быть валидным JSON и ничем больше. Без преамбулы, без markdown-обёртки, без пояснений.
- Давать схему ожидаемого вывода прямо в промпте, как пример. Маленькая модель копирует образец охотнее, чем сочиняет по описанию.
- Где можно - включать режим структурированного вывода на стороне движка (grammar/JSON mode), чтобы формат гарантировался не уговорами, а технически.
- Тестировать модель не на загадках и не на знании столиц, а на своей реальной цепочке инструментов. Бенчмарк интеллекта вам ничего не скажет про то, развалится ли агент на третьем шаге.
Скорость против надёжности
Ещё один момент, который всплывает при сравнении малых моделей: между скоростью и надёжностью есть размен. Самая быстрая модель не всегда самая дисциплинированная, и наоборот. Для интерактивного ассистента вы готовы потерпеть лишнюю секунду ради стабильного формата. Для фонового конвейера, где важна пропускная способность, выбор может быть другим. Это нормально - просто выбирайте под задачу, а не под место в рейтинге.
Вывод
Маленькая локальная модель - это не уменьшенная копия большой. Это другой инструмент с другими слабыми местами. Размер тут вторичен. Первично то, насколько надёжно модель делает скучную работу: вызывает нужный инструмент и возвращает ровно тот формат, который от неё ждут. Выбирайте по дисциплине, а ум подкручивайте промптом.
Читайте дальше
Налоговая, которая сама себя чинит (и не просит денег)
OpenAI, Thrive и Crete собрали налогового агента на Codex. Звучит как очередной стартап с презентацией «уберём бухгалтеров», но тут интереснее
Amazon Bedrock Ops Alert: первый прогон
Вдохновились заявкой Amazon о "трёх-слойном" решении для автоматического мониторинга. Ожидали, что система сама будет ловить сбои, поднимать сигналы и даже формировать поддерж-кейсы без лишних шумов
AWS Fundamental NEXUS: табличная модель в SageMaker JumpStart
Сразу бросается в глаза, что процесс деплоя сведён к нескольким кликам, а SageMaker берёт на себя всё, от подготовки окружения до масштабирования. Для тех, кто пока «путает» модели и инфраструктуру, э...