Fine-tune vs RAG vs промпт-инжиниринг: когда что выбирать и сколько это стоит
29 мая 2026 г. · 7 мин чтения · Максим Космов

Содержание
Компания хочет AI-ассистента который отвечает в фирменном стиле, знает внутренние процессы и не выдаёт лишнего. Есть три способа это сделать: написать хороший промпт, подключить базу знаний через RAG, или дообучить модель на своих данных. Выглядят похоже, работают совсем по-разному.
Разберём каждый подход, объясним разницу и дадим ориентиры по стоимости.
Промпт-инжиниринг: самое быстрое начало
Промпт - это текстовая инструкция для модели. Системный промпт задаёт роль, правила поведения, стиль. Пользовательский промпт - конкретный запрос.
Как это выглядит: вы пишете системный промпт вида «Ты помощник службы поддержки компании X. Отвечай кратко и по делу. Не обсуждай конкурентов. Если не знаешь ответа - скажи "не знаю"». Модель будет следовать этим правилам в каждом ответе.
Стоимость: $0 - только время на написание.
Время настройки: от 30 минут до нескольких часов для сложных промптов.
Ограничения:
- Модель не знает вашу конкретную базу знаний, документы, внутренние правила
- При длинной переписке промпт «вытесняется» историей диалога и правила начинают игнорироваться
- Нельзя надёжно заставить модель придерживаться стиля - особенно для нишевого профессионального жаргона
- Не защищает от выдумывания фактов
Когда достаточно промпта:
- Задача простая и универсальная: перевести, резюмировать, отформатировать
- Не нужны знания о конкретной компании или базе данных
- Объём диалога небольшой
- Цена вопроса невысокая (ошибка модели не критична)
RAG: подключить свои знания
RAG (Retrieval-Augmented Generation) - подход при котором модель получает доступ к вашей базе документов в момент ответа. Механизм: вопрос пользователя превращается в вектор, система находит похожие куски в базе, добавляет их в контекст модели, модель отвечает на основе реальных документов.
Подробнее про RAG - в отдельном гайде. Здесь сравниваем по параметрам.
Стоимость настройки: от $0 (self-hosted через AnythingLLM + Ollama) до $200-500 за настройку если нанять специалиста.
Стоимость работы: зависит от модели и объёма запросов. При 100 запросов в день через GPT-4o API - около $5-20 в месяц. Через более дешёвые модели - меньше.
Время настройки: от 1-2 часов (готовые решения вроде AnythingLLM) до нескольких дней для сложных корпоративных систем.
Ограничения:
- Не меняет стиль или поведение модели - только добавляет знания
- Работает только с тем что лежит в базе. Если документа нет - модель не ответит по нему
- Качество ответов зависит от качества поиска в базе
- Плохо работает для очень коротких запросов или запросов сильно далёких от содержимого базы
Когда нужен RAG:
- Есть большая база документов (FAQ, инструкции, договоры, статьи)
- Нужны ответы на основе конкретных данных без выдуманных фактов
- База обновляется - и знания модели должны обновляться вместе с ней
- Важно показывать источник ответа
Fine-tune: дообучение модели
Дообучение (fine-tuning) - это когда вы берёте уже обученную большую модель и дополнительно обучаете её на своих данных. Модель меняет свои веса и «усваивает» паттерны из ваших данных.
Что даёт fine-tune, чего не даёт RAG:
- Модель усваивает стиль написания конкретного автора или компании
- Модель учится конкретному узкоспециализированному жаргону
- Модель учится следовать очень специфическому формату ответов
- Скорость ответа может быть выше (не нужно делать поиск по базе)
- Нет галлюцинаций по поводу стиля - стиль «встроен» в модель
Что fine-tune НЕ даёт:
- Новые знания о фактах. Обучение на документах не делает модель «умнее» в плане знания вашей базы - для этого нужен RAG. Fine-tune обучает паттернам, а не фактам.
- Гарантий точности фактов: модель может всё равно выдумывать.
Стоимость:
Через OpenAI Fine-tuning API: подготовка данных + загрузка датасета + оплата обучения. Примерные цены (середина 2026): GPT-4o mini fine-tuning - $3 за миллион обучающих токенов. Для датасета в 100 000 токенов - около $0.3. Плюс стоимость использования дообученной модели (обычно немного выше базовой).
Через Hugging Face + облачный GPU: аренда GPU A100 за $1-3 в час, дообучение 7B модели на несколько тысяч примеров - 2-6 часов = $5-15.
Для крупных корпоративных задач (миллионы токенов, сложная инфраструктура) - стоимость выше.
Время: подготовка качественного датасета - самое долгое. Нужны сотни или тысячи пар «входящий запрос - правильный ответ». Это часы или дни ручной работы.
Когда нужен fine-tune:
- Нужен уникальный стиль письма который промптом не воспроизвести
- Очень специализированная ниша с нестандартной терминологией
- Нужна высокая скорость ответа при большом объёме запросов
- Задача хорошо определена и данных для обучения достаточно
Когда fine-tune переоценён:
- Думают что fine-tune даст модели «знания» о конкретных фактах. Не даст - для этого нужен RAG
- Надеются что fine-tune на 50 примерах сделает модель экспертом. Не сделает - нужны тысячи качественных примеров
- Обходятся без RAG когда база знаний постоянно обновляется - дообученную модель нельзя быстро обновить
Сравнительная таблица
Параметр / Промпт / RAG / Fine-tune
Стоимость старта: $0 / $0-500 / $5-500+ Время настройки: часы / часы-дни / дни-недели Знание базы документов: нет / да / нет (только паттерны) Изменение стиля: частично / нет / да Обновление знаний: сразу / сразу (добавь документ) / переобучение Риск галлюцинаций: высокий / низкий (для базы) / средний Нужен разработчик: нет / частично / да
Комбинирование подходов
На практике лучшие результаты даёт сочетание:
Промпт + RAG: самая популярная комбинация. Системный промпт задаёт роль и правила поведения, RAG даёт знания из базы. Работает хорошо для корпоративных ассистентов.
Промпт + Fine-tune + RAG: для серьёзных продуктов. Fine-tune учит нужному стилю, RAG даёт актуальные знания, промпт задаёт дополнительные правила конкретного запроса.
Пример: чат-бот технической поддержки. Fine-tune обучен отвечать кратко и по делу в фирменном стиле. RAG подключён к базе документации и FAQ. Системный промпт запрещает обсуждать нерелевантные темы.
Сколько данных нужно для fine-tune
Распространённое заблуждение: «возьму 50 примеров и дообучу модель». На 50 примерах дообучение даёт нестабильный результат - модель может переобучиться именно на этих примерах и плохо работать на похожих задачах.
Практические ориентиры по объёму датасета:
Для корректировки стиля: 200-500 примеров. Достаточно чтобы модель усвоила тон и формат.
Для специализированного домена (медицина, право, техническая документация): 1000-5000 примеров. Нужно достаточное покрытие разных вариантов формулировок.
Для изменения базового поведения модели: 10 000+ примеров. Это уже серьёзная инженерная задача.
Качество данных важнее количества. Лучше 500 тщательно размеченных примеров чем 5000 автоматически сгенерированных с ошибками. Мусорные данные учат модели воспроизводить этот мусор.
Каждый пример должен иметь формат: входящий запрос + идеальный ответ. Идеальный ответ должен быть написан в нужном стиле и содержать правильную информацию. Если вы сами не уверены что ответ правильный - этот пример лучше не использовать.
Практические рекомендации
Начните с промпта. Всегда. Даже если знаете что в итоге нужен fine-tune. Хороший промпт - это уже 70-80% решения для большинства задач. Fine-tune и RAG добавляют оставшиеся проценты.
Перед RAG проверьте прямой поиск. Иногда простой полнотекстовый поиск по базе + вставка результата в промпт решает задачу без векторной базы и сложной настройки.
Fine-tune оправдан если у вас уже есть датасет. Собирать данные специально для fine-tune дорого и долго. Если уже накопились сотни размеченных примеров - тогда имеет смысл.
Не путайте «дообучение» и «обучение с нуля». Обучение GPT-4 с нуля стоит десятки миллионов долларов. Дообучение уже готовой модели - сотни долларов в худшем случае.
Как оценить нужен ли fine-tune
Прежде чем идти на дообучение, стоит ответить на несколько вопросов.
Насколько хорошо текущая модель справляется с промптом? Попробуйте 20-30 примеров. Если промпт даёт 70%+ правильных ответов - дообучение скорее всего не нужно, проблема в промпте.
Есть ли хотя бы 1000 качественных примеров для обучения? Меньше 500 примеров - дообучение не даст стабильного результата. Данные важнее архитектуры.
Стабильна ли задача? Если задача постоянно меняется или требования обновляются часто - дообучение превращается в постоянные расходы. RAG обновляется добавлением документов. Fine-tune требует переобучения.
Нужна ли продуктовая надёжность? Дообученная модель может вести себя непредсказуемо на данных сильно отличающихся от обучающего датасета. Это важно учитывать для производственных систем.
Если ответы на все вопросы «нет» - начните с промпта. Если ответы смешанные - попробуйте RAG. Fine-tune заказывайте последним.
Итог: когда что выбирать
Промпт-инжиниринг: задача простая, нужна скорость, нет специфических знаний которые нужно встроить.
RAG: есть база документов, нужны точные ответы по ней, база обновляется.
Fine-tune: нужен уникальный стиль или специализированный формат, есть качественные данные для обучения, задача хорошо определена и стабильна.
Большинство реальных задач решаются хорошим промптом плюс RAG. Fine-tune - для продвинутых случаев, когда первые два уже не справляются.
Разборы свежих AI-новостей - в канале AI Компас.
Больше гайдов - guides.kosmoslab.dev/guides.
Читайте дальше
Промпт-инжиниринг для обычных задач: 10 приёмов которые реально работают
Конкретные приёмы для написания промптов которые дают предсказуемый результат. С примерами плохих и хороших запросов для реальных задач.
RAG дома: подключаем свою базу знаний к локальной модели
Пошаговая инструкция: устанавливаем Ollama, поднимаем AnythingLLM, загружаем свои документы и получаем AI-ассистента который знает вашу базу знаний.
AI в лидогенерации: как фильтровать сотни чатов и находить нужное
Разбираем метод автоматической фильтрации Telegram-чатов через AI: как не читать всё подряд и получать только целевые сообщения с оценкой релевантности.