RAG или fine-tuning: когда какой выбрать на реальных задачах

3 июня 2026 г. · 14 мин чтения · Максим Космов

RAG или fine-tuning: когда какой выбрать на реальных задачах
Содержание

TL;DR

Есть 500 документов компании и одна задача: научить LLM отвечать на вопросы по ним. Стандартная корпоративная история, инструкции, регламенты, FAQ по продукту, технические доки на 200 страниц. Перед командой встаёт классический выбор: подключать RAG (retrieval-augmented generation) или делать fine-tuning модели под эти данные.

В реальном кейсе перепробовали оба подхода и потратили на эксперименты примерно полтора месяца. Расскажем честно, что вышло. Краткий вывод такой: RAG остаётся для документов, которые постоянно меняются, инструкции, статьи базы знаний, регламенты с регулярными правками. Fine-tuning уходит на стабильные сценарии: типовые ответы техподдержки, стиль общения с клиентом, шаблонные формулировки.

По деньгам получилось так. RAG на 500 документах и нагрузке 5 вопросов на документ в день, это 2500 запросов в месяц через OpenAI API. Считали на gpt-4o-mini с эмбеддингами text-embedding-3-small, вышло около $50 в месяц. Fine-tuning на 1000 Q&A парах обошёлся в $100 разово за обучение, дальше эксплуатация дешевле, потому что промпт короче, нет нужды тащить контекст с собой.

Правило, к которому пришли: тексты часто меняются, бери RAG. Типовые вопросы на стабильных данных, бери fine-tuning. Если стиль и факты живут на разных уровнях, можно комбинировать, ниже разбор как.

В тексте будет: что такое RAG на пальцах, что такое fine-tuning без академии, прямое сравнение по семи критериям, реальная экономика на 500 документах, гибридный подход с примером, и чек-лист «что брать в конкретной ситуации» с разбором по индустриям, юристы, техподдержка, медицина, e-commerce.

Что такое RAG простым языком

RAG, это когда ты не учишь модель ничему новому. Ты просто перед каждым вопросом подсовываешь ей нужный кусок документа, и она отвечает на основе этого куска. Технически это выглядит так: все 500 документов режутся на куски по 500-800 токенов, прогоняются через embedding-модель, для каждого куска получается вектор и складывается в векторную базу (в кейсе Qdrant, но Pinecone или Chroma делают то же самое).

Когда приходит вопрос пользователя, его векторизуют этой же embedding-моделью, ищут в базе 5-7 ближайших кусков по косинусному расстоянию, склеивают в один блок и отправляют в LLM с промптом вида «вот контекст, вот вопрос, отвечай только по контексту». Модель читает и отвечает.

Главный плюс RAG, ради которого его и взяли: документы можно менять каждый день. В компании регламент техподдержки переписывался три раза за квартал. С RAG ты просто перезаливаешь обновлённый файл в базу, переиндексируешь, и модель сразу отвечает по свежей версии. Никакого переобучения, никаких ожиданий по 4 часа.

Второй плюс, прозрачность. Видно, какие именно куски модель использовала для ответа. Если ответ кривой, можно открыть исходный документ и проверить, врёт ли модель или просто в документе так написано. Для юридических и медицинских задач это важно: пользователю можно дать ссылку на источник.

Минусы тоже есть. Первый, длинный промпт. Каждый запрос тащит с собой 3-5 тысяч токенов контекста, и это бьёт по бюджету. Второй, качество ретривала. Если embedding-модель плохо находит нужный кусок, LLM получает мусор и отвечает мусором. В кейсе примерно 12% запросов уходило в «не нашлось», пришлось докручивать гибридный поиск с BM25.

Что такое fine-tuning без академического тумана

Fine-tuning, это когда берётся базовая LLM (в кейсе gpt-4o-mini через fine-tuning API OpenAI) и докручивается на парах «вопрос, ответ». Модель не получает новые знания в чистом виде, она запоминает паттерны: как формулировать ответ, в каком стиле, какие формулировки использовать, какие термины брать.

Датасет готовили так. Выгрузили из CRM 1200 реальных тикетов техподдержки за полгода, оставили 1000 нормальных (без матерных переписок и неразрешённых кейсов), отформатировали в JSONL формат с полями system / user / assistant. Загрузили в OpenAI fine-tuning, выбрали 3 эпохи обучения. Ждали 2.5 часа, заплатили $100, получили кастомную модель с приставкой ft: в названии.

Плюсы fine-tuning, которые сразу почувствовали. Первый, короткий промпт. Больше не нужно тащить контекст и инструкции «отвечай вежливо, упомяни гарантии, ссылайся на FAQ». Модель сама знает стиль, ты просто шлёшь вопрос пользователя. Это снижает стоимость запроса в 3-4 раза по токенам.

Второй плюс, предсказуемый стиль. После fine-tuning модель стала отвечать единообразно. До этого на одинаковые вопросы могло получиться три разных по тону ответа, после, один паттерн. Для бренда это критично.

Минус номер один, данные устаревают. Если поменялся тариф или добавилась новая фича, fine-tuned модель будет уверенно рассказывать про старое. Чтобы исправить, нужно собрать новый датасет, переобучить, проверить. Это минимум день работы и ещё $50-100.

Минус номер два, нет ссылок на источник. Модель не «помнит» откуда она это знает, она просто выдаёт ответ. Для техподдержки на стабильных данных, нормально. Для юриста, который должен сослаться на статью закона, не годится.

Прямое сравнение по семи критериям

Опыт сведён в таблицу, чтобы не размазывать. Вот по чему шло сравнение.

Скорость внедрения. RAG поднимается за неделю с нуля до прода: 2 дня на парсинг и нарезку документов, 1 день на эмбеддинги и векторную базу, 2 дня на retrieval-логику и тесты, 2 дня на промпт-тюнинг. Fine-tuning занял 3 недели: 2 недели на подготовку датасета и его чистку, 3 дня на обучение и проверку, остальное на интеграцию. RAG быстрее на старте в 2-3 раза.

Стоимость на старте. RAG почти бесплатно, платишь только за эмбеддинги при индексации, это вышло $8 на 500 документов. Fine-tuning, $100 за обучение плюс время инженера на подготовку датасета. Если считать инженерное время по рынку, fine-tuning стартует от $500-800.

Стоимость эксплуатации. Тут fine-tuning выигрывает на больших объёмах. У RAG промпт длинный, на 2500 запросах в месяц вышло $50 на gpt-4o-mini. У fine-tuned модели промпт короче в 3-4 раза, те же 2500 запросов обошлись в $18 в месяц. На годовом горизонте RAG равен $600, fine-tuning равен $216 эксплуатации плюс $100 обучения, итого $316. Экономия около половины.

Свежесть данных. RAG работает на свежем документе в ту же минуту, как его перезалили. Fine-tuning требует переобучения, минимум день и $100. Если документы меняются хотя бы раз в месяц, RAG однозначно.

Прозрачность и ссылки. RAG умеет показать источник, fine-tuning, нет. Для регулируемых индустрий (юристы, медицина, финансы) это закрывает вопрос в пользу RAG.

Качество стиля. Fine-tuning делает модель «своей» по тону. RAG отвечает в стандартном стиле базовой модели, его можно подкрутить промптом, но идеального попадания не будет.

Безопасность от галлюцинаций. RAG галлюцинирует реже, потому что вынужден опираться на конкретный кусок текста. Fine-tuning может уверенно выдумывать, особенно на пограничных вопросах. После fine-tuning было 7% выдуманных фактов на тестовой выборке, у RAG, 3%.

Экономика на 500 документах: счёт по факту

Дадим конкретные цифры, без округлений. Объём, 500 PDF и markdown документов, средний размер 8 страниц, общий объём около 2.4 млн токенов. Реальная нагрузка, 5 вопросов на документ в день в среднем (некоторые документы спрашивают по 50 раз, некоторые по разу в неделю), итого 2500 запросов в месяц.

Сетап RAG. Эмбеддинги text-embedding-3-small по $0.02 за миллион токенов: 2.4 млн × $0.02 / 1000, итого $48 разовых, плюс пере-индексация раз в месяц около $5. Векторная база Qdrant, self-hosted на VPS за $15 в месяц. На запрос: 4000 токенов контекста плюс 200 токенов вопроса плюс 400 токенов ответа, около $0.018 за запрос на gpt-4o-mini. 2500 запросов × $0.018, итого $45 в месяц плюс $15 VPS плюс $5 переиндексация, итого $65 в месяц. Округлим до $50-65 по верхней границе.

Сетап fine-tuning. Подготовка датасета, 8 часов работы (если считать инженерное время по $50/час, это $400). Обучение, $100 в OpenAI. На запрос: 200 токенов вопроса плюс 400 токенов ответа без контекста, $0.0072 за запрос. 2500 × $0.0072, итого $18 в месяц. Если данные не меняются, всё. Если меняются раз в квартал, добавь $100 плюс 8 часов раз в три месяца, амортизированно это $50 в месяц.

На годовом горизонте при стабильных данных fine-tuning заметно дешевле, $216 эксплуатации плюс $100 обучения против $600-780 у RAG. При нестабильных данных RAG дешевле, потому что переобучение fine-tuning раз в месяц съедает экономию.

Гибридный подход: что в итоге собрали

После всех экспериментов выбор остановился не на чём-то одном. Был собран гибрид, и в проде он работает до сих пор.

Стабильную часть, стиль ответа, типовые формулировки, базовые правила общения с клиентом, закатали в fine-tuned модель. Эта часть не менялась год, и обучать её каждый месяц нет смысла.

Меняющуюся часть, актуальные цены, текущие промо, регламент возвратов, новые фичи, держат в RAG. Когда приходит вопрос, сначала через retrieval достаётся релевантный кусок из векторной базы, потом отдаётся в fine-tuned модель с промптом «ответь по этому стилю на основе этого контекста».

Это даёт оба плюса. Стиль стабильный и предсказуемый, потому что fine-tuning. Факты свежие, потому что RAG. Промпт короче, чем чистый RAG, потому что инструкции по стилю уже зашиты в модель. Стоимость на запрос вышла около $0.011, то есть 2500 запросов равны $27 в месяц плюс $15 VPS плюс $50 амортизация переобучения, итого $92. Дороже чем чистый fine-tuning, дешевле чем чистый RAG с подкрученным промптом.

Когда что брать: чек-лист по индустриям

Разложим по сценариям, где разница видна явно.

Юристы и комплаенс. Только RAG. Юрист должен сослаться на конкретный документ, статью, пункт. Fine-tuning без источников не подходит для юридически значимых ответов.

Техподдержка на стабильном продукте. Fine-tuning. Если у тебя FAQ не меняется по сути, продукт стабильный, нужен предсказуемый стиль, бери fine-tuning. Это случай той самой техподдержки из кейса.

Медицина и здравоохранение. RAG с обязательной ссылкой на источник. Любое неверное утверждение в медицине, риск, и fine-tuning тут опасен из-за галлюцинаций. Плюс протоколы лечения регулярно обновляются.

E-commerce. Гибрид. Стиль общения с клиентом (вежливо, упоминание гарантии, шаблон отказа), fine-tuning. Информация о товаре, цене, наличии, акциях, RAG из живой базы.

Внутренняя документация для разработчиков. RAG. API меняется, библиотеки обновляются, версии плодятся. Переобучать модель каждую неделю невозможно.

Образовательные продукты. Fine-tuning для стиля и подачи, RAG для конкретного материала курса. Тот же гибрид что и в основном кейсе.

FAQ

Можно ли обойтись только контекстом в промпте без векторной базы?

Можно, если документов мало, до 10 штук, влезающих в окно контекста модели. У gpt-4o окно 128к токенов, туда влезает примерно 250-300 страниц текста. Дальше нужен retrieval, иначе платишь за то, что модель читает 200к токенов на каждый запрос.

Что выбрать для русскоязычных документов?

Для embedding на русском лучше работает multilingual-e5-large (open source, self-host) или text-embedding-3-large от OpenAI. Маленький text-embedding-3-small на русском хуже находит синонимы. Fine-tuning на русском работает нормально, gpt-4o-mini после обучения держит стиль на русском без потерь.

Сколько Q&A пар нужно для fine-tuning?

Минимум 100, нормально, 500-1000, оптимум, 1500-3000. Меньше 100, модель почти не учится, больше 5000, переобучение и потеря общих способностей. На 1000 парах вышло хорошо.

Можно ли обучить fine-tuning поверх RAG-системы?

Да, в кейсе так и сделали. Это лучший подход для production, если бюджет позволяет два этапа. Сначала fine-tuning на стиль и формат ответа, потом RAG на актуальный контекст.

Что делать, если RAG не находит нужный документ?

Включай гибридный поиск: BM25 для точных совпадений ключевых слов плюс векторный поиск для смысла. Дальше reranker сверху (Cohere Rerank или open-source). После reranker качество поиска выросло с 73% до 89% на тестовой выборке.

📌 Dzen (~900 слов)

RAG или fine-tuning: что выбрать для 500 документов компании

Есть 500 документов компании и задача научить LLM отвечать по ним. Перед командой встаёт классический выбор: RAG или fine-tuning. В реальном кейсе перепробовали оба за полтора месяца. Расскажем что вышло.

Краткий вывод: RAG остаётся для меняющихся документов, fine-tuning, для стабильных задач со своим стилем. По деньгам RAG обошёлся в $50 в месяц на нагрузке 2500 запросов, fine-tuning, $100 разово плюс $18 в месяц на той же нагрузке.

Что такое RAG в двух словах

RAG, это когда ты не учишь модель, а подсовываешь ей нужный кусок документа перед каждым вопросом. Технически: режутся 500 документов на куски по 500-800 токенов, прогоняются через embedding-модель, складываются векторы в Qdrant. На запрос ищутся 5-7 ближайших по смыслу кусков, склеиваются и отдаются в LLM с промптом «отвечай по контексту».

Плюс номер один, документы можно менять каждый день. Регламент техподдержки переписывался три раза за квартал, с RAG ты просто перезаливаешь файл и переиндексируешь за 5 минут. Никакого переобучения.

Плюс номер два, прозрачность. Видно, какие куски модель использовала. Если ответ кривой, открываешь исходник и проверяешь. Для юристов и медиков это критично, можно дать ссылку на источник.

Минусы. Длинный промпт, каждый запрос тащит 3-5 тысяч токенов контекста. И качество retrieval: 12% запросов уходило в «не нашлось», пришлось докручивать гибридный поиск с BM25.

Что такое fine-tuning по-простому

Fine-tuning, это докрутка базовой LLM на парах вопрос-ответ. Модель учится не фактам, а паттернам: как формулировать, в каком стиле, какие термины брать.

Датасет готовили так. Выгрузили из CRM 1200 тикетов техподдержки за полгода, оставили 1000 нормальных кейсов, отформатировали в JSONL с system/user/assistant. Загрузили в OpenAI fine-tuning, 3 эпохи обучения. Ждали 2.5 часа, заплатили $100, получили кастомную модель.

Плюсы. Промпт стал коротким, не нужно тащить инструкции про стиль и гарантии, модель сама знает. Стоимость запроса упала в 3-4 раза по токенам. И стиль стал предсказуемым, до fine-tuning на один вопрос могло получиться три разных по тону ответа, после, один паттерн.

Минусы. Данные устаревают. Поменялся тариф, модель уверенно рассказывает про старый. Нужен новый датасет, переобучение, $50-100 и день работы. И нет ссылок на источник, модель просто отвечает, без отсылок.

Сравнение по основным критериям

Скорость внедрения. RAG поднимается за неделю с нуля до прода. Fine-tuning занял 3 недели в основном из-за подготовки и чистки датасета. На старте RAG в 2-3 раза быстрее.

Стоимость старта. RAG почти бесплатно, $8 на эмбеддинги для 500 документов. Fine-tuning, $100 за обучение плюс время инженера на датасет (по рынку $500-800).

Стоимость эксплуатации. На 2500 запросах в месяц RAG равен $50, fine-tuning равен $18. На годовом горизонте при стабильных данных fine-tuning заметно дешевле: $316 против $600-780 у RAG.

Свежесть данных. RAG работает на свежем документе через минуту. Fine-tuning, переобучение за день и $100. Если документы меняются раз в месяц, RAG однозначно.

Прозрачность. RAG показывает источник, fine-tuning нет. Для юристов, медицины, финансов это закрывает вопрос в пользу RAG.

Качество стиля. Fine-tuning делает модель «своей» по тону. RAG отвечает в стиле базовой модели.

Галлюцинации. RAG врёт реже, потому что опирается на конкретный текст. После fine-tuning было 7% выдуманных фактов на тесте, у RAG, 3%.

Реальная экономика на 500 документах

Объём: 500 документов в среднем по 8 страниц, общий объём 2.4 млн токенов. Нагрузка: 5 вопросов на документ в день, итого 2500 запросов в месяц.

RAG. Эмбеддинги text-embedding-3-small: 2.4 млн × $0.02/1000, итого $48 разово, плюс $5 в месяц на переиндексацию. Векторная база Qdrant self-hosted на VPS за $15 в месяц. На запрос: 4000 токенов контекста плюс 200 вопроса плюс 400 ответа, итого $0.018. 2500 × $0.018, итого $45 в месяц плюс $15 плюс $5, итого $65 в месяц.

Fine-tuning. Подготовка датасета, 8 часов работы. Обучение, $100. На запрос: 200 токенов вопроса плюс 400 ответа без контекста, итого $0.0072. 2500 × $0.0072, итого $18 в месяц. При стабильных данных, всё. При изменениях раз в квартал, плюс $100 раз в три месяца, амортизированно $50 в месяц.

Годовой бюджет: fine-tuning, $216 плюс $100, итого $316. RAG, $600-780. Если данные стабильные, fine-tuning экономит вдвое. Если меняются часто, RAG выигрывает за счёт отсутствия переобучения.

Что в итоге собрали: гибрид

В итоге выбор остановился не на одном подходе. Был собран гибрид, и в проде он используется до сих пор.

Стабильную часть, стиль ответа, формулировки, правила общения, закатали в fine-tuned модель. Это не менялось год, переобучать смысла нет.

Меняющуюся часть, цены, промо, регламент возвратов, новые фичи, держат в RAG. На запрос сначала достаётся кусок из базы, потом отдаётся в fine-tuned модель с промптом «ответь по этому стилю на основе контекста».

Плюсы оба: стиль стабильный, факты свежие. Стоимость запроса $0.011, итого $92 в месяц с учётом VPS и амортизации переобучения. Дороже fine-tuning, дешевле RAG на длинном промпте.

Чек-лист по индустриям

Юристы и комплаенс, только RAG. Нужны ссылки на конкретные документы и статьи.

Техподдержка на стабильном продукте, fine-tuning. Если FAQ не меняется и нужен предсказуемый стиль.

Медицина, RAG с обязательной ссылкой на источник. Галлюцинации опасны, протоколы обновляются.

E-commerce, гибрид. Стиль общения, fine-tuning, информация о товаре и цене, RAG.

Внутренняя документация для разработчиков, RAG. API меняется, версии плодятся, переобучать невозможно.

Образовательные продукты, гибрид. Fine-tuning для подачи, RAG для материала курса.

Главное правило по итогам экспериментов: тексты меняются часто, бери RAG. Типовые вопросы на стабильных данных, бери fine-tuning. Если живут на разных уровнях, комбинируй.

📲 TG (600-900 символов)

RAG или fine-tuning для 500 документов компании. В реальном кейсе попробовали оба за полтора месяца.

RAG на 2500 запросах в месяц вышел $50: эмбеддинги text-embedding-3-small за $48 разово, Qdrant self-hosted на VPS $15, около $0.018 за запрос на gpt-4o-mini. Плюс свежесть данных в минуту и ссылки на источник. Минус, длинный промпт и 12% запросов в «не нашлось» без BM25.

Fine-tuning на 1000 Q&A парах обошёлся $100 разово и $18 в месяц эксплуатации (промпт в 3-4 раза короче). Плюс предсказуемый стиль. Минус, данные устаревают и нет ссылок на источник, галлюцинации 7% против 3% у RAG.

Финал: гибрид. Стиль в fine-tuning, факты в RAG. Стоимость $92 в месяц на 2500 запросов.

Читайте дальше