aibot.

RAG: как заставить модель отвечать по вашим документам

Обновлено 13 августа 2026 · проверено редакцией

RAG — это способ дать модели знания, которых у неё нет: вместо того чтобы переучивать модель, ей подкладывают нужные куски ваших документов прямо в запрос. Звучит просто, и именно поэтому большинство внедрений разваливается не на модели, а на поиске.

Расшифровка
Retrieval-Augmented Generation
По-русски
генерация с поиском по базе
Что даёт
ответы по документам без переобучения
Где ломается чаще всего
на этапе поиска, а не генерации

листайте схему вбок

Как модель отвечает по вашим документам01Документыpdf, база, вики02Чанкинарезка по смыслу03Эмбеддингичисловое представление04Поискпохожие фрагменты05Ответмодель + найденноеМодель не запоминает ваши документы: она получает нужные куски вместе с вопросом.Поэтому обновление документа сразу меняет ответ — переобучать ничего не нужно
Путь документа: нарезка, векторизация, поиск, ответ

Что такое RAG простыми словами

Языковая модель знает то, что было в её обучении, и не знает вашего договора, вашей базы товаров и вчерашней переписки. Есть два пути это исправить: переучить модель или подсказать ей нужное прямо в момент вопроса. RAG — второй путь.

Аналогия с экзаменом

Дообучение — это заставить студента выучить учебник наизусть: долго, дорого и придётся повторять при каждом изменении. RAG — разрешить экзамен с открытой книгой: студент тот же, но перед ответом успевает найти нужную страницу.

Отсюда следует главное свойство: если книга открыта не на той странице, уверенный ответ будет неверным. Качество RAG определяется качеством поиска, а не умом модели.

Что происходит по шагам

Документы режутся на фрагменты, каждый фрагмент превращается в числовое представление и кладётся в базу. При вопросе то же самое делают с вопросом, находят ближайшие фрагменты и склеивают их с вопросом в один запрос к модели.

Почему модель не «запоминает» документы

Модель каждый раз получает найденное как часть текста запроса и после ответа ничего не сохраняет. Отсюда полезное следствие: поправили документ — следующий ответ уже учитывает правку, никаких переобучений.

Почему ответ можно проверить

Раз фрагменты известны заранее, вместе с ответом легко отдать ссылки на источники. Если система такого не умеет, проверять её ответы придётся вручную — и весь выигрыш во времени пропадает.

RAG или дообучение: что выбрать

Вопрос звучит как технический, но решается по характеру данных: как часто они меняются и что именно нужно изменить — знания или манеру.

RAG подходит, когда данные меняются

База товаров, документы, регламенты, переписка, новости. Всё, где вчерашний ответ сегодня уже неверен. Обновление стоит ровно столько, сколько стоит переиндексировать изменившийся файл.

Дообучение подходит, когда меняется поведение

Устойчивый формат ответа, отраслевой язык, специфическая разметка на выходе. Знания дообучением тоже вкладываются, но дорого и с риском: модель начинает уверенно воспроизводить устаревшую версию факта.

Чаще всего нужны оба

Рабочая связка выглядит так: RAG отвечает за факты, промпт — за формат, дообучение подключают, когда промпт перестаёт держать стиль на длинной дистанции. Начинать стоит с RAG: он дешевле и обратим.

Сравнение подходов

КритерийRAGДообучение
Обновление данныхмгновенно, переиндексациейновый цикл обучения
Стоимость входанизкаявысокая
Проверяемость ответаесть ссылки на фрагментыисточник не отследить
Расход контекстарастёт: найденное занимает местоне растёт
Что меняетзнанияманеру и формат

Где RAG ломается на практике

Почти все провалы внедрения делятся на четыре типа, и ни один из них не лечится сменой модели на более умную.

Нарезка по размеру вместо смысла

Самая частая ошибка: документ режут на куски по количеству символов. Таблица разрывается пополам, условие оказывается в одном фрагменте, а исключение из него — в другом. Модель получает половину правила и уверенно отвечает по ней.

Лечится нарезкой по структуре: разделы, пункты, строки таблицы целиком. Плюс небольшое перекрытие соседних фрагментов, чтобы фраза на границе не терялась.

Поиск находит похожее, а не нужное

Векторный поиск возвращает семантически близкое. На запрос про «условия возврата» он честно принесёт пять абзацев про возврат — включая старую редакцию регламента, которую забыли удалить.

Гибридный поиск

Комбинация поиска по смыслу и обычного поиска по словам закрывает слабое место каждого: векторный плохо ловит артикулы и номера, словесный не ловит перефразировки.

Фильтры до поиска

Дата, редакция документа, подразделение, статус «действующий». Отсечь мусор фильтром дешевле, чем надеяться, что модель сама заметит противоречие между двумя редакциями.

В контекст кладут слишком много

Логика «положим двадцать фрагментов, модель разберётся» работает плохо: детали в середине длинного контекста удерживаются хуже, чем в начале и в конце. Плюс каждый лишний фрагмент — это оплаченные токены в каждом запросе.

Нет ответа «не знаю»

Если в базе ничего подходящего нет, поиск всё равно вернёт что-то — просто менее похожее. Без порога релевантности и прямого указания в промпте система вместо честного «в документах этого нет» выдаст правдоподобную выдумку.

Диагностика в одно действие: возьмите вопрос, на который система ответила неверно, и посмотрите, какие фрагменты она нашла. В девяти случаях из десяти нужного фрагмента среди них нет — значит, чинить надо поиск, а не промпт и не модель.

Как проверить свой RAG за полчаса

  1. Соберите двадцать реальных вопросовНе придуманных, а тех, что действительно задают. Половину — с однозначным ответом в документах, половину — с ответом, которого в базе нет.
  2. Посмотрите найденные фрагменты, а не ответыПо каждому вопросу оцените: есть ли среди найденного тот кусок, где лежит ответ. Это и есть качество поиска в чистом виде.
  3. Проверьте вопросы без ответаСистема обязана сказать, что не нашла. Если она отвечает — порог релевантности не настроен.
  4. Посчитайте объём контекстаСколько токенов уходит на найденные фрагменты в среднем запросе. Умножьте на число запросов в месяц и на цену — часто это открытие.
  5. Проверьте свежестьИзмените документ и задайте вопрос по нему. Если ответ старый — переиндексация не работает, и это тихая бомба.

Сколько это стоит

Стоимость RAG складывается из трёх частей, и самая крупная обычно не та, о которой думают в начале.

Индексация

Разовая: превращение документов в векторы. Модели для этого дешевле разговорных на порядок, и для типичной базы документов компании это единицы долларов.

Хранение

Векторная база. На малых объёмах помещается в обычную базу данных с расширением, отдельный сервис нужен, когда фрагментов миллионы.

Каждый запрос

Вот здесь деньги. К вопросу пользователя добавляются найденные фрагменты — и оплачивается всё вместе. Пять фрагментов по тысяче токенов превращают короткий вопрос в запрос на пять с лишним тысяч токенов.

Расчёт цены за миллион токенов по каждой модели — в каталоге.

Частые вопросы

Что означает аббревиатура RAG
Retrieval-Augmented Generation — генерация, дополненная поиском. Модель сначала ищет нужные фрагменты, потом отвечает по ним.
Чем RAG отличается от обычного поиска по сайту
Обычный поиск выдаёт список документов и оставляет чтение вам. RAG находит фрагменты и формулирует по ним связный ответ, в идеале со ссылками на источник.
Можно ли сделать RAG без программиста
Да, готовые сервисы позволяют загрузить документы и получить бота. Ограничение в том, что настройка нарезки и порога релевантности там обычно скрыта — а именно это чинят, когда качество не устраивает.
Почему RAG отвечает неправильно, хотя документ загружен
Почти всегда нужный фрагмент просто не попал в найденное: либо документ нарезан так, что ответ разорван, либо запрос сформулирован иначе, чем текст в документе. Смотреть надо на выдачу поиска, а не на ответ.
Сколько документов выдерживает RAG
Ограничения по количеству практически нет, ограничение по качеству наступает рано: чем больше похожих документов, тем чаще поиск приносит близкое, но не то. Спасают фильтры по разделу и дате.
Нужна ли отдельная векторная база
На объёме до сотен тысяч фрагментов достаточно расширения к обычной базе данных. Отдельный сервис оправдан на миллионах фрагментов или при высокой нагрузке.
Утекают ли документы в модель при RAG
Фрагменты уходят провайдеру модели в составе запроса — как и любой текст, который вы отправляете. Если это недопустимо, модель поднимают локально.
Заменит ли большое контекстное окно RAG
Нет. Даже когда база помещается в окно целиком, класть её в каждый запрос дорого, а удержание деталей в длинном контексте хуже точечного поиска. Подробнее — в разборе контекстного окна.

Связанные страницы

Последняя проверка фактов: 13.08.2026. Нашли неточность — напишите редакции.