Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
Ключевые тезисы
- Даёт свежие данные и ссылки на источники, снижая галлюцинации.
- Качество RAG определяется в первую очередь качеством retrieval.
- Ключевые ручки: стратегия чанкования, реранкинг, размер контекста.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Устройство RAG-пайплайна
Пять этапов, каждый из которых может всё испортить.
- Чанкование: разбить документы на фрагменты (обычно 200–500 токенов с перекрытием).
- Индексация: посчитать эмбеддинги и построить индекс, обычно вместе с BM25.
- Retrieval: найти топ-k фрагментов по запросу.
- Реранкинг: отсортировать их cross-encoder'ом.
- Генерация: подать фрагменты в промпт с требованием отвечать только по ним и давать ссылки.
Качество RAG почти целиком определяется retrieval. Если нужного фрагмента нет в контексте, никакая модель не придумает правильный ответ — она его сгаллюцинирует.
2Как оценивать RAG
Отдельно поиск, отдельно ответ.
| Что измеряем | Метрика |
|---|---|
| Нашёлся ли нужный фрагмент | Recall@k, MRR |
| Насколько ответ опирается на источники | faithfulness / groundedness |
| Отвечает ли он на вопрос | answer relevance, exact match |
| Нет ли лишнего в контексте | context precision |
Практический минимум: собрать 50–100 реальных вопросов с эталонными фрагментами и мерить Recall@k при каждом изменении чанкования или модели эмбеддингов. Это дешевле и информативнее, чем оценивать финальные ответы вручную.
Связанные темы
Поиск, эмбеддинги и RAG
Embeddings80%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Semantic Search80%
Семантический поиск · Обработка естественного языкаПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
TF-IDF80%
TF-IDF · Обработка естественного языкаВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
LLM80%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Agents80%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
NDCG80%
NDCG · МетрикиНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
MRR80%
Средний обратный ранг · МетрикиСреднее значение 1/rank первого релевантного результата.
MAP80%
Средняя усреднённая точность · МетрикиСреднее по запросам от average precision — учитывает и релевантность, и позиции.
Precision@K80%
Точность@K · МетрикиДоля релевантных объектов среди первых K позиций выдачи.
Recall@K80%
Полнота@K · МетрикиКакая доля всех релевантных объектов попала в топ-K.