Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.
Ключевые тезисы
- Дешевле дообучения и позволяет обновлять знания мгновенно.
- Даёт цитируемость и проверяемость ответов.
- Слабое звено — retrieval: плохой поиск не спасёт никакая модель.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Чанкование — недооценённый рычаг
Самая частая причина плохого RAG.
- Слишком мелкие чанки теряют контекст, слишком крупные размывают эмбеддинг.
- Рабочий ориентир: 200–500 токенов с перекрытием 10–20%.
- Уважайте структуру документа: заголовки, разделы, таблицы не должны разрываться посередине.
- Полезно добавлять в чанк заголовок раздела и название документа — это заметно улучшает retrieval.
Прежде чем менять модель эмбеддингов, проверьте чанкование: обычно там лежит больший запас качества.
2Продвинутые приёмы RAG
Что добавляют, когда базовая схема упирается в потолок.
- Query rewriting: модель переформулирует вопрос перед поиском — помогает при разговорных запросах.
- HyDE: сгенерировать гипотетический ответ и искать по нему, а не по вопросу.
- Multi-query: несколько переформулировок, объединение результатов.
- Контекстное обогащение чанка: добавить в него заголовки разделов и краткое описание документа.
- Цитирование: требовать в ответе ссылки на конкретные фрагменты — так проверяемость становится измеримой.
Связанные темы
Поиск, эмбеддинги и RAG · Адаптация языковых моделей
Embeddings80%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Semantic Search80%
Семантический поиск · Обработка естественного языкаПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
RAG80%
Retrieval-Augmented Generation · Обработка естественного языкаЯзыковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
TF-IDF80%
TF-IDF · Обработка естественного языкаВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
LLM80%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Agents80%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
NDCG80%
NDCG · МетрикиНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
MRR80%
Средний обратный ранг · МетрикиСреднее значение 1/rank первого релевантного результата.
MAP80%
Средняя усреднённая точность · МетрикиСреднее по запросам от average precision — учитывает и релевантность, и позиции.
Precision@K80%
Точность@K · МетрикиДоля релевантных объектов среди первых K позиций выдачи.
Recall@K80%
Полнота@K · МетрикиКакая доля всех релевантных объектов попала в топ-K.
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Fine-tuning80%
Дообучение · Генеративный ИИАдаптация предобученной модели под домен или формат на собственных данных.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
RLHF80%
RLHF · Генеративный ИИДообучение по человеческим предпочтениям: модель награды + оптимизация политики.
PPO80%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.
GPT80%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.