Генеративный ИИ

RAG

RAG

новинкаНовое или быстро растущее направление

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

Ключевые тезисы

  • Дешевле дообучения и позволяет обновлять знания мгновенно.
  • Даёт цитируемость и проверяемость ответов.
  • Слабое звено — retrieval: плохой поиск не спасёт никакая модель.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Чанкование — недооценённый рычаг

Самая частая причина плохого RAG.

  • Слишком мелкие чанки теряют контекст, слишком крупные размывают эмбеддинг.
  • Рабочий ориентир: 200–500 токенов с перекрытием 10–20%.
  • Уважайте структуру документа: заголовки, разделы, таблицы не должны разрываться посередине.
  • Полезно добавлять в чанк заголовок раздела и название документа — это заметно улучшает retrieval.
На практике

Прежде чем менять модель эмбеддингов, проверьте чанкование: обычно там лежит больший запас качества.

2

Продвинутые приёмы RAG

Что добавляют, когда базовая схема упирается в потолок.

  • Query rewriting: модель переформулирует вопрос перед поиском — помогает при разговорных запросах.
  • HyDE: сгенерировать гипотетический ответ и искать по нему, а не по вопросу.
  • Multi-query: несколько переформулировок, объединение результатов.
  • Контекстное обогащение чанка: добавить в него заголовки разделов и краткое описание документа.
  • Цитирование: требовать в ответе ссылки на конкретные фрагменты — так проверяемость становится измеримой.

Связанные темы

Поиск, эмбеддинги и RAG · Адаптация языковых моделей

Embeddings80%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Semantic Search80%

Семантический поиск · Обработка естественного языка

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

RAG80%

Retrieval-Augmented Generation · Обработка естественного языка

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

TF-IDF80%

TF-IDF · Обработка естественного языка

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

LLM80%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

MAP80%

Средняя усреднённая точность · Метрики

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.

Prompting80%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Fine-tuning80%

Дообучение · Генеративный ИИ

Адаптация предобученной модели под домен или формат на собственных данных.

LoRA80%

LoRA · Генеративный ИИ

Обучение низкоранговых добавок к весам вместо полного дообучения модели.

RLHF80%

RLHF · Генеративный ИИ

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

PPO80%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.

GPT80%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.