Метрики

MAP

Средняя усреднённая точность

актуальноТекущий рабочий стандарт

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Ключевые тезисы

  • Награждает за размещение релевантных объектов выше в списке.
  • Работает с бинарной релевантностью.
  • Классическая метрика информационного поиска.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Average Precision и её среднее

Учитываем не только попадание, но и позицию.

Обозначения
  • число объектов в выборке
  • размер топа выдачи (K) или номер позиции
  • суммирование по всем перечисленным элементам
Обозначения
  • распределение, предсказанное моделью
  • суммирование по всем перечисленным элементам
Усреднение по всем запросам

Та же метрика под именем mAP используется в детекции объектов: там «релевантность» определяется порогом IoU, а усреднение идёт по классам и порогам.

2

mAP в детекции объектов

Та же идея, другая интерпретация «релевантности».

  1. Предсказанная рамка считается верной, если IoU с истинной выше порога.
  2. Для каждого класса строится PR-кривая по уверенности предсказаний.
  3. AP усредняется по классам, а в COCO — ещё и по порогам IoU от 0.5 до 0.95.
На практике

Поэтому mAP@0.5 всегда заметно выше mAP@[.5:.95] — при сравнении моделей обязательно уточняйте, какой вариант приведён.

Связанные темы

Поиск, эмбеддинги и RAG

Embeddings80%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Semantic Search80%

Семантический поиск · Обработка естественного языка

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

RAG80%

Retrieval-Augmented Generation · Обработка естественного языка

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

TF-IDF80%

TF-IDF · Обработка естественного языка

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

LLM80%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.