Метрики

Precision

Точность

актуальноТекущий рабочий стандарт

Какая доля объектов, предсказанных положительными, действительно положительна.

Что означает каждый компонент
  • верные срабатывания: модель сказала «да», и это правда
  • все срабатывания модели, включая ложные тревоги. Precision отвечает: какой доле срабатываний можно верить

Ключевые тезисы

  • Отвечает на вопрос «насколько можно доверять срабатыванию модели».
  • Критична там, где ложное срабатывание дорого: блокировки, рассылки, модерация.
  • Растёт при повышении порога — за счёт падения полноты.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Смысл и когда важна

Насколько можно доверять срабатыванию модели.

Обозначения
  • верные срабатывания: модель сказала «да», и это правда
  • ложные срабатывания: модель сказала «да», а это неправда
Пример

Из 100 транзакций, которые модель пометила как мошеннические, действительно мошеннических 30 → precision = 0.3. Семьдесят честных клиентов получили блокировку.

  • Важна там, где ложное срабатывание дорого: блокировки, автоматические отказы, рассылки, модерация.
  • Растёт при повышении порога — но за счёт падения recall.
  • При очень редком классе низкая precision может быть неизбежной: см. парадокс редких событий в теореме Байеса.
2

Precision при фиксированной полноте

Как формулировать требование к модели на языке бизнеса.

Метрику удобно фиксировать так: «нужно находить не меньше 80% мошеннических операций». Тогда recall = 0.8 — ограничение, а precision при этом recall — то, что оптимизируется.

from sklearn.metrics import precision_recall_curve
p, r, thr = precision_recall_curve(y_true, y_score)
i = (r >= 0.8).nonzero()[0][-1]      # последний порог, где recall ещё ≥ 0.8
print(f"precision={p[i]:.3f} при recall={r[i]:.3f}, порог={thr[i]:.4f}")
На практике

Порог, найденный на валидации, нужно проверить на тесте: при малом числе положительных объектов он нестабилен.

Связанные темы

Прикладные задачи NLP · Качество классификации

F196%

F1-мера · Метрики

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

Recall96%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.

Accuracy85%

Доля правильных ответов · Метрики

Доля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.

ROC-AUC85%

ROC-AUC · Метрики

Вероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.

PR-AUC85%

PR-AUC · Метрики

Площадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.

Log Loss85%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

MCC85%

Коэффициент Мэтьюса · Метрики

Корреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.

Calibration85%

Калибровка · Оценка моделей

Соответствие предсказанных вероятностей реальным частотам событий.

Logistic Regression85%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

Text classification75%

Классификация текстов · Обработка естественного языка

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

NER75%

Извлечение именованных сущностей · Обработка естественного языка

Разметка последовательности: находим в тексте имена, организации, даты, суммы.

Sentiment Analysis75%

Анализ тональности · Обработка естественного языка

Определение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.

BERT75%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

Embeddings75%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.