Площадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
Ключевые тезисы
- Базовый уровень равен доле положительного класса, а не 0.5.
- Фокусируется именно на качестве по положительному классу.
- Стандарт в поиске фрода, аномалий и редких событий.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1PR-AUC против ROC-AUC
Почему на редких классах их выводы расходятся.
PR-кривая строится в координатах recall–precision. Её базовый уровень равен доле положительного класса: при 1% положительных случайная модель даёт PR-AUC ≈ 0.01, тогда как ROC-AUC у неё 0.5.
| ROC-AUC | PR-AUC | |
|---|---|---|
| Учитывает TN | да | нет |
| База случайной модели | 0.5 | доля класса 1 |
| Чувствительность к дисбалансу | низкая (оптимистична) | высокая (честная) |
| Когда выбирать | сбалансированные классы | редкий положительный класс |
Практическое правило: если положительных объектов меньше 5–10%, сравнивайте модели по PR-AUC, а ROC-AUC оставьте как вспомогательное число.
2Average Precision и интерполяция
Как правильно считать площадь под PR-кривой.
- размер топа выдачи (K) или номер позиции
- суммирование по всем перечисленным элементам
average_precision_scoreЛинейная интерполяция PR-кривой (в отличие от ROC) даёт смещённую оценку — поэтому используйте AP, а не auc(recall, precision). Разница на несбалансированных данных бывает заметной.
Связанные темы
Редкие классы и события · Качество классификации
MCC97%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Accuracy85%
Доля правильных ответов · МетрикиДоля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.
Precision85%
Точность · МетрикиКакая доля объектов, предсказанных положительными, действительно положительна.
Recall85%
Полнота · МетрикиКакая доля реально положительных объектов найдена моделью.
F185%
F1-мера · МетрикиГармоническое среднее точности и полноты — компромисс между ними одним числом.
ROC-AUC85%
ROC-AUC · МетрикиВероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.
Log Loss85%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
Calibration85%
Калибровка · Оценка моделейСоответствие предсказанных вероятностей реальным частотам событий.
Logistic Regression85%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
Imbalanced Data80%
Дисбаланс классов · ДанныеКогда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.
Isolation Forest80%
Isolation Forest · Классическое машинное обучениеОбнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.
Anomaly Detection80%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Extreme Value Theory80%
Теория экстремальных значений · Теория вероятностей и распределенияАппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.