Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Ключевые тезисы
- Методы обнаружения: z-score, IQR, Isolation Forest, LOF, расстояние Махаланобиса.
- Линейные модели и MSE крайне чувствительны к выбросам, деревья — почти нет.
- Прежде чем удалять выброс, стоит понять его природу: в фрод-детекции это и есть цель.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как находить выбросы
Четыре рабочих метода: от простого z-score до Isolation Forest.
- стандартное отклонение — разброс величины
- среднее значение
- объект: вектор признаков
- Isolation Forest — случайные разбиения; аномалия отделяется за меньшее число разрезов.
- LOF — сравнивает локальную плотность объекта с плотностью его соседей.
- Расстояние Махаланобиса — многомерный аналог z-score, учитывает корреляции признаков.
2Что с ними делать
Удалять — самый частый и самый опасный ответ.
Сначала классифицируйте выброс: это ошибка ввода (возраст 999), редкое, но настоящее наблюдение (зарплата топ-менеджера) или именно то, что вы ищете (мошенническая транзакция).
| Тип | Действие |
|---|---|
| Ошибка данных | исправить или превратить в пропуск |
| Редкое настоящее значение | оставить, но выбрать устойчивую модель или обрезать (winsorize) |
| Целевое событие | не трогать — это и есть сигнал |
Линейные модели и MSE крайне чувствительны к выбросам, деревья почти нет. Иногда правильный ответ — не чистить данные, а сменить функцию потерь на MAE или Huber.
Связанные темы
Тяжёлые хвосты и риск · Подготовка данных · Аномалии и выбросы
Power Law75%
Степенное распределение · Теория вероятностей и распределенияПлотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.
Heavy Tails75%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Extreme Value Theory75%
Теория экстремальных значений · Теория вероятностей и распределенияАппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.
Log-normal Distribution75%
Логнормальное распределение · Теория вероятностей и распределенияВеличина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.
Complex Systems75%
Сложные системы · Динамические системы и фракталыСистемы из множества взаимодействующих элементов, где коллективное поведение не сводится к сумме частей.
Self-similarity75%
Самоподобие · Динамические системы и фракталыСвойство структуры повторять себя на разных масштабах — точно или статистически.
Scale-free Networks75%
Безмасштабные сети · Графы и сетиСети, в которых распределение степеней вершин подчиняется степенному закону: немного «хабов» и очень много слабо связанных вершин.
MAPE75%
Средняя абсолютная процентная ошибка · МетрикиОтносительная ошибка в процентах — удобна для сравнения рядов разного масштаба.
Data preprocessing75%
Предобработка данных · ДанныеПриведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.
Missing values75%
Пропущенные значения · ДанныеПропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.
Encoding75%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Normalization & Standardization75%
Нормализация и стандартизация · ДанныеПриведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.
Feature engineering75%
Конструирование признаков · ДанныеСоздание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
ML Pipelines75%
ML-пайплайны · MLOpsОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.
Anomaly Detection70%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
Anomaly detection70%
Поиск аномалий во времени · Временные рядыОбнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Density Estimation70%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.
TDA + Time Series70%
TDA и временные ряды · Топологический анализ данныхРяд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.