Аппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.
Ключевые тезисы
- Теорема Фишера — Типпета: максимумы сходятся к одному из трёх типов распределений.
- Подход «пики над порогом» использует обобщённое распределение Парето.
- Применения: риск-менеджмент, оценка нагрузки, детекция аномалий с контролем ложных срабатываний.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Метод превышений порога
Как оценить риск события, которого не было.
Берём все наблюдения выше высокого порога и моделируем превышения обобщённым распределением Парето. Это позволяет оценить вероятность значений за пределами наблюдаемого диапазона.
- стандартное отклонение — разброс величины
- переменная нарушения зазора: насколько объект заходит внутрь полосы
- истинное значение целевой переменной
Ключевой параметр : при хвост тяжёлый (Фреше), при экспоненциальный, при ограниченный.
2Применения
Где эта теория используется каждый день.
- Финансы: VaR и Expected Shortfall на хвосте распределения доходностей.
- Инфраструктура: планирование мощности под пиковую, а не среднюю нагрузку.
- Мониторинг: пороги алертов, дающие контролируемое число ложных срабатываний.
- Страхование: оценка крупных убытков по редким событиям.
Связанные темы
Редкие классы и события · Тяжёлые хвосты и риск
Imbalanced Data80%
Дисбаланс классов · ДанныеКогда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.
Isolation Forest80%
Isolation Forest · Классическое машинное обучениеОбнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.
Anomaly Detection80%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
PR-AUC80%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCC80%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Power Law75%
Степенное распределение · Теория вероятностей и распределенияПлотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.
Heavy Tails75%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Log-normal Distribution75%
Логнормальное распределение · Теория вероятностей и распределенияВеличина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.
Complex Systems75%
Сложные системы · Динамические системы и фракталыСистемы из множества взаимодействующих элементов, где коллективное поведение не сводится к сумме частей.
Self-similarity75%
Самоподобие · Динамические системы и фракталыСвойство структуры повторять себя на разных масштабах — точно или статистически.
Scale-free Networks75%
Безмасштабные сети · Графы и сетиСети, в которых распределение степеней вершин подчиняется степенному закону: немного «хабов» и очень много слабо связанных вершин.
Outliers75%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
MAPE75%
Средняя абсолютная процентная ошибка · МетрикиОтносительная ошибка в процентах — удобна для сравнения рядов разного масштаба.