Теория вероятностей и распределения

Random Variables

Случайные величины

актуальноТекущий рабочий стандарт

Отображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.

Что означает каждый компонент
  • плотность после преобразования величины
  • плотность исходной величины в соответствующей точке
  • множитель-якобиан: учитывает, насколько преобразование сжимает или растягивает шкалу

Ключевые тезисы

  • Функция распределения определена всегда, плотность — не для всех величин.
  • Преобразование величины меняет плотность: появляется множитель-якобиан.
  • Квантиль — обратная функция распределения; на ней держатся доверительные интервалы и VaR.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Преобразование случайной величины

Что происходит с плотностью при замене переменной.

Обозначения
  • истинное значение целевой переменной
  • вероятность события
Пример

Если нормальна, то логнормальна. Именно поэтому логарифмирование скошенной целевой переменной «выпрямляет» её распределение — а обратное преобразование даёт медиану, а не среднее.

2

Квантили и хвостовые оценки

Почему в отчётах всё чаще указывают p95, а не среднее.

Среднее чувствительно к хвостам и на скошенных данных не описывает «типичный» случай. Квантили устойчивы: p50 отвечает на вопрос «как обычно», p95 и p99 — «как бывает плохо».

  • Задержки сервисов всегда описывают перцентилями, потому что распределение имеет тяжёлый правый хвост.
  • Квантильная регрессия (pinball loss) предсказывает выбранный квантиль напрямую.
  • Для оценки квантиля 0.99 нужно ощутимо больше данных, чем для медианы.

Связанные темы

Байесовский подход

Bayesian Inference75%

Байесовский вывод · Теория вероятностей и распределения

Параметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.

Markov Chains75%

Марковские цепи · Теория вероятностей и распределения

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

Beta Distribution75%

Бета-распределение · Теория вероятностей и распределения

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

Conditional Independence75%

Условная независимость · Теория вероятностей и распределения

Две величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.

Probability Axioms75%

Аксиомы вероятности · Теория вероятностей и распределения

Три аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.

Bayes Theorem75%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes75%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Bayesian Optimization75%

Байесовская оптимизация · Практика ML

Строит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.

Probability75%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.