Закон, задающий вероятности значений случайной величины.
Ключевые тезисы
- Дискретные: Бернулли, биномиальное, Пуассона; непрерывные: нормальное, экспоненциальное.
- Нормальное распределение возникает из центральной предельной теоремы.
- Выбор распределения ошибки эквивалентен выбору функции потерь.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Распределения, которые встречаются чаще всего
И функции потерь, которые из них следуют.
| Распределение | Параметры | Функция потерь |
|---|---|---|
| Нормальное | MSE | |
| Лапласа | MAE | |
| Бернулли | бинарная кросс-энтропия | |
| Категориальное | кросс-энтропия | |
| Пуассона | Poisson loss |
Связь простая: минимизация функции потерь = максимизация правдоподобия при соответствующем предположении о шуме. Выбирая метрику, вы неявно выбираете модель шума.
2Сэмплирование и генерация
Как получить объект из распределения.
- Inverse CDF: применить обратную функцию распределения к равномерной величине.
- Reparameterization: — используется в VAE, потому что дифференцируемо.
- MCMC: когда плотность известна с точностью до константы.
- Gumbel-softmax: дифференцируемая замена сэмплированию из категориального распределения.
Связанные темы
Распределения и их хвосты · Вероятность и информация
Probability94%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Normal Distribution80%
Нормальное распределение · Теория вероятностей и распределенияКолоколообразное распределение с двумя параметрами. Максимально энтропийное при заданных среднем и дисперсии — поэтому его берут «по умолчанию».
Log-normal Distribution80%
Логнормальное распределение · Теория вероятностей и распределенияВеличина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.
Power Law80%
Степенное распределение · Теория вероятностей и распределенияПлотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.
Poisson Distribution80%
Распределение Пуассона · Теория вероятностей и распределенияЧисло редких независимых событий за фиксированный интервал: заказы за час, отказы за сутки, клики за сессию.
Exponential Distribution80%
Экспоненциальное распределение · Теория вероятностей и распределенияВремя между пуассоновскими событиями. Единственное непрерывное распределение без памяти.
Binomial & Bernoulli80%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Beta Distribution80%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
Heavy Tails80%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Statistics70%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Information Theory70%
Теория информации · ОсновыИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Variance70%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
KL Divergence70%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Bayes Theorem70%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes70%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.