Probability & Distributions
Теория вероятностей и распределения
Отдельный разбор распределений: какое из них когда возникает, какие у них хвосты и что это значит для метрик, порогов и прогнозов. Нормальное распределение здесь соседствует со степенным — и это соседство объясняет половину сюрпризов в реальных данных.
Probability Axiomsактуально
Аксиомы вероятностиТри аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.
Random Variablesактуально
Случайные величиныОтображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.
Conditional Independenceактуально
Условная независимостьДве величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.
Law of Large Numbersактуально
Закон больших чиселСреднее по выборке сходится к математическому ожиданию при росте числа наблюдений.
Central Limit Theoremактуально
Центральная предельная теоремаСумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Bayes Theoremактуально
Теорема Байесаиз «Математический справочник»Правило пересчёта вероятности гипотезы после получения новых данных.
Varianceактуально
Дисперсияиз «Математический справочник»Мера разброса значений вокруг среднего.
Normal Distributionактуально
Нормальное распределениеКолоколообразное распределение с двумя параметрами. Максимально энтропийное при заданных среднем и дисперсии — поэтому его берут «по умолчанию».
Log-normal Distributionактуально
Логнормальное распределениеВеличина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.
Power Lawактуально
Степенное распределениеПлотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.
Poisson Distributionактуально
Распределение ПуассонаЧисло редких независимых событий за фиксированный интервал: заказы за час, отказы за сутки, клики за сессию.
Exponential Distributionактуально
Экспоненциальное распределениеВремя между пуассоновскими событиями. Единственное непрерывное распределение без памяти.
Binomial & Bernoulliактуально
Бернулли и биномиальноеОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Beta Distributionактуально
Бета-распределениеРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
Heavy Tailsактуально
Тяжёлые хвостыРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Extreme Value Theoryактуально
Теория экстремальных значенийАппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.
Markov Chainsактуально
Марковские цепиПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
Self-similarityактуально
Самоподобиеиз «Динамические системы и фракталы»Свойство структуры повторять себя на разных масштабах — точно или статистически.
Bayesian Inferenceактуально
Байесовский выводПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
Log Lossактуально
Логарифмические потерииз «Метрики»Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
A/B testingактуально
A/B-тестированиеиз «Оценка моделей»Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Naive Bayesклассика
Наивный байесовский классификаториз «Классическое машинное обучение»Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.