Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
- априорные «успехи» плюс наблюдённые успехи
- априорные «неудачи» плюс наблюдённые. Обновление апостериорного — просто сложение счётчиков
Ключевые тезисы
- Сопряжённое к биномиальному: апостериорное распределение снова бета, параметры просто прибавляются.
- Thompson sampling сэмплирует из беты и решает задачу exploration/exploitation.
- Позволяет корректно сравнивать конверсии при малом числе наблюдений.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Сопряжённость с биномиальным
Обновление априора одной строкой.
- показатель степенного закона: чем он меньше, тем тяжелее хвост
- коэффициент сглаживания (инерции)
- число наблюдений или испытаний
- число наблюдённых событий или успехов
- сходимость: выражение слева стремится к тому, что справа
Это делает байесовскую оценку конверсии практически бесплатной: не нужен ни MCMC, ни оптимизация — параметры просто прибавляются.
2Thompson sampling
Многорукие бандиты в четыре строки.
for t in range(T):
theta = [np.random.beta(1 + s[i], 1 + f[i]) for i in range(K)]
arm = int(np.argmax(theta))
reward = pull(arm)
s[arm] += reward; f[arm] += 1 - rewardТакой подход часто лучше классического A/B-теста там, где важно минимизировать потери во время эксперимента: трафик автоматически перетекает к лучшему варианту.
Связанные темы
Решения в условиях неопределённости · Распределения и их хвосты · Байесовский подход
Bayesian Optimization95%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.
Probability95%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Multi-armed Bandits80%
Многорукие бандиты · Обучение с подкреплениемУпрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.
Offline RL80%
Оффлайн RL · Обучение с подкреплениемОбучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.
A/B testing80%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Experiment Infrastructure80%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Normal Distribution80%
Нормальное распределение · Теория вероятностей и распределенияКолоколообразное распределение с двумя параметрами. Максимально энтропийное при заданных среднем и дисперсии — поэтому его берут «по умолчанию».
Log-normal Distribution80%
Логнормальное распределение · Теория вероятностей и распределенияВеличина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.
Power Law80%
Степенное распределение · Теория вероятностей и распределенияПлотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.
Poisson Distribution80%
Распределение Пуассона · Теория вероятностей и распределенияЧисло редких независимых событий за фиксированный интервал: заказы за час, отказы за сутки, клики за сессию.
Exponential Distribution80%
Экспоненциальное распределение · Теория вероятностей и распределенияВремя между пуассоновскими событиями. Единственное непрерывное распределение без памяти.
Binomial & Bernoulli80%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Heavy Tails80%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Probability Distribution80%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Bayesian Inference75%
Байесовский вывод · Теория вероятностей и распределенияПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
Markov Chains75%
Марковские цепи · Теория вероятностей и распределенияПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
Conditional Independence75%
Условная независимость · Теория вероятностей и распределенияДве величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.
Probability Axioms75%
Аксиомы вероятности · Теория вероятностей и распределенияТри аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.
Random Variables75%
Случайные величины · Теория вероятностей и распределенияОтображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.
Bayes Theorem75%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes75%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.