Оценка моделей

A/B testing

A/B-тестирование

актуальноТекущий рабочий стандарт

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

Ключевые тезисы

  • Размер выборки считается до запуска, а не после.
  • Подглядывание в результаты по ходу теста раздувает ошибку I рода.
  • Офлайн-метрика и бизнес-метрика расходятся чаще, чем хотелось бы.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Дизайн эксперимента

Размер выборки, метрика и длительность считаются заранее.

Обозначения
  • стандартное отклонение — разброс величины
  • уровень значимости — допустимая вероятность ложного открытия
  • вероятность ошибки II рода (единица минус мощность)
  • приращение — малое изменение величины
  • число объектов в выборке
— минимальный эффект, который вы хотите различать (MDE)
Пример

Конверсия 5%, хотим заметить прирост в 0.5 п.п. при и мощности 80% — нужно порядка 30 000 пользователей на группу. Если трафика меньше, эксперимент бессмысленно запускать: он не различит такой эффект.

2

Типичные ошибки

Подглядывание, метрики-прокси и нарушение независимости.

  • Подглядывание: остановка теста в момент, когда p < 0.05, увеличивает ошибку I рода в несколько раз. Нужны заранее фиксированный срок или последовательные тесты.
  • Сетевые эффекты: пользователи взаимодействуют между собой (соцсети, маркетплейсы) — независимость нарушена, нужна кластерная рандомизация.
  • Не та метрика: рост CTR при падении выручки — классический результат оптимизации прокси-метрики.
  • Новизна: первые дни поведение меняется просто из-за смены интерфейса; смотрите на стабилизировавшийся период.
На практике

Офлайн-метрика и продуктовый эффект связаны слабо. Прирост ROC-AUC на 0.01 может дать нулевую разницу в деньгах, а иногда и отрицательную.

Связанные темы

Решения в условиях неопределённости · Онлайн-эксперименты · Эксперименты и статистика

Experiment Infrastructure97%

Инфраструктура экспериментов · Системный дизайн ML-сервисов

Механика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.

Hypothesis testing96%

Проверка гипотез · Оценка моделей

Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.

Statistical significance96%

Статистическая значимость · Оценка моделей

Проверка, что разница между моделями не объясняется случайностью выборки.

Binomial & Bernoulli85%

Бернулли и биномиальное · Теория вероятностей и распределения

Один успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.

Central Limit Theorem85%

Центральная предельная теорема · Теория вероятностей и распределения

Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.

Multi-armed Bandits80%

Многорукие бандиты · Обучение с подкреплением

Упрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.

Offline RL80%

Оффлайн RL · Обучение с подкреплением

Обучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.

Beta Distribution80%

Бета-распределение · Теория вероятностей и распределения

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

Bayesian Optimization80%

Байесовская оптимизация · Практика ML

Строит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.

Confidence intervals75%

Доверительные интервалы · Оценка моделей

Показывают точность оценки метрики; одно число без интервала мало о чём говорит.

Bootstrap75%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Ablation studies75%

Абляционные исследования · Оценка моделей

Поочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.

Statistics75%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.