Оценка моделей

Hypothesis testing

Проверка гипотез

актуальноТекущий рабочий стандарт

Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.

Ключевые тезисы

  • Ошибки I рода (ложное открытие) и II рода (пропуск эффекта).
  • Мощность теста зависит от размера эффекта и объёма выборки.
  • p-value — не вероятность того, что гипотеза верна.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Схема проверки гипотезы

Пять шагов, одинаковых для любого теста.

  1. Сформулировать (эффекта нет) и .
  2. Выбрать уровень значимости до эксперимента.
  3. Посчитать статистику критерия.
  4. Получить p-value — вероятность такого или более экстремального результата при верной .
  5. Сравнить с и сделать вывод — только о , не о «доказанной» .
СитуацияТест
Средние двух группt-тест (или Манна — Уитни)
Доли (конверсии)z-тест для пропорций, χ²
Парные измеренияпарный t-тест, Уилкоксон
Распределения целикомКолмогоров — Смирнов
2

Тест МакНемара

Правильный способ сравнить два классификатора на одном тесте.

B верноB неверно
A верно
A неверно
Важны только объекты, где модели разошлись

Логика проста: совпадающие ответы ничего не говорят о разнице между моделями. Если из 100 расхождений 70 в пользу A — это уже статистически значимо.

Связанные темы

Онлайн-эксперименты · Эксперименты и статистика

A/B testing96%

A/B-тестирование · Оценка моделей

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

Statistical significance96%

Статистическая значимость · Оценка моделей

Проверка, что разница между моделями не объясняется случайностью выборки.

Experiment Infrastructure85%

Инфраструктура экспериментов · Системный дизайн ML-сервисов

Механика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.

Binomial & Bernoulli85%

Бернулли и биномиальное · Теория вероятностей и распределения

Один успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.

Central Limit Theorem85%

Центральная предельная теорема · Теория вероятностей и распределения

Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.

Confidence intervals75%

Доверительные интервалы · Оценка моделей

Показывают точность оценки метрики; одно число без интервала мало о чём говорит.

Bootstrap75%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Ablation studies75%

Абляционные исследования · Оценка моделей

Поочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.

Statistics75%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.