Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.
Ключевые тезисы
- Ошибки I рода (ложное открытие) и II рода (пропуск эффекта).
- Мощность теста зависит от размера эффекта и объёма выборки.
- p-value — не вероятность того, что гипотеза верна.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Схема проверки гипотезы
Пять шагов, одинаковых для любого теста.
- Сформулировать (эффекта нет) и .
- Выбрать уровень значимости до эксперимента.
- Посчитать статистику критерия.
- Получить p-value — вероятность такого или более экстремального результата при верной .
- Сравнить с и сделать вывод — только о , не о «доказанной» .
| Ситуация | Тест |
|---|---|
| Средние двух групп | t-тест (или Манна — Уитни) |
| Доли (конверсии) | z-тест для пропорций, χ² |
| Парные измерения | парный t-тест, Уилкоксон |
| Распределения целиком | Колмогоров — Смирнов |
2Тест МакНемара
Правильный способ сравнить два классификатора на одном тесте.
| B верно | B неверно | |
|---|---|---|
| A верно | ||
| A неверно |
Логика проста: совпадающие ответы ничего не говорят о разнице между моделями. Если из 100 расхождений 70 в пользу A — это уже статистически значимо.
Связанные темы
Онлайн-эксперименты · Эксперименты и статистика
A/B testing96%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Statistical significance96%
Статистическая значимость · Оценка моделейПроверка, что разница между моделями не объясняется случайностью выборки.
Experiment Infrastructure85%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Binomial & Bernoulli85%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Central Limit Theorem85%
Центральная предельная теорема · Теория вероятностей и распределенияСумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Confidence intervals75%
Доверительные интервалы · Оценка моделейПоказывают точность оценки метрики; одно число без интервала мало о чём говорит.
Bootstrap75%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Ablation studies75%
Абляционные исследования · Оценка моделейПоочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.
Statistics75%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.