Проверка, что разница между моделями не объясняется случайностью выборки.
Ключевые тезисы
- Парные тесты на одних и тех же фолдах мощнее независимых.
- Множественные сравнения требуют поправки (Бонферрони, FDR).
- Значимость ≠ практическая важность: смотрите на размер эффекта.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Парное сравнение моделей
Сравнивать нужно на одних и тех же фолдах.
Если обе модели оценены на одинаковых разбиениях, разница метрик по фолдам образует парную выборку. Парный тест мощнее независимого: он убирает вклад «сложности» конкретного фолда.
- Малое число фолдов → используйте перестановочный тест или бутстрэп разницы, а не t-тест.
- Для классификаторов на одном тесте есть тест МакНемара по таблице несовпадений.
- 5x2cv-тест специально сконструирован для сравнения алгоритмов обучения.
2Множественные сравнения
Чем больше моделей вы сравниваете, тем больше ложных находок.
- Бонферрони: сравнивать p-value с — просто и консервативно.
- Бенджамини — Хохберг: контролирует долю ложных открытий, мощнее при большом .
- Практический совет: заранее определите одну главную метрику и одну главную гипотезу.
Связанные темы
Онлайн-эксперименты · Эксперименты и статистика
A/B testing96%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Hypothesis testing96%
Проверка гипотез · Оценка моделейФормальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.
Experiment Infrastructure85%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Binomial & Bernoulli85%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Central Limit Theorem85%
Центральная предельная теорема · Теория вероятностей и распределенияСумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Confidence intervals75%
Доверительные интервалы · Оценка моделейПоказывают точность оценки метрики; одно число без интервала мало о чём говорит.
Bootstrap75%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Ablation studies75%
Абляционные исследования · Оценка моделейПоочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.
Statistics75%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.