Показывают точность оценки метрики; одно число без интервала мало о чём говорит.
- точечная оценка — то самое число, которое вы посчитали на тесте
- квантиль нормального распределения для 95% уровня доверия
- стандартная ошибка: падает как корень из объёма выборки. Вчетверо больше данных — вдвое уже интервал
Ключевые тезисы
- Ширина интервала падает примерно как 1/√n.
- Пересекающиеся интервалы двух моделей — повод не спешить с выводами.
- Бутстрэп-интервалы работают там, где аналитическая формула недоступна.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как построить интервал для метрики
Аналитически, бутстрэпом или по фолдам.
- оценка параметра по выборке
- стандартное отклонение — разброс величины
- параметры модели
- число объектов в выборке
Для метрик со сложным распределением (AUC, F1, NDCG) надёжнее бутстрэп-интервал по перцентилям. Для оценки по кросс-валидации интервал строят по разбросу фолдов, помня, что фолды не независимы.
Правило большого пальца: ширина интервала падает как . Чтобы сузить интервал вдвое, нужно вчетверо больше тестовых данных — иногда это дешевле, чем месяц улучшений модели.
2Сколько нужно тестовых данных
Обратная задача: от желаемой точности к размеру выборки.
- стандартное отклонение — разброс величины
- число объектов в выборке
Хотим оценить accuracy с точностью ±1 п.п. при ожидаемом значении около 0.9: , значит объектов.
Это часто вскрывает неприятную правду: тест на 300 объектов не способен различить модели, отличающиеся на 2 процентных пункта.
Связанные темы
Предельные теоремы · Эксперименты и статистика
Bootstrap95%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Statistics95%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Law of Large Numbers80%
Закон больших чисел · Теория вероятностей и распределенияСреднее по выборке сходится к математическому ожиданию при росте числа наблюдений.
Central Limit Theorem80%
Центральная предельная теорема · Теория вероятностей и распределенияСумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Heavy Tails80%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Series and Convergence80%
Ряды и сходимость · Математический анализКогда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.
Limits and Continuity80%
Пределы и непрерывность · Математический анализПредел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.
Statistical significance75%
Статистическая значимость · Оценка моделейПроверка, что разница между моделями не объясняется случайностью выборки.
Hypothesis testing75%
Проверка гипотез · Оценка моделейФормальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.
A/B testing75%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Ablation studies75%
Абляционные исследования · Оценка моделейПоочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.