Основы

Statistics

Статистика

актуальноТекущий рабочий стандарт

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Ключевые тезисы

  • Смещение и дисперсия оценки — тот же компромисс, что и bias–variance в машинном обучении.
  • Доверительный интервал говорит о точности оценки, а p-value — о совместимости данных с нулевой гипотезой.
  • Статистика даёт инструменты для честного сравнения моделей и A/B-тестов.

Подробный разбор

3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Оценки: от выборки к генеральной совокупности

Почему среднее по 100 наблюдениям — это не «истина», а случайная величина.

Мы никогда не видим всю совокупность — только выборку. Любая статистика, посчитанная по выборке (среднее, доля, AUC модели), сама случайна: на другой выборке она была бы другой. Хорошая оценка несмещена () и имеет малый разброс.

Обозначения
  • дисперсия — мера разброса значений
  • стандартное отклонение — разброс величины
  • среднее значение
  • объект или аргумент функции
  • число объектов в выборке
  • суммирование по всем перечисленным элементам
Точность среднего растёт как : чтобы удвоить точность, нужно вчетверо больше данных
Пример

Модель показала ROC-AUC 0.81 на тесте из 500 объектов. Бутстрэп даёт 95%-й интервал примерно . Значит, конкурирующая модель с AUC 0.83 не обязательно лучше — разница внутри шума.

2

Проверка гипотез и p-value

Что на самом деле означает «результат статистически значим».

Формулируется нулевая гипотеза («разницы нет»), считается статистика, и оценивается: насколько вероятно получить такие или более экстремальные данные, если верна. Эта вероятность и есть p-value.

  • p-value — это не вероятность того, что гипотеза верна, и не размер эффекта.
  • Ошибка I рода — «нашли эффект, которого нет»; уровень (обычно 0.05) её контролирует.
  • Ошибка II рода — «не заметили реальный эффект»; её контролирует мощность, зависящая от размера выборки.
  • 20 проверок подряд при дают в среднем одно ложное открытие — нужна поправка на множественные сравнения.
На практике

В A/B-тестах самая частая ошибка — «подглядывание»: смотреть результат каждый день и остановиться, как только p < 0.05. Так уровень ошибки I рода вырастает в разы. Размер выборки считается заранее.

3

Форма распределения и выбор метрики

Среднее, медиана и хвосты: почему для зарплат нельзя брать MSE.

У симметричных распределений среднее и медиана совпадают. У скошенных (доходы, длительность сессий, цены) среднее уезжает в хвост. Метрика, оптимальная для среднего (MSE), в этом случае заставит модель систематически завышать прогноз.

Свойство данныхЧто выбрать
Симметричные, без выбросовMSE / RMSE, оптимум — среднее
Тяжёлые хвосты, выбросыMAE (оптимум — медиана) или Huber
Логнормальная цель (цены, доходы)логарифмирование цели, затем RMSE
Счётные данные (число заказов)распределение Пуассона, Poisson loss
-3-1130246ошибка y − ŷпотериMSEMAEHuber
MSE4.00
MAE2.00
Huber1.50
Задача
Сравните, как MSE, MAE и Huber штрафуют большую ошибку — переключите δ и посмотрите на переход между режимами

Связанные темы

Предельные теоремы · Вероятность и информация · Эксперименты и статистика

Confidence intervals95%

Доверительные интервалы · Оценка моделей

Показывают точность оценки метрики; одно число без интервала мало о чём говорит.

Bootstrap95%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Law of Large Numbers80%

Закон больших чисел · Теория вероятностей и распределения

Среднее по выборке сходится к математическому ожиданию при росте числа наблюдений.

Central Limit Theorem80%

Центральная предельная теорема · Теория вероятностей и распределения

Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.

Heavy Tails80%

Тяжёлые хвосты · Теория вероятностей и распределения

Распределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.

Series and Convergence80%

Ряды и сходимость · Математический анализ

Когда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.

Limits and Continuity80%

Пределы и непрерывность · Математический анализ

Предел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.

Statistical significance75%

Статистическая значимость · Оценка моделей

Проверка, что разница между моделями не объясняется случайностью выборки.

Hypothesis testing75%

Проверка гипотез · Оценка моделей

Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.

A/B testing75%

A/B-тестирование · Оценка моделей

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

Ablation studies75%

Абляционные исследования · Оценка моделей

Поочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.

Probability70%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Information Theory70%

Теория информации · Основы

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Probability Distribution70%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Variance70%

Дисперсия · Математический справочник

Мера разброса значений вокруг среднего.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

Entropy70%

Энтропия · Математический справочник

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

KL Divergence70%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Bayes Theorem70%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes70%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.