Математический справочник

Variance

Дисперсия

актуальноТекущий рабочий стандарт

Мера разброса значений вокруг среднего.

Что означает каждый компонент
  • систематическая ошибка: модель слишком проста для данных (лечится усложнением и бустингом)
  • разброс: модель слишком чувствительна к конкретной выборке (лечится данными, регуляризацией, бэггингом)
  • неустранимый шум данных — предел, ниже которого не опустится никакая модель

Ключевые тезисы

  • Var[X] = E[X²] − (E[X])².
  • Разложение ошибки на bias и variance — центральная идея ML.
  • Ансамблирование снижает именно дисперсию.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Разложение ошибки

Bias–variance как прямое следствие определений.

Обозначения
  • математическое ожидание — среднее по распределению
  • дисперсия — мера разброса значений
  • стандартное отклонение — разброс величины
  • истинное значение целевой переменной
  • вектор или точка пространства признаков
  • функция, о которой идёт речь
  • Bias — систематическая ошибка: модель слишком проста для данных.
  • Variance — чувствительность к конкретной обучающей выборке.
  • $\sigma^2$ — неустранимый шум; ниже него не опустится никакая модель.
-3-113-4-2024xy
степень полинома3
ошибка на train0.568
ошибка на test0.395
диагнозбаланс
Слева высокий bias, справа высокая variance — крайности одной шкалы сложности
2

Почему ансамбли работают

Арифметика снижения дисперсии.

Обозначения
  • дисперсия — мера разброса значений
  • стандартное отклонение — разброс величины
  • суммирование по всем перечисленным элементам

При дисперсия падает в раз; при не падает вовсе. Отсюда весь дизайн ансамблей: бутстрэп, случайные подмножества признаков, разные архитектуры и сиды — всё это способы уменьшить корреляцию между моделями.

-3-113-202xy
моделей в ансамбле5
MSE на обучении0.205
типбустинг (последовательно)
Ансамбль
Бэггинг усредняет независимые модели — сглаживание видно уже на нескольких пнях

Связанные темы

Ансамблирование · Переобучение и регуляризация · Вероятность и информация

Random Forest97%

Случайный лес · Классическое машинное обучение

Бэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.

Stacking and Blending85%

Стекинг и блендинг · Классическое машинное обучение

Ансамбль из разнородных моделей, поверх которых обучается мета-модель. Стандартный приём соревнований и способ выжать последние проценты.

Gradient Boosting85%

Градиентный бустинг · Классическое машинное обучение

Последовательное построение деревьев, каждое из которых исправляет ошибки предыдущего ансамбля.

Cross-validation85%

Кросс-валидация · Оценка моделей

Многократное разбиение выборки, дающее оценку качества вместе с её разбросом.

Regularization80%

Регуляризация · Оптимизация обучения

Любое ограничение сложности модели, снижающее переобучение.

Weight Decay80%

Затухание весов · Оптимизация обучения

Постепенное сжатие весов к нулю на каждом шаге оптимизации.

Early Stopping80%

Ранняя остановка · Оптимизация обучения

Обучение останавливается, когда валидационная метрика перестала улучшаться.

Overfitting80%

Переобучение · Практика ML

Модель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.

Underfitting80%

Недообучение · Практика ML

Модель слишком проста или недоучена: ошибка велика и на train, и на валидации.

Probability70%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Statistics70%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Information Theory70%

Теория информации · Основы

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Probability Distribution70%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

Entropy70%

Энтропия · Математический справочник

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

KL Divergence70%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Bayes Theorem70%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes70%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.