Последовательное построение деревьев, каждое из которых исправляет ошибки предыдущего ансамбля.
- ансамбль после m-й итерации
- то, что уже построено на прошлых шагах — оно не переобучается заново
- скорость обучения: доля, с которой новое дерево входит в ансамбль (обычно 0.01–0.1)
- новое дерево; оно приближает антиградиент потерь — для MSE это просто остатки
Ключевые тезисы
- Каждое дерево аппроксимирует антиградиент функции потерь.
- Learning rate и число деревьев связаны обратно: меньше шаг — больше итераций.
- Стандарт де-факто для табличных задач при наличии достаточного объёма данных.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Последовательное исправление ошибок
Каждое следующее дерево учится на том, что не смогли предыдущие.
- истинное значение целевой переменной
- объект: вектор признаков
- функция потерь — то, что минимизируется при обучении
- частная производная — чувствительность к одному аргументу
Для MSE антиградиент — это просто остаток , поэтому первое объяснение бустинга всегда звучит как «второе дерево предсказывает ошибку первого». Для других функций потерь вместо остатка стоит их градиент.
, среднее . Остатки: . Первое дерево предсказывает их приближённо, скажем . При новый ответ: , остатки уменьшились до .
2Главные гиперпараметры
Что крутить в первую очередь и как они связаны друг с другом.
| Параметр | Эффект | Типичные значения |
|---|---|---|
| learning_rate ν | вклад каждого дерева | 0.01–0.1 |
| n_estimators | число деревьев | подбирается по early stopping |
| max_depth | сложность базовой модели | 3–8 |
| subsample | доля объектов на дерево | 0.7–1.0 |
| colsample | доля признаков на дерево | 0.7–1.0 |
ν и число деревьев связаны обратно: уменьшили шаг вдвое — увеличивайте число деревьев примерно вдвое. Практика: зафиксировать небольшой ν, поставить заведомо большое число деревьев и остановиться по валидации.
3Бустинг и разложение ошибки
Почему бустинг бьёт по смещению, а бэггинг — по разбросу.
- дисперсия — мера разброса значений
- стандартное отклонение — разброс величины
- объект: вектор признаков
- Бэггинг берёт глубокие деревья (малое смещение, большой разброс) и усредняет — падает Var.
- Бустинг берёт неглубокие деревья (большое смещение, малый разброс) и складывает — падает Bias.
- Поэтому бустинг переобучается при слишком большом числе итераций, а случайный лес — почти нет.
Связанные темы
Ансамблирование · Деревья и ансамбли
Random Forest98%
Случайный лес · Классическое машинное обучениеБэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.
Stacking and Blending85%
Стекинг и блендинг · Классическое машинное обучениеАнсамбль из разнородных моделей, поверх которых обучается мета-модель. Стандартный приём соревнований и способ выжать последние проценты.
Variance85%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Cross-validation85%
Кросс-валидация · Оценка моделейМногократное разбиение выборки, дающее оценку качества вместе с её разбросом.
Decision Trees85%
Решающие деревья · Классическое машинное обучениеПоследовательность вопросов «признак > порог», разбивающая пространство на прямоугольные области.
XGBoost85%
XGBoost · Классическое машинное обучениеРеализация бустинга с регуляризацией в функции потерь, вторым порядком оптимизации и продуманной работой с разреженностью.
LightGBM85%
LightGBM · Классическое машинное обучениеБыстрый бустинг от Microsoft: гистограммное разбиение и рост дерева по листьям вместо по уровням.
CatBoost85%
CatBoost · Классическое машинное обучениеБустинг от Яндекса с упорядоченным кодированием категорий и упорядоченным бустингом против смещения.
SHAP85%
SHAP · Интерпретируемость моделейРаспределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.
Encoding85%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.