Классическое машинное обучение

Linear Regression

Линейная регрессия

актуальноТекущий рабочий стандарт

Предсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.

Что означает каждый компонент
  • предсказание модели — то число, которое она выдаёт на выходе
  • свободный член: значение предсказания, когда все признаки равны нулю
  • вклад j-го признака: вес умножается на значение признака и складывается с остальными
Предсказание — взвешенная сумма признаков плюс сдвиг

Ключевые тезисы

  • Обучается методом наименьших квадратов: аналитически или градиентным спуском.
  • Ridge (L2) и Lasso (L1) стабилизируют коэффициенты при мультиколлинеарности.
  • Коэффициент читается как «эффект признака при прочих равных».

Подробный разбор

4 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Модель и её геометрия

Предсказание как взвешенная сумма признаков.

Обозначения
  • предсказание модели
  • истинное значение целевой переменной
  • объект: вектор признаков
  • веса модели — то, что подбирается при обучении
  • транспонирование: строка вместо столбца
Один вес на признак плюс свободный член

Для одного признака это прямая, для двух — плоскость, для признаков — гиперплоскость. Вес читается так: «при увеличении на единицу и неизменных остальных признаках предсказание меняется на ».

Зарплата по стажу

Модель . Каждый год стажа добавляет 8 000 при том же числе часов; каждый час — 300.

2

Обучение: аналитика против градиента

Два способа получить веса и когда какой применим.

Обозначения
  • истинное значение целевой переменной
  • объект: вектор признаков
  • веса модели — то, что подбирается при обучении
  • число объектов в выборке
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • транспонирование: строка вместо столбца
Обозначения
  • истинное значение целевой переменной
  • веса модели — то, что подбирается при обучении
  • транспонирование: строка вместо столбца
Нормальное уравнение: точное решение за один шаг
  • Аналитическое решение требует обращения матрицы — это ; при в тысячи становится дорого, при вырожденной — невозможно.
  • Градиентный спуск масштабируется на любые и и работает потоково, но требует настройки шага.
  • Ridge исправляет вырожденность: — матрица всегда обратима.
-6-226100204060wL(w)минимум
шаг обучения η0.20
текущий x1.767
f(x)1.054
градиент-0.467
статусидёт
Функция потерь MSE выпукла: спуск из любой точки приходит в один и тот же минимум — если шаг не слишком велик
3

Предпосылки и диагностика

Что должно быть верно, чтобы коэффициентам можно было верить.

  • Линейность связи: проверяется графиком остатков против предсказаний — там не должно быть структуры.
  • Гомоскедастичность: разброс остатков одинаков по всему диапазону; «воронка» означает, что нужно логарифмировать цель.
  • Отсутствие мультиколлинеарности: VIF > 10 говорит, что коэффициенты нестабильны и интерпретировать их нельзя.
  • Независимость наблюдений: для временных рядов почти всегда нарушена.
На практике

Даже при нарушенных предпосылках предсказания могут быть неплохими — страдает именно интерпретация коэффициентов и их доверительные интервалы.

4

Ridge, Lasso и ElasticNet

Три способа не дать коэффициентам разъехаться.

Обозначения
  • сила регуляризации
  • истинное значение целевой переменной
  • веса модели — то, что подбирается при обучении
  • функция потерь — то, что минимизируется при обучении
  • норма — длина вектора

L2 сжимает все коэффициенты пропорционально и хорошо работает при коррелированных признаках. L1 благодаря «углам» своего шара обнуляет часть коэффициентов и тем самым отбирает признаки. ElasticNet комбинирует оба штрафа.

-202-303xy
λ1.0e-4
‖w‖₂4.054
нулевых коэффициентов0 из 9
Тип
Переключите L1/L2 и увеличивайте λ: посмотрите, как у Lasso коэффициенты обнуляются, а у Ridge просто сжимаются

Связанные темы

Качество регрессии

MAE80%

Средняя абсолютная ошибка · Метрики

Среднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.

MSE80%

Среднеквадратичная ошибка · Метрики

Среднее квадратов ошибок: сильно штрафует большие отклонения.

RMSE80%

Корень из среднеквадратичной ошибки · Метрики

Корень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.

MAPE80%

Средняя абсолютная процентная ошибка · Метрики

Относительная ошибка в процентах — удобна для сравнения рядов разного масштаба.

SMAPE80%

Симметричная MAPE · Метрики

Вариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.

80%

Коэффициент детерминации · Метрики

Доля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.

Adjusted R²80%

Скорректированный R² · Метрики

R² со штрафом за число признаков — падает, если новый признак не приносит пользы.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.