Предсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.
- предсказание модели — то число, которое она выдаёт на выходе
- свободный член: значение предсказания, когда все признаки равны нулю
- вклад j-го признака: вес умножается на значение признака и складывается с остальными
Ключевые тезисы
- Обучается методом наименьших квадратов: аналитически или градиентным спуском.
- Ridge (L2) и Lasso (L1) стабилизируют коэффициенты при мультиколлинеарности.
- Коэффициент читается как «эффект признака при прочих равных».
Подробный разбор
4 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Модель и её геометрия
Предсказание как взвешенная сумма признаков.
- предсказание модели
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- транспонирование: строка вместо столбца
Для одного признака это прямая, для двух — плоскость, для признаков — гиперплоскость. Вес читается так: «при увеличении на единицу и неизменных остальных признаках предсказание меняется на ».
Модель . Каждый год стажа добавляет 8 000 при том же числе часов; каждый час — 300.
2Обучение: аналитика против градиента
Два способа получить веса и когда какой применим.
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- число объектов в выборке
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
- транспонирование: строка вместо столбца
- истинное значение целевой переменной
- веса модели — то, что подбирается при обучении
- транспонирование: строка вместо столбца
- Аналитическое решение требует обращения матрицы — это ; при в тысячи становится дорого, при вырожденной — невозможно.
- Градиентный спуск масштабируется на любые и и работает потоково, но требует настройки шага.
- Ridge исправляет вырожденность: — матрица всегда обратима.
3Предпосылки и диагностика
Что должно быть верно, чтобы коэффициентам можно было верить.
- Линейность связи: проверяется графиком остатков против предсказаний — там не должно быть структуры.
- Гомоскедастичность: разброс остатков одинаков по всему диапазону; «воронка» означает, что нужно логарифмировать цель.
- Отсутствие мультиколлинеарности: VIF > 10 говорит, что коэффициенты нестабильны и интерпретировать их нельзя.
- Независимость наблюдений: для временных рядов почти всегда нарушена.
Даже при нарушенных предпосылках предсказания могут быть неплохими — страдает именно интерпретация коэффициентов и их доверительные интервалы.
4Ridge, Lasso и ElasticNet
Три способа не дать коэффициентам разъехаться.
- сила регуляризации
- истинное значение целевой переменной
- веса модели — то, что подбирается при обучении
- функция потерь — то, что минимизируется при обучении
- норма — длина вектора
L2 сжимает все коэффициенты пропорционально и хорошо работает при коррелированных признаках. L1 благодаря «углам» своего шара обнуляет часть коэффициентов и тем самым отбирает признаки. ElasticNet комбинирует оба штрафа.
Связанные темы
Качество регрессии
MAE80%
Средняя абсолютная ошибка · МетрикиСреднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.
MSE80%
Среднеквадратичная ошибка · МетрикиСреднее квадратов ошибок: сильно штрафует большие отклонения.
RMSE80%
Корень из среднеквадратичной ошибки · МетрикиКорень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.
MAPE80%
Средняя абсолютная процентная ошибка · МетрикиОтносительная ошибка в процентах — удобна для сравнения рядов разного масштаба.
SMAPE80%
Симметричная MAPE · МетрикиВариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.
R²80%
Коэффициент детерминации · МетрикиДоля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.
Adjusted R²80%
Скорректированный R² · МетрикиR² со штрафом за число признаков — падает, если новый признак не приносит пользы.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.