Метрики

Коэффициент детерминации

актуальноТекущий рабочий стандарт

Доля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.

Что означает каждый компонент
  • ошибка вашей модели — сумма квадратов остатков
  • ошибка простейшего прогноза средним. Отношение показывает, во сколько раз модель лучше константы
R² = 1 — идеально, 0 — как среднее, меньше нуля — хуже среднего

Ключевые тезисы

  • 1 — идеал, 0 — уровень среднего, отрицательные значения хуже среднего.
  • Растёт при добавлении любых признаков, даже бесполезных.
  • Не сравним между разными датасетами.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Что означает R²

Сравнение модели с самым простым бейзлайном.

Обозначения
  • предсказание модели
  • истинное значение целевой переменной
  • суммирование по всем перечисленным элементам
  • — идеальное предсказание; — модель не лучше константы; — хуже среднего.
  • На train у линейной регрессии не может убывать при добавлении признаков — даже случайных.
  • Между разными датасетами несравним: он зависит от дисперсии цели.
Пример

SGD-регрессор без масштабирования признаков легко даёт — это не «плохая модель», а расходимость обучения. Признак того, что забыли StandardScaler.

2

Как неправильно читают R²

Три частых заблуждения.

  • « — значит модель хорошая». Не обязательно: при почти постоянной цели даже слабая модель даст высокий .
  • « на train и test сравнимы». Сравнивать нужно с одинаковой дисперсией цели; разные тестовые выборки дают несопоставимые значения.
  • « — ошибка в коде». Не всегда: это просто означает, что модель хуже среднего — например, при экстраполяции.

Связанные темы

Качество регрессии

MAE80%

Средняя абсолютная ошибка · Метрики

Среднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.

MSE80%

Среднеквадратичная ошибка · Метрики

Среднее квадратов ошибок: сильно штрафует большие отклонения.

RMSE80%

Корень из среднеквадратичной ошибки · Метрики

Корень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.

MAPE80%

Средняя абсолютная процентная ошибка · Метрики

Относительная ошибка в процентах — удобна для сравнения рядов разного масштаба.

SMAPE80%

Симметричная MAPE · Метрики

Вариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.

Adjusted R²80%

Скорректированный R² · Метрики

R² со штрафом за число признаков — падает, если новый признак не приносит пользы.

Linear Regression80%

Линейная регрессия · Классическое машинное обучение

Предсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.