Глубокое обучение

Loss functions

Функции потерь

актуальноТекущий рабочий стандарт

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Ключевые тезисы

  • MSE и MAE для регрессии, кросс-энтропия для классификации, Huber как компромисс.
  • Focal loss и веса классов борются с сильным дисбалансом.
  • Контрастные потери (InfoNCE, triplet) учат пространство представлений, а не метку.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как выбрать функцию потерь

Соответствие задаче важнее любых архитектурных ухищрений.

ЗадачаПотериКомментарий
РегрессияMSE / MAE / HuberMAE устойчивее к выбросам
Бинарная классификацияBCE (log loss)используйте версию с логитами
МногоклассоваяCross-Entropyвключает softmax внутри
Сильный дисбалансFocal lossснижает вклад лёгких примеров
Метрическое обучениеTriplet, InfoNCEучит пространство, а не метку
-3-1130246ошибка y − ŷпотериMSEMAEHuber
MSE4.00
MAE2.00
Huber1.50
Задача
Переключите задачу и посмотрите, как по-разному штрафуются ошибки
2

Дисбаланс и focal loss

Когда 99% объектов — лёгкий отрицательный класс.

Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • коэффициент, управляющий вкладом дальних членов
  • вероятность (или плотность распределения)
  • логарифм: превращает произведения в суммы и сжимает масштаб
Множитель почти обнуляет вклад примеров, которые модель уже уверенно решает

При формула вырождается в обычную кросс-энтропию. Типичное значение : лёгкий пример с получает вес в 100 раз меньше, чем трудный с .

Связанные темы

Редкие классы и события · Нейросеть по кирпичикам · Качество регрессии

Imbalanced Data80%

Дисбаланс классов · Данные

Когда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.

Isolation Forest80%

Isolation Forest · Классическое машинное обучение

Обнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.

Anomaly Detection80%

Поиск аномалий · Обучение без учителя

Выделение объектов, не похожих на основную массу данных, при отсутствии меток.

PR-AUC80%

PR-AUC · Метрики

Площадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.

MCC80%

Коэффициент Мэтьюса · Метрики

Корреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.

Extreme Value Theory80%

Теория экстремальных значений · Теория вероятностей и распределения

Аппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.

Perceptron80%

Перцептрон · Глубокое обучение

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

MLP80%

Многослойный перцептрон · Глубокое обучение

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

Activation functions80%

Функции активации · Глубокое обучение

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Optimizers80%

Оптимизаторы · Глубокое обучение

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Logistic Regression80%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

MAE80%

Средняя абсолютная ошибка · Метрики

Среднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.

MSE80%

Среднеквадратичная ошибка · Метрики

Среднее квадратов ошибок: сильно штрафует большие отклонения.

RMSE80%

Корень из среднеквадратичной ошибки · Метрики

Корень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.

MAPE80%

Средняя абсолютная процентная ошибка · Метрики

Относительная ошибка в процентах — удобна для сравнения рядов разного масштаба.

SMAPE80%

Симметричная MAPE · Метрики

Вариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.

80%

Коэффициент детерминации · Метрики

Доля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.

Adjusted R²80%

Скорректированный R² · Метрики

R² со штрафом за число признаков — падает, если новый признак не приносит пользы.

Linear Regression80%

Линейная регрессия · Классическое машинное обучение

Предсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.