Оптимизация обучения

Regularization

Регуляризация

актуальноТекущий рабочий стандарт

Любое ограничение сложности модели, снижающее переобучение.

Ключевые тезисы

  • L1 обнуляет коэффициенты и отбирает признаки, L2 их равномерно сжимает.
  • Dropout случайно отключает нейроны, имитируя ансамбль.
  • Аугментация данных — самая мощная форма регуляризации.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

L1 и L2: геометрия штрафа

Почему один штраф обнуляет коэффициенты, а другой нет.

Обозначения
  • сила регуляризации: штраф за сложность модели
  • веса модели — то, что подбирается при обучении
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам

Ограничение задаёт ромб с углами на осях, а — круг. Линии уровня функции потерь чаще касаются ромба именно в углу, где часть координат равна нулю — отсюда разреженность решения Lasso.

-202-303xy
λ1.0e-4
‖w‖₂4.054
нулевых коэффициентов0 из 9
Тип
Переключите L1/L2 и увеличьте λ: у Lasso растёт число нулевых коэффициентов, у Ridge — нет
2

Dropout, аугментация и другие способы

Регуляризация — это не только штраф на веса.

  • Dropout: во время обучения каждый нейрон отключается с вероятностью ; сеть вынуждена не полагаться на отдельные признаки. На инференсе выключается.
  • Аугментация данных — самый сильный метод в CV и аудио: модель видит новые варианты одного и того же объекта.
  • Label smoothing: вместо цели 1.0 используют 0.9 — модель перестаёт быть переуверенной.
  • Early stopping — регуляризация по времени обучения.
  • Ансамблирование — усреднение снижает разброс.
На практике

Порядок действий при переобучении: сначала больше данных и аугментаций, затем более простая модель, затем dropout / weight decay, и только потом тонкая настройка коэффициентов.

Связанные темы

Переобучение и регуляризация