Постепенное сжатие весов к нулю на каждом шаге оптимизации.
Ключевые тезисы
- Эквивалентно L2-регуляризации в классическом SGD.
- В адаптивных методах требует отдельной реализации — см. AdamW.
- Обычно не применяется к bias и параметрам нормализации.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Механика и отличие от L2
Одно и то же в SGD и разные вещи в Adam.
- скорость обучения — длина шага оптимизатора
- сила регуляризации: штраф за сложность модели
- веса модели — то, что подбирается при обучении
В чистом SGD это в точности эквивалентно добавлению к функции потерь. В адаптивных методах эквивалентность ломается — поэтому и существует AdamW.
- Типичные значения: для свёрточных сетей, – для трансформеров.
- Не применяется к bias, embedding-таблицам и параметрам нормализации.
2Подбор коэффициента
Как понять, что decay слишком велик или мал.
| Симптом | Вероятная причина |
|---|---|
| train и val ошибки обе высоки | decay слишком велик — модель зажата |
| большой разрыв train/val | decay мал — нужна регуляризация |
| нормы весов растут без остановки | decay отсутствует или обнулён по ошибке |
Полезно логировать среднюю норму весов по слоям: она должна выходить на плато. Растущая норма при стабильных потерях — признак, что регуляризация не работает.
Связанные темы
Переобучение и регуляризация
Regularization80%
Регуляризация · Оптимизация обученияЛюбое ограничение сложности модели, снижающее переобучение.
Early Stopping80%
Ранняя остановка · Оптимизация обученияОбучение останавливается, когда валидационная метрика перестала улучшаться.
Overfitting80%
Переобучение · Практика MLМодель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.
Underfitting80%
Недообучение · Практика MLМодель слишком проста или недоучена: ошибка велика и на train, и на валидации.
Variance80%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Random Forest80%
Случайный лес · Классическое машинное обучениеБэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.