Глубокое обучение

Normalization Layers

Слои нормализации

актуальноТекущий рабочий стандарт

BatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.

Ключевые тезисы

  • BatchNorm зависит от размера батча и плохо работает при батче 1–2 и в рекуррентных сетях.
  • LayerNorm нормирует по признакам одного объекта — стандарт трансформеров.
  • RMSNorm убирает вычитание среднего и работает быстрее при том же качестве.
Тема также относится к главам:Оптимизация обученияСтабильность обучения

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Чем отличаются

По какой оси считается статистика.

СлойСтатистика поГде применяется
BatchNormбатчу для каждого каналасвёрточные сети
LayerNormпризнакам одного объектатрансформеры, RNN
GroupNormгруппе каналовмалые батчи в CV
RMSNormнорме без вычитания среднегосовременные LLM
На практике

BatchNorm ведёт себя по-разному на обучении и инференсе (там используются накопленные статистики) — это источник классических багов при экспорте модели.

2

Почему это помогает

Не только «сдвиг ковариат».

Изначальное объяснение через internal covariate shift оказалось неполным. Сегодня основной эффект связывают со сглаживанием ландшафта потерь: нормализация делает поверхность более предсказуемой, что позволяет брать больший learning rate.

  • Позволяет обучать глубокие сети без тщательной настройки инициализации.
  • BatchNorm даёт побочный регуляризующий эффект за счёт шума батча.
  • Pre-norm (нормализация до подслоя) в трансформерах устойчивее post-norm при большой глубине.

Связанные темы

Стабильность обучения нейросетей