BatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.
Ключевые тезисы
- BatchNorm зависит от размера батча и плохо работает при батче 1–2 и в рекуррентных сетях.
- LayerNorm нормирует по признакам одного объекта — стандарт трансформеров.
- RMSNorm убирает вычитание среднего и работает быстрее при том же качестве.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Чем отличаются
По какой оси считается статистика.
| Слой | Статистика по | Где применяется |
|---|---|---|
| BatchNorm | батчу для каждого канала | свёрточные сети |
| LayerNorm | признакам одного объекта | трансформеры, RNN |
| GroupNorm | группе каналов | малые батчи в CV |
| RMSNorm | норме без вычитания среднего | современные LLM |
BatchNorm ведёт себя по-разному на обучении и инференсе (там используются накопленные статистики) — это источник классических багов при экспорте модели.
2Почему это помогает
Не только «сдвиг ковариат».
Изначальное объяснение через internal covariate shift оказалось неполным. Сегодня основной эффект связывают со сглаживанием ландшафта потерь: нормализация делает поверхность более предсказуемой, что позволяет брать больший learning rate.
- Позволяет обучать глубокие сети без тщательной настройки инициализации.
- BatchNorm даёт побочный регуляризующий эффект за счёт шума батча.
- Pre-norm (нормализация до подслоя) в трансформерах устойчивее post-norm при большой глубине.
Связанные темы
Стабильность обучения нейросетей
Gradient Clipping85%
Обрезка градиента · Оптимизация обученияОграничение нормы градиента перед шагом оптимизатора — простейшая защита от расходимости обучения.
Mixed Precision85%
Смешанная точность · Оптимизация обученияОбучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
Backpropagation85%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Learning Rate Scheduling85%
Расписание скорости обучения · Оптимизация обученияИзменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.
Numerical Methods85%
Численные методы · ОсновыКомпьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.