Изменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.
Ключевые тезисы
- Cosine annealing с warmup — стандарт для трансформеров.
- Warmup спасает от расходимости на первых шагах при больших батчах.
- ReduceLROnPlateau реагирует на остановку роста метрики.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Основные расписания
Большой шаг в начале, маленький в конце.
- скорость обучения — длина шага оптимизатора
- число π ≈ 3.14159
- Step decay — уменьшать в 10 раз на заданных эпохах: просто и предсказуемо.
- Cosine — плавное затухание, стандарт для трансформеров.
- ReduceLROnPlateau — реагирует на остановку роста метрики, удобно, когда длительность обучения неизвестна.
- One-cycle — рост, затем спад; часто даёт лучший результат за фиксированный бюджет.
2Warmup
Почему первые сотни шагов идут с крошечным шагом.
В начале обучения оценки вторых моментов у Adam ещё ненадёжны, а веса случайны — большой шаг легко выбрасывает модель в область, из которой она не восстанавливается. Warmup линейно поднимает lr от нуля до рабочего значения за первые несколько сотен или тысяч шагов.
Чем больше батч и глубже сеть, тем важнее warmup. Для трансформеров это фактически обязательный элемент рецепта.
Связанные темы
Стабильность обучения нейросетей · Оптимизаторы · Подбор гиперпараметров
Normalization Layers85%
Слои нормализации · Глубокое обучениеBatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.
Gradient Clipping85%
Обрезка градиента · Оптимизация обученияОграничение нормы градиента перед шагом оптимизатора — простейшая защита от расходимости обучения.
Mixed Precision85%
Смешанная точность · Оптимизация обученияОбучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
Backpropagation85%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Numerical Methods85%
Численные методы · ОсновыКомпьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.
Optimization85%
Оптимизация · ОсновыПоиск параметров, минимизирующих функцию потерь. Свойства задачи — выпуклость, гладкость, обусловленность — определяют, насколько это просто.
Optimizers85%
Оптимизаторы · Глубокое обучениеПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Gradient Descent85%
Градиентный спуск · Оптимизация обученияИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
SGD85%
Стохастический градиентный спуск · Оптимизация обученияГрадиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.
Momentum85%
Момент · Оптимизация обученияНакопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.
Adam85%
Adam · Оптимизация обученияАдаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.
AdamW85%
AdamW · Оптимизация обученияAdam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.
RMSProp85%
RMSProp · Оптимизация обученияНормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.
Batch size85%
Размер батча · Оптимизация обученияЧисло объектов на одно обновление весов: влияет на скорость, память и качество обобщения.
Hyperparameter tuning80%
Настройка гиперпараметров · Практика MLПоиск конфигурации модели по валидационной метрике — последний, а не первый шаг работы.
Grid Search80%
Поиск по сетке · Практика MLПолный перебор всех комбинаций заданных значений гиперпараметров.
Random Search80%
Случайный поиск · Практика MLСлучайная выборка конфигураций из заданных распределений.
Bayesian Optimization80%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.
Cross-validation80%
Кросс-валидация · Оценка моделейМногократное разбиение выборки, дающее оценку качества вместе с её разбросом.