Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Ключевые тезисы
- Momentum сглаживает траекторию и ускоряет движение по узким оврагам.
- Adam адаптирует шаг по каждому параметру, AdamW корректно отделяет weight decay.
- SGD с momentum часто даёт лучшую обобщающую способность в задачах зрения.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Семейство методов
От SGD до Adam: что добавляет каждый шаг эволюции.
- скорость обучения — длина шага оптимизатора
- коэффициент сглаживания (инерции)
- веса модели — то, что подбирается при обучении
- скорость обучения — длина шага оптимизатора
- коэффициент сглаживания (инерции)
- малая константа для численной устойчивости
- скользящие средние градиента и его квадрата в адаптивных оптимизаторах
- веса модели — то, что подбирается при обучении
2Что выбирать на практике
Готовые рецепты для типовых задач.
- Трансформеры и LLM — AdamW, warmup + cosine decay, weight decay 0.01–0.1.
- Компьютерное зрение (свёртки) — SGD с momentum 0.9 часто даёт лучшую обобщающую способность.
- Быстрый прототип — Adam с lr : почти всегда «просто работает».
- Табличные нейросети — AdamW плюс сильная регуляризация; часто проще взять бустинг.
Если обучение расходится в первые сотни шагов, первым делом уменьшайте learning rate и добавляйте warmup — это лечит больше проблем, чем смена архитектуры.
Связанные темы
Нейросеть по кирпичикам · Оптимизаторы
Optimization85%
Оптимизация · ОсновыПоиск параметров, минимизирующих функцию потерь. Свойства задачи — выпуклость, гладкость, обусловленность — определяют, насколько это просто.
Gradient Descent85%
Градиентный спуск · Оптимизация обученияИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
SGD85%
Стохастический градиентный спуск · Оптимизация обученияГрадиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.
Momentum85%
Момент · Оптимизация обученияНакопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.
Adam85%
Adam · Оптимизация обученияАдаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.
AdamW85%
AdamW · Оптимизация обученияAdam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.
RMSProp85%
RMSProp · Оптимизация обученияНормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.
Learning Rate Scheduling85%
Расписание скорости обучения · Оптимизация обученияИзменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.
Batch size85%
Размер батча · Оптимизация обученияЧисло объектов на одно обновление весов: влияет на скорость, память и качество обобщения.
Perceptron80%
Перцептрон · Глубокое обучениеПростейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.
MLP80%
Многослойный перцептрон · Глубокое обучениеНесколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.
Activation functions80%
Функции активации · Глубокое обучениеНелинейности между слоями, без которых сеть не сложнее линейной модели.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Logistic Regression80%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.