Глубокое обучение

Activation functions

Функции активации

актуальноТекущий рабочий стандарт

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Ключевые тезисы

  • ReLU — дефолт: дёшева и не насыщается, но может «умирать» на отрицательных входах.
  • GELU и SiLU — стандарт в трансформерах, дают более гладкий градиент.
  • Sigmoid и tanh оставляют для выходов и вентилей рекуррентных ячеек.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Кого выбирать

Практическое сравнение основных функций.

ФункцияФормулаПлюсыМинусы
ReLUбыстрая, не насыщается справа«мёртвые» нейроны
LeakyReLUнет мёртвых нейроновлишний гиперпараметр
GELUгладкая, стандарт в трансформерахдороже считать
Sigmoidвыход — вероятностьнасыщение, градиент ≈ 0
tanhцентрирована в нуленасыщение
-4-2024-10123xf(x)производная
f(-2)0.000
f(2)2.000
f′(-4)0.0000
f′(4)1.0000
Функция активации
Посмотрите на производную у краёв: именно она определяет, дойдёт ли градиент до ранних слоёв
2

Активация выходного слоя

Здесь выбор диктуется задачей, а не модой.

  • Регрессия — без активации (линейный выход).
  • Бинарная классификация — sigmoid (или логиты + BCEWithLogits).
  • Многоклассовая — softmax по классам.
  • Multilabel — sigmoid независимо по каждому классу, не softmax.
Обозначения
  • суммирование по всем перечисленным элементам
  • экспонента
Softmax превращает логиты в распределение: значения положительны и суммируются в единицу

Связанные темы

Нейросеть по кирпичикам

Perceptron80%

Перцептрон · Глубокое обучение

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

MLP80%

Многослойный перцептрон · Глубокое обучение

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Optimizers80%

Оптимизаторы · Глубокое обучение

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Logistic Regression80%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.