Нелинейности между слоями, без которых сеть не сложнее линейной модели.
Ключевые тезисы
- ReLU — дефолт: дёшева и не насыщается, но может «умирать» на отрицательных входах.
- GELU и SiLU — стандарт в трансформерах, дают более гладкий градиент.
- Sigmoid и tanh оставляют для выходов и вентилей рекуррентных ячеек.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Кого выбирать
Практическое сравнение основных функций.
| Функция | Формула | Плюсы | Минусы |
|---|---|---|---|
| ReLU | быстрая, не насыщается справа | «мёртвые» нейроны | |
| LeakyReLU | нет мёртвых нейронов | лишний гиперпараметр | |
| GELU | гладкая, стандарт в трансформерах | дороже считать | |
| Sigmoid | выход — вероятность | насыщение, градиент ≈ 0 | |
| tanh | центрирована в нуле | насыщение |
2Активация выходного слоя
Здесь выбор диктуется задачей, а не модой.
- Регрессия — без активации (линейный выход).
- Бинарная классификация — sigmoid (или логиты +
BCEWithLogits). - Многоклассовая — softmax по классам.
- Multilabel — sigmoid независимо по каждому классу, не softmax.
- суммирование по всем перечисленным элементам
- экспонента
Связанные темы
Нейросеть по кирпичикам
Perceptron80%
Перцептрон · Глубокое обучениеПростейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.
MLP80%
Многослойный перцептрон · Глубокое обучениеНесколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Optimizers80%
Оптимизаторы · Глубокое обучениеПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Logistic Regression80%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.