Глубокое обучение

MLP

Многослойный перцептрон

актуальноТекущий рабочий стандарт

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

Ключевые тезисы

  • Без нелинейной активации любая глубина сворачивается в одно линейное преобразование.
  • Глубина обычно эффективнее ширины при том же числе параметров.
  • Используется как «голова» поверх свёрточных и трансформерных признаков.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Архитектура и размерности

Как считать число параметров и не запутаться в матрицах.

Обозначения
  • предсказание модели
  • истинное значение целевой переменной
  • объект: вектор признаков
Пример

Вход 100 признаков, скрытые слои 64 и 32, выход 1. Параметров: , затем , затем — итого 8 545.

Теорема об универсальной аппроксимации говорит, что достаточно широкой сети с одним скрытым слоем хватит для приближения любой непрерывной функции. Но «достаточно широкой» может означать экспоненциально много нейронов — на практике глубина эффективнее ширины.

2

Почему без активации всё разваливается

Композиция линейных слоёв — снова линейный слой.

Сколько бы слоёв вы ни поставили, без нелинейности между ними получится одна матрица. Именно активация делает глубину осмысленной.

-4-2024-10123xf(x)производная
f(-2)0.000
f(2)2.000
f′(-4)0.0000
f′(4)1.0000
Функция активации
Сравните функции активации и их производные: у сигмоиды градиент затухает на краях, у ReLU — нет

Связанные темы

Нейросеть по кирпичикам

Perceptron80%

Перцептрон · Глубокое обучение

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

Activation functions80%

Функции активации · Глубокое обучение

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Optimizers80%

Оптимизаторы · Глубокое обучение

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Logistic Regression80%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.