Математический справочник

Gradient

Градиент

актуальноТекущий рабочий стандарт

Вектор частных производных, указывающий направление наибыстрейшего роста функции.

Что означает каждый компонент
  • частная производная по первому параметру: как изменится функция, если чуть увеличить только его
  • то же по последнему. Вектор из всех таких производных указывает направление наискорейшего роста

Ключевые тезисы

  • Обучение = движение против градиента функции потерь.
  • В минимуме градиент равен нулю.
  • Нулевой или взрывной градиент — типичная причина, почему сеть не учится.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Свойства градиента

Три факта, которые нужно помнить.

  • Указывает направление наискорейшего роста; шаг делается против него.
  • Перпендикулярен линиям уровня функции.
  • В точке минимума равен нулю — но нулевой градиент бывает и в седле, и в максимуме.
-6-226100204060wL(w)минимум
шаг обучения η0.20
текущий x1.767
f(x)1.054
градиент-0.467
статусидёт
Значение градиента показано на панели: у минимума оно стремится к нулю
2

Автоматическое дифференцирование

Как фреймворки считают градиенты.

Autograd строит граф операций во время прямого прохода, а затем обходит его в обратном порядке, применяя правило цепочки. Это не численное дифференцирование (нет ошибки аппроксимации) и не символьное (нет разрастания выражений).

x = torch.tensor([2.0], requires_grad=True)
y = x ** 3 + 2 * x
y.backward()
print(x.grad)     # 3x² + 2 = 14
Градиент считается точно, а не приближённо

Связанные темы

Аппарат анализа · Градиенты и производные

Calculus97%

Математический анализ · Основы

Производные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.

Hessian97%

Гессиан · Математический справочник

Матрица вторых производных, описывающая локальную кривизну функции.

Backpropagation97%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Limits and Continuity85%

Пределы и непрерывность · Математический анализ

Предел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.

Derivative85%

Производная · Математический анализ

Скорость изменения функции: предел отношения приращения функции к приращению аргумента. Геометрически — наклон касательной.

Differentiation Rules85%

Правила дифференцирования · Математический анализ

Сумма, произведение, частное и композиция — четыре правила, которых достаточно, чтобы продифференцировать почти любую функцию потерь вручную.

Taylor Series85%

Ряд Тейлора · Математический анализ

Приближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.

Multivariable Calculus85%

Многомерный анализ · Математический анализ

Функции многих переменных: частные производные, градиент, производная по направлению и линии уровня.

Jacobian85%

Якобиан · Математический анализ

Матрица частных производных векторной функции. Описывает, как преобразование растягивает пространство локально.

Lagrange Multipliers85%

Множители Лагранжа · Математический анализ

Метод условной оптимизации: минимизировать функцию при ограничениях, не решая их подстановкой.

Convexity85%

Выпуклость · Математический анализ

Свойство функции, гарантирующее единственность минимума и сходимость градиентных методов.

Numerical Differentiation85%

Численное дифференцирование · Математический анализ

Приближение производной конечными разностями: медленно и неточно, но незаменимо для проверки аналитических градиентов.

Series and Convergence85%

Ряды и сходимость · Математический анализ

Когда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.

Integral85%

Интеграл · Математический анализ

Определённый интеграл — площадь под кривой, неопределённый — обратная операция к дифференцированию. В ML интеграл почти всегда означает математическое ожидание.

Differential Equations85%

Дифференциальные уравнения · Математический анализ

Уравнения, связывающие функцию с её производными. Описывают динамику — от роста популяций до обратного процесса в диффузионных моделях.

Gradient Descent80%

Градиентный спуск · Оптимизация обучения

Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.

Numerical Methods80%

Численные методы · Основы

Компьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.