Математический справочник

Hessian

Гессиан

актуальноТекущий рабочий стандарт

Матрица вторых производных, описывающая локальную кривизну функции.

Ключевые тезисы

  • Положительно определённый гессиан — локальный минимум.
  • Число обусловленности объясняет медленную сходимость в оврагах.
  • Методы второго порядка точны, но дороги: O(n²) памяти.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Кривизна и обусловленность

Почему оптимизация буксует в оврагах.

Число обусловленности гессиана: чем больше, тем медленнее сходится градиентный спуск

При оптимальный шаг вдоль «узкой» оси в сто раз меньше, чем вдоль «широкой». Единый learning rate вынужден ориентироваться на меньший — отсюда медленная сходимость и зигзаг.

методSGD
шагов сделано30
f(x, y)0.2153
‖(x, y)‖0.656
Оптимизатор
Овраг $f = x^2/2 + 8y^2$ имеет κ = 16; сравните, как справляются разные оптимизаторы
2

Методы второго порядка

Почему они точнее и почему их почти не используют.

Обозначения
  • веса модели — то, что подбирается при обучении
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • функция, о которой идёт речь
  • градиент: вектор частных производных
Метод Ньютона: шаг учитывает кривизну и не требует подбора learning rate
  • Гессиан для модели с параметрами занимает памяти — для миллиона параметров это нереально.
  • L-BFGS хранит лишь несколько последних векторов и приближает обратный гессиан; применим для небольших моделей и full-batch задач.
  • K-FAC и Shampoo — приближения, которые иногда используют для больших сетей.

Связанные темы

Аппарат анализа · Градиенты и производные

Calculus97%

Математический анализ · Основы

Производные показывают, как изменится ошибка при малом изменении параметра. Именно это делает возможным градиентное обучение.

Gradient97%

Градиент · Математический справочник

Вектор частных производных, указывающий направление наибыстрейшего роста функции.

Backpropagation97%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Limits and Continuity85%

Пределы и непрерывность · Математический анализ

Предел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.

Derivative85%

Производная · Математический анализ

Скорость изменения функции: предел отношения приращения функции к приращению аргумента. Геометрически — наклон касательной.

Differentiation Rules85%

Правила дифференцирования · Математический анализ

Сумма, произведение, частное и композиция — четыре правила, которых достаточно, чтобы продифференцировать почти любую функцию потерь вручную.

Taylor Series85%

Ряд Тейлора · Математический анализ

Приближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.

Multivariable Calculus85%

Многомерный анализ · Математический анализ

Функции многих переменных: частные производные, градиент, производная по направлению и линии уровня.

Jacobian85%

Якобиан · Математический анализ

Матрица частных производных векторной функции. Описывает, как преобразование растягивает пространство локально.

Lagrange Multipliers85%

Множители Лагранжа · Математический анализ

Метод условной оптимизации: минимизировать функцию при ограничениях, не решая их подстановкой.

Convexity85%

Выпуклость · Математический анализ

Свойство функции, гарантирующее единственность минимума и сходимость градиентных методов.

Numerical Differentiation85%

Численное дифференцирование · Математический анализ

Приближение производной конечными разностями: медленно и неточно, но незаменимо для проверки аналитических градиентов.

Series and Convergence85%

Ряды и сходимость · Математический анализ

Когда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.

Integral85%

Интеграл · Математический анализ

Определённый интеграл — площадь под кривой, неопределённый — обратная операция к дифференцированию. В ML интеграл почти всегда означает математическое ожидание.

Differential Equations85%

Дифференциальные уравнения · Математический анализ

Уравнения, связывающие функцию с её производными. Описывают динамику — от роста популяций до обратного процесса в диффузионных моделях.

Gradient Descent80%

Градиентный спуск · Оптимизация обучения

Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.

Numerical Methods80%

Численные методы · Основы

Компьютер считает приближённо. Понимание точности float, устойчивости и обусловленности спасает от NaN и «необъяснимых» расхождений.