Математический справочник

KL Divergence

KL-дивергенция

актуальноТекущий рабочий стандарт

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Что означает каждый компонент
  • усреднение идёт по истинному распределению p — поэтому мера несимметрична
  • во сколько раз модель q ошибается относительно истины p в каждой точке

Ключевые тезисы

  • Всегда неотрицательна, равна нулю только при совпадении распределений.
  • Регуляризатор в VAE и в RLHF.
  • Симметричная альтернатива — дивергенция Дженсена — Шеннона.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Свойства и применение

Не метрика, но незаменима.

Обозначения
  • KL-дивергенция: насколько одно распределение отличается от другого
  • вектор или точка пространства признаков
  • вероятность (или показатель нормы)
  • распределение, предсказанное моделью
  • суммирование по всем перечисленным элементам
  • норма — длина вектора
  • логарифм: превращает произведения в суммы и сжимает масштаб
  • Несимметрична: ; не удовлетворяет неравенству треугольника.
  • Обращается в бесконечность, если там, где — модель «исключила» возможный исход.
  • Применения: регуляризатор в VAE, штраф в RLHF, мера дрейфа данных (в симметричном варианте — Дженсена — Шеннона).
2

Асимметрия и её последствия

Mode-seeking против mode-covering.

НаправлениеПоведение Где встречается
покрывает все моды , размазываетсямаксимизация правдоподобия
садится на одну модувариационный вывод

Отсюда, в частности, размытость VAE: обучение максимизирует правдоподобие и вынуждает модель покрывать все варианты сразу, усредняя их.

Связанные темы

Вероятность и информация

Probability70%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Statistics70%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Information Theory70%

Теория информации · Основы

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Probability Distribution70%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Variance70%

Дисперсия · Математический справочник

Мера разброса значений вокруг среднего.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

Entropy70%

Энтропия · Математический справочник

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Bayes Theorem70%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes70%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.