Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
- усреднение идёт по истинному распределению p — поэтому мера несимметрична
- во сколько раз модель q ошибается относительно истины p в каждой точке
Ключевые тезисы
- Всегда неотрицательна, равна нулю только при совпадении распределений.
- Регуляризатор в VAE и в RLHF.
- Симметричная альтернатива — дивергенция Дженсена — Шеннона.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Свойства и применение
Не метрика, но незаменима.
- KL-дивергенция: насколько одно распределение отличается от другого
- вектор или точка пространства признаков
- вероятность (или показатель нормы)
- распределение, предсказанное моделью
- суммирование по всем перечисленным элементам
- норма — длина вектора
- логарифм: превращает произведения в суммы и сжимает масштаб
- Несимметрична: ; не удовлетворяет неравенству треугольника.
- Обращается в бесконечность, если там, где — модель «исключила» возможный исход.
- Применения: регуляризатор в VAE, штраф в RLHF, мера дрейфа данных (в симметричном варианте — Дженсена — Шеннона).
2Асимметрия и её последствия
Mode-seeking против mode-covering.
| Направление | Поведение | Где встречается |
|---|---|---|
| покрывает все моды , размазывается | максимизация правдоподобия | |
| садится на одну моду | вариационный вывод |
Отсюда, в частности, размытость VAE: обучение максимизирует правдоподобие и вынуждает модель покрывать все варианты сразу, усредняя их.
Связанные темы
Вероятность и информация
Probability70%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Statistics70%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Information Theory70%
Теория информации · ОсновыИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Probability Distribution70%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Variance70%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Bayes Theorem70%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes70%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.