Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
- вероятность исхода — вес в среднем
- количество информации в исходе: чем он реже, тем больше несёт
Ключевые тезисы
- Энтропия — средняя неожиданность события, минимальная длина кода для сообщения.
- Кросс-энтропия — стандартная функция потерь в классификации и языковых моделях.
- KL-дивергенция измеряет цену использования неверного распределения вместо истинного.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Энтропия: сколько информации в ответе
Мера неопределённости, из которой выросли и деревья, и языковые модели.
- энтропия — мера неопределённости распределения
- объект или аргумент функции
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
- логарифм: превращает произведения в суммы и сжимает масштаб
Честная монета: бит — максимальная неопределённость. Монета, всегда падающая орлом: , результат известен заранее. Именно поэтому решающее дерево ищет разбиение, максимально снижающее энтропию: оно ищет вопрос, ответ на который несёт больше всего информации.
2Кросс-энтропия и KL-дивергенция
Цена того, что модель ошибается в своём представлении о мире.
- KL-дивергенция: насколько одно распределение отличается от другого
- энтропия — мера неопределённости распределения
- объект или аргумент функции
- вероятность (или плотность распределения)
- распределение, предсказанное моделью
- суммирование по всем перечисленным элементам
- норма — длина вектора
от модели не зависит, поэтому минимизация кросс-энтропии эквивалентна минимизации KL-дивергенции между истинным распределением и предсказанным. Это и есть обучение классификатора: подгонять под .
- KL несимметрична: , поэтому это не метрика.
- Уверенная ошибка ( там, где ) даёт бесконечный штраф — отсюда чувствительность log loss.
- Перплексия языковой модели — это : «сколько равновероятных вариантов модель в среднем рассматривает».
Связанные темы
Вероятность и информация
Probability70%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Statistics70%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Probability Distribution70%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Variance70%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
KL Divergence70%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Bayes Theorem70%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes70%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.