Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Ключевые тезисы
- Очень быстрый, хорошо ведёт себя на малых выборках и разреженных текстах.
- Варианты: мультиномиальный, бернуллиевский, гауссовский.
- Вероятности плохо откалиброваны, но ранжирование классов обычно адекватное.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Идея и «наивное» предположение
Теорема Байеса плюс допущение независимости признаков.
- истинное значение целевой переменной
- объект: вектор признаков
- произведение по всем элементам
Предположение почти всегда ложно (слова в тексте зависимы), но для ранжирования классов этого часто достаточно: даже смещённые вероятности сохраняют правильный порядок.
Слово «выигрыш» встречается в 8% спама и в 0.1% нормальных писем. Каждое такое слово умножает шансы в пользу спама. Именно так работали первые байесовские фильтры — и работали хорошо.
2Варианты и сглаживание
Мультиномиальный, бернуллиевский, гауссовский — и что делать с нулевой вероятностью.
| Вариант | Данные | Модель признака |
|---|---|---|
| Multinomial | счётчики слов | частоты |
| Bernoulli | бинарные признаки | наличие / отсутствие |
| Gaussian | вещественные признаки | нормальное распределение внутри класса |
- коэффициент, задающий вес слагаемого или скорость обновления
- истинное значение целевой переменной
- объект: вектор признаков
- число объектов в выборке
Вероятности Naive Bayes систематически переуверены (близки к 0 или 1) из-за перемножения зависимых множителей. Если нужны вероятности, а не метки, — калибруйте.
Связанные темы
Байесовский подход · Вероятность и информация
Bayes Theorem93%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Probability93%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Bayesian Inference75%
Байесовский вывод · Теория вероятностей и распределенияПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
Markov Chains75%
Марковские цепи · Теория вероятностей и распределенияПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
Beta Distribution75%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
Conditional Independence75%
Условная независимость · Теория вероятностей и распределенияДве величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.
Probability Axioms75%
Аксиомы вероятности · Теория вероятностей и распределенияТри аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.
Random Variables75%
Случайные величины · Теория вероятностей и распределенияОтображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.
Bayesian Optimization75%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.
Statistics70%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Information Theory70%
Теория информации · ОсновыИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Probability Distribution70%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Variance70%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
KL Divergence70%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.