Две величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.
- совместная вероятность двух событий при известном C
- если C известно, знание про B ничего не добавляет к A…
- …и наоборот. Именно это допущение делает наивный байесовский классификатор «наивным»
Ключевые тезисы
- Независимость и условная независимость не следуют друг из друга ни в одну сторону.
- Парадокс Симпсона — прямое следствие игнорирования условной структуры.
- Графические модели кодируют именно условные независимости, а не корреляции.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Парадокс Симпсона
Как агрегирование меняет знак зависимости.
| Группа | Метод A | Метод B |
|---|---|---|
| Лёгкие случаи | 93% (81/87) | 87% (234/270) |
| Тяжёлые случаи | 73% (192/263) | 69% (55/80) |
| Итого | 78% | 83% |
Метод A лучше в каждой группе и хуже в сумме — потому что группы разного размера и по-разному распределены. Вывод для ML: всегда смотрите метрики по сегментам, а не только агрегат.
2Графические модели
Как условная независимость превращается в структуру.
Байесовская сеть кодирует утверждения вида « не зависит от при известном ». Из структуры графа читаются все такие утверждения (d-разделение), а совместное распределение раскладывается в произведение условных.
- значение случайной величины
- число наблюдений или испытаний
- вероятность события
- произведение по всем элементам
Связанные темы
Байесовский подход
Bayesian Inference75%
Байесовский вывод · Теория вероятностей и распределенияПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
Markov Chains75%
Марковские цепи · Теория вероятностей и распределенияПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
Beta Distribution75%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
Probability Axioms75%
Аксиомы вероятности · Теория вероятностей и распределенияТри аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.
Random Variables75%
Случайные величины · Теория вероятностей и распределенияОтображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.
Bayes Theorem75%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes75%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Bayesian Optimization75%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.
Probability75%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.