Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.
Ключевые тезисы
- Даёт мягкое отнесение: вероятность принадлежности объекта каждому кластеру.
- Ковариационные матрицы позволяют кластерам быть вытянутыми и повёрнутыми.
- Число компонент выбирают по BIC/AIC; k-means — частный вырожденный случай GMM.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Смесь распределений
Мягкая кластеризация с вероятностями принадлежности.
- нормальное распределение со средним μ и дисперсией σ²
- среднее значение
- объект: вектор признаков
- число объектов в выборке
- вероятность (или плотность распределения)
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
Каждый объект принадлежит всем кластерам с некоторыми вероятностями. Ковариационные матрицы позволяют кластерам быть вытянутыми и повёрнутыми — k-means этого не умеет, потому что неявно предполагает .
2EM-алгоритм
Как обучать модель, когда метки кластеров неизвестны.
- E-шаг: при текущих параметрах считаем ответственности — вероятность, что объект порождён компонентой .
- M-шаг: при фиксированных ответственностях пересчитываем , , как взвешенные оценки.
- нормальное распределение со средним μ и дисперсией σ²
- среднее значение
- параметр ядра RBF: радиус влияния объекта
- объект: вектор признаков
- число объектов в выборке
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
Правдоподобие не убывает на каждой итерации, но сходимость возможна в локальный максимум — поэтому запускают несколько раз с разной инициализацией. Число компонент выбирают по BIC/AIC.
Связанные темы
Кластеризация и её оценка
k-Means75%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
DBSCAN75%
DBSCAN · Классическое машинное обучениеПлотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.
Density Estimation75%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.
Association Rules75%
Ассоциативные правила · Обучение без учителяПоиск закономерностей вида «если A, то B» в транзакционных данных.
Silhouette Score75%
Силуэт · МетрикиСравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.
Davies–Bouldin75%
Индекс Дэвиса — Болдина · МетрикиОтношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.
Calinski–Harabasz75%
Индекс Калинского — Харабаша · МетрикиОтношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.
Mapper75%
Алгоритм Mapper · Топологический анализ данныхСтроит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.