Метрики

Davies–Bouldin

Индекс Дэвиса — Болдина

актуальноТекущий рабочий стандарт

Отношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.

Ключевые тезисы

  • Считается быстро, удобен для перебора числа кластеров.
  • Предполагает выпуклые, примерно сферические кластеры.
  • Единственный из популярных индексов, где минимум — это хорошо.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Индекс Дэвиса — Болдина

Чем меньше, тем лучше — редкий случай среди метрик кластеризации.

Обозначения
  • среднее значение
  • суммирование по всем перечисленным элементам
— средний разброс внутри кластера, — расстояние между центрами

Для каждого кластера берётся его «худший сосед» — тот, с которым он хуже всего разделён. Метрика считается быстро и удобна для перебора числа кластеров, но предполагает выпуклые кластеры сопоставимого размера.

2

Сравнение внутренних индексов

Когда какой индекс информативнее.

ИндексНаправлениеСтоимостьСлабость
Силуэтмаксимизироватьдорого на больших выборках
Davies–Bouldinминимизироватьпредполагает выпуклые кластеры
Calinski–Harabaszмаксимизироватьрастёт с K
На практике

Лучшая практика — смотреть все три сразу: если они согласованно указывают на одно K, доверия к разбиению больше.

Связанные темы

Кластеризация и её оценка

k-Means75%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

DBSCAN75%

DBSCAN · Классическое машинное обучение

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

GMM75%

Смесь гауссиан · Классическое машинное обучение

Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.

Clustering75%

Кластеризация · Обучение без учителя

Разбиение объектов на группы похожих без заранее известных меток.

Density Estimation75%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

Association Rules75%

Ассоциативные правила · Обучение без учителя

Поиск закономерностей вида «если A, то B» в транзакционных данных.

Silhouette Score75%

Силуэт · Метрики

Сравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.

Calinski–Harabasz75%

Индекс Калинского — Харабаша · Метрики

Отношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.

Mapper75%

Алгоритм Mapper · Топологический анализ данных

Строит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.