Обучение без учителя

Density Estimation

Оценка плотности

актуальноТекущий рабочий стандарт

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

Ключевые тезисы

  • KDE — непараметрическая оценка, GMM — параметрическая смесь.
  • Normalizing flows дают точную плотность и умеют генерировать.
  • Низкая плотность — естественное определение аномалии.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Ядерная оценка плотности

Гистограмма без произвольных границ корзин.

Обозначения
  • объект: вектор признаков
  • число объектов в выборке
  • вероятность (или плотность распределения)
  • суммирование по всем перечисленным элементам
— ядро (обычно гауссово), — ширина окна

Ширина окна важнее выбора ядра: малое даёт изрезанную оценку с пиками на каждом объекте, большое — сглаживает всю структуру. подбирают кросс-валидацией по правдоподобию.

На практике

В высоких размерностях KDE становится непрактичной (то же проклятие размерности). Там переходят к параметрическим смесям, normalizing flows или моделям на основе энергии.

2

Normalizing flows

Точная плотность плюс возможность генерировать.

Обозначения
  • объект: вектор признаков
  • вероятность (или плотность распределения)
  • функция, о которой идёт речь
  • частная производная — чувствительность к одному аргументу
  • логарифм: превращает произведения в суммы и сжимает масштаб
Замена переменных: обратимое преобразование переносит простое распределение в сложное

Требование обратимости и вычислимого якобиана ограничивает архитектуру, зато даёт то, чего нет у GAN и диффузии: точное значение правдоподобия — удобно для детекции аномалий.

Связанные темы

Кластеризация и её оценка · Генеративные модели · Аномалии и выбросы

VAE80%

Вариационный автоэнкодер · Глубокое обучение

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

GAN80%

Генеративно-состязательные сети · Глубокое обучение

Генератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.

Diffusion Models80%

Диффузионные модели · Глубокое обучение

Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.

Generative Models80%

Генеративные модели · Генеративный ИИ

Модели, обучающие распределение данных и умеющие порождать новые объекты из него.

Autoregressive Models80%

Авторегрессионные модели · Генеративный ИИ

Порождают объект по частям, каждый раз предсказывая следующий элемент по предыдущим.

VAE80%

Вариационный автоэнкодер · Генеративный ИИ

Генерация через непрерывное вероятностное латентное пространство.

GAN80%

GAN · Генеративный ИИ

Состязательная пара сетей, дающая резкие и реалистичные изображения.

Diffusion80%

Диффузия · Генеративный ИИ

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

k-Means75%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

DBSCAN75%

DBSCAN · Классическое машинное обучение

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

GMM75%

Смесь гауссиан · Классическое машинное обучение

Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.

Clustering75%

Кластеризация · Обучение без учителя

Разбиение объектов на группы похожих без заранее известных меток.

Association Rules75%

Ассоциативные правила · Обучение без учителя

Поиск закономерностей вида «если A, то B» в транзакционных данных.

Silhouette Score75%

Силуэт · Метрики

Сравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.

Davies–Bouldin75%

Индекс Дэвиса — Болдина · Метрики

Отношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.

Calinski–Harabasz75%

Индекс Калинского — Харабаша · Метрики

Отношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.

Mapper75%

Алгоритм Mapper · Топологический анализ данных

Строит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.

Outliers70%

Выбросы · Данные

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

Anomaly Detection70%

Поиск аномалий · Обучение без учителя

Выделение объектов, не похожих на основную массу данных, при отсутствии меток.

Anomaly detection70%

Поиск аномалий во времени · Временные ряды

Обнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

TDA + Time Series70%

TDA и временные ряды · Топологический анализ данных

Ряд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.