Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.
Ключевые тезисы
- KDE — непараметрическая оценка, GMM — параметрическая смесь.
- Normalizing flows дают точную плотность и умеют генерировать.
- Низкая плотность — естественное определение аномалии.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Ядерная оценка плотности
Гистограмма без произвольных границ корзин.
- объект: вектор признаков
- число объектов в выборке
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
Ширина окна важнее выбора ядра: малое даёт изрезанную оценку с пиками на каждом объекте, большое — сглаживает всю структуру. подбирают кросс-валидацией по правдоподобию.
В высоких размерностях KDE становится непрактичной (то же проклятие размерности). Там переходят к параметрическим смесям, normalizing flows или моделям на основе энергии.
2Normalizing flows
Точная плотность плюс возможность генерировать.
- объект: вектор признаков
- вероятность (или плотность распределения)
- функция, о которой идёт речь
- частная производная — чувствительность к одному аргументу
- логарифм: превращает произведения в суммы и сжимает масштаб
Требование обратимости и вычислимого якобиана ограничивает архитектуру, зато даёт то, чего нет у GAN и диффузии: точное значение правдоподобия — удобно для детекции аномалий.
Связанные темы
Кластеризация и её оценка · Генеративные модели · Аномалии и выбросы
VAE80%
Вариационный автоэнкодер · Глубокое обучениеВероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.
GAN80%
Генеративно-состязательные сети · Глубокое обучениеГенератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.
Diffusion Models80%
Диффузионные модели · Глубокое обучениеМодель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.
Generative Models80%
Генеративные модели · Генеративный ИИМодели, обучающие распределение данных и умеющие порождать новые объекты из него.
Autoregressive Models80%
Авторегрессионные модели · Генеративный ИИПорождают объект по частям, каждый раз предсказывая следующий элемент по предыдущим.
VAE80%
Вариационный автоэнкодер · Генеративный ИИГенерация через непрерывное вероятностное латентное пространство.
GAN80%
GAN · Генеративный ИИСостязательная пара сетей, дающая резкие и реалистичные изображения.
Diffusion80%
Диффузия · Генеративный ИИИтеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
k-Means75%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
DBSCAN75%
DBSCAN · Классическое машинное обучениеПлотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
GMM75%
Смесь гауссиан · Классическое машинное обучениеВероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.
Association Rules75%
Ассоциативные правила · Обучение без учителяПоиск закономерностей вида «если A, то B» в транзакционных данных.
Silhouette Score75%
Силуэт · МетрикиСравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.
Davies–Bouldin75%
Индекс Дэвиса — Болдина · МетрикиОтношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.
Calinski–Harabasz75%
Индекс Калинского — Харабаша · МетрикиОтношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.
Mapper75%
Алгоритм Mapper · Топологический анализ данныхСтроит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.
Outliers70%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Anomaly Detection70%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
Anomaly detection70%
Поиск аномалий во времени · Временные рядыОбнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
TDA + Time Series70%
TDA и временные ряды · Топологический анализ данныхРяд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.