Компактное представление данных, сохраняющее важную часть структуры.
Ключевые тезисы
- PCA — линейный базис, UMAP и t-SNE — нелинейная визуализация.
- Снижение размерности часто улучшает последующую кластеризацию.
- Помните: 2D-картинка — это проекция, а не сами данные.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1UMAP и t-SNE на практике
Как не сделать ложных выводов по красивой картинке.
- Расстояния между кластерами на картинке не означают реальной удалённости.
- Размеры кластеров на картинке не отражают их плотность или численность.
perplexity(t-SNE) иn_neighbors(UMAP) кардинально меняют результат — всегда смотрите несколько значений.- UMAP умеет
transformдля новых точек, t-SNE — нет.
Перед t-SNE и UMAP почти всегда сначала применяют PCA до 30–50 компонент: это ускоряет вычисления и снижает шум.
2Как выбрать метод
Зависит от того, что вы собираетесь делать дальше.
| Цель | Метод |
|---|---|
| Признаки для модели | PCA, автоэнкодер |
| Картинка для человека | UMAP, t-SNE |
| Борьба с мультиколлинеарностью | PCA |
| Нелинейное многообразие | UMAP, Isomap, автоэнкодер |
Связанные темы
Плотностная кластеризация · Представления и снижение размерности
Eigenvector96%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.
HDBSCAN85%
HDBSCAN · Обучение без учителяИерархическая версия DBSCAN: перебирает плотности автоматически и находит кластеры разной плотности.
Spectral Clustering85%
Спектральная кластеризация · Обучение без учителяКластеризация через собственные векторы матрицы Лапласа графа сходства: находит невыпуклые и вложенные структуры.
DBSCAN85%
DBSCAN · Классическое машинное обучениеПлотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
Persistent Homology85%
Персистентные гомологии · Топологический анализ данныхЦентральный метод TDA: вместо одного порога ε рассматривается вся фильтрация, и отслеживается, когда топологические особенности рождаются и умирают.
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Dimensionality reduction70%
Снижение размерности · ДанныеПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Representation Learning70%
Обучение представлений · Обучение без учителяМодель сама учится полезным признакам, чаще всего через self-supervised задачи.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Embeddings70%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.