Данные

Dimensionality reduction

Снижение размерности

актуальноТекущий рабочий стандарт

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Ключевые тезисы

  • PCA сохраняет глобальную дисперсию, t-SNE и UMAP — локальную структуру соседства.
  • Визуализация в 2D помогает увидеть кластеры, но искажает расстояния.
  • Автоэнкодеры дают нелинейное сжатие, обучаемое под конкретные данные.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Проклятие размерности

Почему в 500 измерениях все объекты примерно одинаково далеки друг от друга.

С ростом размерности объём пространства растёт экспоненциально, а данные остаются теми же. Расстояния между ближайшим и дальнейшим соседом сближаются, и методы на основе близости теряют смысл.

Обозначения
  • объект: вектор признаков
  • предел: к чему стремится выражение
  • сходимость: выражение слева стремится к тому, что справа
  • норма — длина вектора
Контраст расстояний исчезает при росте размерности
На практике

Практическое следствие: k-NN и кластеризацию по «сырым» высокоразмерным данным обычно предваряют снижением размерности.

2

Линейные и нелинейные методы

PCA сохраняет глобальную структуру, UMAP и t-SNE — локальную.

МетодЧто сохраняетПрименение
PCAглобальную дисперсию, линейные осипредобработка, сжатие, декорреляция
t-SNEлокальное соседствотолько визуализация
UMAPлокальное + частично глобальноевизуализация и признаки
Автоэнкодерто, что нужно для реконструкциинелинейное сжатие под свои данные
На практике

t-SNE нельзя применять к новым данным (нет transform), а расстояния и размеры кластеров на его картинке не имеют смысла. Это инструмент разглядывания, а не измерения.

PC1PC2
λ₁0.711
λ₂0.041
объяснённая дисперсия PC194.5%
Чем сильнее корреляция признаков, тем больше дисперсии забирает первая компонента

Связанные темы

Представления и снижение размерности

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Dimensionality Reduction70%

Снижение размерности · Обучение без учителя

Компактное представление данных, сохраняющее важную часть структуры.

Representation Learning70%

Обучение представлений · Обучение без учителя

Модель сама учится полезным признакам, чаще всего через self-supervised задачи.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Embeddings70%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector70%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.