Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.
Ключевые тезисы
- Собственные векторы ковариационной матрицы — главные компоненты.
- Для симметричных матриц они взаимно ортогональны.
- PageRank — собственный вектор матрицы переходов.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Устойчивые направления
Где преобразование только растягивает, но не поворачивает.
У симметричных матриц (а ковариационная матрица симметрична) собственные векторы взаимно ортогональны и образуют удобный новый базис. Именно в него PCA и переводит данные.
PageRank — собственный вектор матрицы переходов, отвечающий значению : распределение вероятностей, устойчивое к дальнейшему блужданию по ссылкам.
2Степенной метод
Как найти главную компоненту без полного разложения.
- номер или количество: индекс шага, число соседей, кластеров или позиций
- норма — длина вектора
Метод требует только умножения матрицы на вектор, поэтому применим к огромным разреженным матрицам — так изначально и считали PageRank.
Связанные темы
Плотностная кластеризация · Машинное обучение на графах · Представления и снижение размерности · Линейная алгебра в ML
Dimensionality Reduction96%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
PCA91%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Eigenvalue91%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
HDBSCAN85%
HDBSCAN · Обучение без учителяИерархическая версия DBSCAN: перебирает плотности автоматически и находит кластеры разной плотности.
Spectral Clustering85%
Спектральная кластеризация · Обучение без учителяКластеризация через собственные векторы матрицы Лапласа графа сходства: находит невыпуклые и вложенные структуры.
DBSCAN85%
DBSCAN · Классическое машинное обучениеПлотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
Persistent Homology85%
Персистентные гомологии · Топологический анализ данныхЦентральный метод TDA: вместо одного порога ε рассматривается вся фильтрация, и отслеживается, когда топологические особенности рождаются и умирают.
Graph Basics85%
Основы графов · Графы и сетиВершины, рёбра, веса и направления. Матрица смежности и список рёбер — два способа хранить одно и то же.
Centrality85%
Центральности · Графы и сетиМеры важности вершины: по числу связей, по посредничеству, по близости и по влиянию соседей.
PageRank85%
PageRank · Графы и сетиСтационарное распределение случайного блуждания по графу с телепортацией. Классический алгоритм ранжирования, который до сих пор используется как признак.
Community Detection85%
Поиск сообществ · Графы и сетиРазбиение графа на плотно связанные группы: клиенты одного круга, связанные аккаунты, тематические кластеры документов.
Graph Embeddings85%
Графовые эмбеддинги · Графы и сетиВекторные представления вершин, в которых близость отражает связанность в графе.
Graph Neural Networks85%
Графовые нейросети · Графы и сетиНейросети, работающие прямо на структуре графа: представление вершины обновляется по представлениям соседей.
Message Passing85%
Передача сообщений · Графы и сетиЕдиная схема, к которой сводятся почти все архитектуры GNN: собрать сообщения от соседей, агрегировать, обновить состояние.
Link Prediction85%
Предсказание связей · Графы и сетиЗадача «появится ли ребро между вершинами»: рекомендации друзей и товаров, достройка графов знаний.
Knowledge Graphs85%
Графы знаний · Графы и сетиФакты в виде троек «субъект — предикат — объект». Структурированная память, которую всё чаще подключают к языковым моделям.
Network Motifs85%
Мотивы и триады · Графы и сетиМаленькие повторяющиеся подграфы, встречающиеся чаще, чем в случайной сети. Хорошие признаки для классификации вершин.
Clustering85%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.
Dimensionality reduction70%
Снижение размерности · ДанныеПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Representation Learning70%
Обучение представлений · Обучение без учителяМодель сама учится полезным признакам, чаще всего через self-supervised задачи.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Embeddings70%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Linear Algebra70%
Линейная алгебра · ОсновыВекторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.
Vector70%
Вектор · Математический справочникУпорядоченный набор чисел; в ML — представление объекта в пространстве признаков.
Matrix70%
Матрица · Математический справочникПрямоугольная таблица чисел, задающая линейное преобразование или набор объектов.
Norm70%
Норма · Математический справочникМера длины вектора; выбор нормы определяет геометрию задачи.
Distance70%
Расстояние · Математический справочникМера непохожести объектов — основа кластеризации, k-NN и поиска.
Metric spaces70%
Метрические пространства · Топологический анализ данныхМножество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.