Векторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.
- выход слоя — новый вектор признаков
- матрица весов: поворачивает, растягивает и проецирует пространство
- вход — объект в пространстве признаков
- вектор сдвига: позволяет отображению не проходить через ноль
Ключевые тезисы
- Матрица — это линейное отображение: она поворачивает, растягивает и проецирует пространство признаков.
- Разложения (SVD, собственные) объясняют, какие направления данных несут больше всего дисперсии.
- Скалярное произведение задаёт меру похожести — от косинусной близости эмбеддингов до ядер SVM.
Подробный разбор
4 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Объект как вектор, выборка как матрица
Почему любая таблица данных — это матрица, а строка — точка в пространстве признаков.
Один объект описывается набором чисел: возраст, доход, количество покупок. Этот набор и есть вектор , а — размерность пространства признаков. Вся выборка из объектов складывается в матрицу размера : строки — объекты, столбцы — признаки.
- объект или аргумент функции
- число объектов в выборке
Клиент банка: возраст 35, доход 120 000, число продуктов 3 → вектор . Тысяча клиентов — матрица . Заметьте, что координаты имеют разный масштаб: это и есть причина, по которой нужна нормализация.
Такое представление даёт неожиданно много: расстояние между строками становится мерой похожести клиентов, а обучение линейной модели — поиском одного вектора весов , который «читает» все строки одинаковым способом.
2Матрица как преобразование пространства
Умножение на матрицу поворачивает, растягивает и проецирует данные.
Умножение — это не «перемножение чисел», а отображение: каждой точке сопоставляется новая точка . Матрица полностью задаётся тем, куда она переводит базисные векторы: первый столбец — образ вектора , второй — образ .
- Композиция: означает «сначала применить , потом ». Отсюда некоммутативность: .
- Ранг — размерность образа. Ранг меньше означает, что преобразование схлопывает пространство и информация теряется безвозвратно.
- Определитель — во сколько раз меняется объём. Нулевой определитель ⇔ матрица вырождена ⇔ обратной не существует.
Полносвязный слой нейросети — это ровно : матрица преобразует пространство, вектор сдвигает его. Вся «глубина» сети — это композиция таких преобразований, между которыми стоят нелинейности.
3Скалярное произведение и мера похожести
Одна операция, из которой выросли косинусная близость, ядра SVM и внимание в трансформерах.
- параметры модели
- суммирование по всем перечисленным элементам
- норма — длина вектора
- скалярное произведение: мера согласованности векторов
Если векторы сонаправлены, произведение максимально; если перпендикулярны — равно нулю. Поэтому косинус угла используют как меру смысловой близости эмбеддингов: длина вектора там часто не важна, важно направление.
Товар описан вектором из 256 чисел. Чтобы найти похожие, считают скалярные произведения запроса со всеми товарами и берут топ-к. Для 1 млн товаров это одно умножение матрицы на — то, что видеокарта делает за миллисекунды.
В механизме внимания то же самое: — насколько -й запрос «резонирует» с -м ключом. Деление на нужно, чтобы при большой размерности значения не улетали в область, где softmax насыщается.
4Собственные векторы и SVD
Как найти направления, вдоль которых данные «живут» на самом деле.
Собственный вектор — направление, которое преобразование не поворачивает, а только масштабирует: . Для ковариационной матрицы данных собственные векторы — это оси, вдоль которых разброс максимален, а собственные значения — величина этого разброса.
- стандартное отклонение — разброс величины
- награда, полученная агентом на шаге
- транспонирование: строка вместо столбца
- Первые компонент SVD дают наилучшее приближение матрицы рангом (теорема Эккарта — Янга) — это математическая основа PCA и сжатия эмбеддингов.
- Отношение — число обусловленности: чем оно больше, тем сильнее шум в данных влияет на решение системы.
- LoRA обучает низкоранговую поправку — ту же идею «мало компонент хватает» применяют к весам LLM.
Связанные темы
Линейная алгебра в ML
Vector70%
Вектор · Математический справочникУпорядоченный набор чисел; в ML — представление объекта в пространстве признаков.
Matrix70%
Матрица · Математический справочникПрямоугольная таблица чисел, задающая линейное преобразование или набор объектов.
Norm70%
Норма · Математический справочникМера длины вектора; выбор нормы определяет геометрию задачи.
Distance70%
Расстояние · Математический справочникМера непохожести объектов — основа кластеризации, k-NN и поиска.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector70%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Metric spaces70%
Метрические пространства · Топологический анализ данныхМножество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.