Сеть учится восстанавливать вход через узкое место, получая сжатое представление.
Ключевые тезисы
- Латентный код — нелинейный аналог главных компонент.
- Denoising-версия восстанавливает чистый вход из зашумлённого.
- Ошибка реконструкции — рабочий детектор аномалий.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Узкое место и реконструкция
Сжать, чтобы понять, что в данных главное.
- объект: вектор признаков
- функция потерь — то, что минимизируется при обучении
- норма — длина вектора
Если энкодер и декодер линейны, а потери квадратичные, автоэнкодер выучивает то же подпространство, что и PCA. Нелинейности позволяют находить кривые многообразия, недоступные PCA.
2Применения
Шумоподавление, поиск аномалий, сжатие для других моделей.
- Denoising: на вход подаём зашумлённый объект, на выходе требуем чистый — сеть учится «понимать» структуру, а не копировать вход.
- Аномалии: обучаем только на нормальных данных; большая ошибка реконструкции = аномалия.
- Сжатие: латентный код используется как признаки для классификатора или как пространство для диффузии (Stable Diffusion работает именно в латентном пространстве VAE).
Связанные темы
Представления и снижение размерности · Аномалии и выбросы
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Dimensionality reduction70%
Снижение размерности · ДанныеПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Dimensionality Reduction70%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
Representation Learning70%
Обучение представлений · Обучение без учителяМодель сама учится полезным признакам, чаще всего через self-supervised задачи.
Embeddings70%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector70%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.
Outliers70%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Anomaly Detection70%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
Anomaly detection70%
Поиск аномалий во времени · Временные рядыОбнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.
Density Estimation70%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.
TDA + Time Series70%
TDA и временные ряды · Топологический анализ данныхРяд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.