Модель сама учится полезным признакам, чаще всего через self-supervised задачи.
Ключевые тезисы
- Контрастные методы (SimCLR, InfoNCE) сближают аугментации одного объекта.
- Маскированное восстановление (MAE, BERT) — вторая большая парадигма.
- Хорошие представления резко снижают потребность в разметке.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Контрастное обучение
Сближаем разные виды одного объекта, отдаляем разные объекты.
- порог или задержка
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
- скалярное произведение: мера согласованности векторов
- логарифм: превращает произведения в суммы и сжимает масштаб
- экспонента
Положительная пара — две аугментации одного изображения (или предложение и его перефразировка). Отрицательные — все остальные объекты батча. Модель учится представлению, инвариантному к аугментациям, но различающему объекты.
- Размер батча критичен: он определяет число отрицательных примеров.
- Температура регулирует, насколько жёстко штрафуются «трудные» отрицательные примеры.
- Альтернатива — маскированное восстановление (BERT, MAE): проще в реализации и не требует больших батчей.
2Как оценивать представления
Три стандартных протокола.
- Linear probe: обучаем линейный классификатор поверх замороженных представлений — чем выше качество, тем лучше пространство.
- k-NN evaluation: качество ближайших соседей без всякого обучения.
- Few-shot: качество при 1–10 размеченных примерах на класс — то, ради чего представления обычно и учат.
Связанные темы
Представления и снижение размерности
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Dimensionality reduction70%
Снижение размерности · ДанныеПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Dimensionality Reduction70%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Embeddings70%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector70%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.