Обучение без учителя

Representation Learning

Обучение представлений

актуальноТекущий рабочий стандарт

Модель сама учится полезным признакам, чаще всего через self-supervised задачи.

Ключевые тезисы

  • Контрастные методы (SimCLR, InfoNCE) сближают аугментации одного объекта.
  • Маскированное восстановление (MAE, BERT) — вторая большая парадигма.
  • Хорошие представления резко снижают потребность в разметке.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Контрастное обучение

Сближаем разные виды одного объекта, отдаляем разные объекты.

Обозначения
  • порог или задержка
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • скалярное произведение: мера согласованности векторов
  • логарифм: превращает произведения в суммы и сжимает масштаб
  • экспонента

Положительная пара — две аугментации одного изображения (или предложение и его перефразировка). Отрицательные — все остальные объекты батча. Модель учится представлению, инвариантному к аугментациям, но различающему объекты.

  • Размер батча критичен: он определяет число отрицательных примеров.
  • Температура регулирует, насколько жёстко штрафуются «трудные» отрицательные примеры.
  • Альтернатива — маскированное восстановление (BERT, MAE): проще в реализации и не требует больших батчей.
2

Как оценивать представления

Три стандартных протокола.

  • Linear probe: обучаем линейный классификатор поверх замороженных представлений — чем выше качество, тем лучше пространство.
  • k-NN evaluation: качество ближайших соседей без всякого обучения.
  • Few-shot: качество при 1–10 размеченных примерах на класс — то, ради чего представления обычно и учат.

Связанные темы

Представления и снижение размерности

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Dimensionality reduction70%

Снижение размерности · Данные

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Dimensionality Reduction70%

Снижение размерности · Обучение без учителя

Компактное представление данных, сохраняющее важную часть структуры.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Embeddings70%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector70%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.