Компьютерное зрение

Vision Transformers

Vision Transformers

актуальноТекущий рабочий стандарт

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

Ключевые тезисы

  • ViT превосходит CNN при большом объёме данных или сильном предобучении.
  • Самообучение (DINO, MAE) снимает зависимость от разметки.
  • Гибриды со свёртками остаются практичным компромиссом.
Тема также относится к главам:Глубокое обучениеАрхитектуры

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Изображение как последовательность патчей

Как трансформер вообще применяют к картинке.

Изображение 224×224 режется на патчи 16×16 — получается 196 «токенов». Каждый патч линейно проецируется в вектор, к нему добавляется позиционное кодирование, дальше — обычный трансформерный энкодер.

  • У ViT нет свёрточного индуктивного сдвига (локальность, трансляционная инвариантность), поэтому ему нужно больше данных или сильное предобучение.
  • Самообучение (DINO, MAE) снимает зависимость от разметки: MAE восстанавливает замаскированные патчи — прямой аналог BERT для изображений.
  • Гибриды (свёрточный стем + трансформер) сочетают быстрое обучение и глобальный контекст.
2

Самообучение для зрения

MAE и DINO — как учиться без разметки.

  • MAE: маскируется 75% патчей, декодер восстанавливает их. Обучение дешёвое, поскольку энкодер видит только видимые патчи.
  • DINO: самодистилляция — ученик учится совпадать с усреднённым учителем на разных аугментациях; карты внимания сами выделяют объекты.
  • Обе схемы дают представления, которые затем дообучаются на небольшой размеченной выборке.

Связанные темы

Внимание и трансформеры · Мультимодальность

LLM96%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformers85%

Трансформеры · Глубокое обучение

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Attention85%

Внимание в NLP · Обработка естественного языка

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Transformers85%

Трансформеры в NLP · Обработка естественного языка

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPT85%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Transformer forecasting85%

Трансформеры для прогноза · Временные ряды

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

Multimodal Models75%

Мультимодальные модели · Компьютерное зрение

Единое пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.

Multimodal Models75%

Мультимодальные модели · Генеративный ИИ

Единая модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.

OCR75%

Оптическое распознавание текста · Компьютерное зрение

Извлечение текста из изображений и сканов: детекция областей текста и его распознавание.

Embeddings75%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.