Компьютерное зрение

Multimodal Models

Мультимодальные модели

новинкаНовое или быстро растущее направление

Единое пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.

Ключевые тезисы

  • CLIP обучается контрастно на парах «изображение — подпись».
  • Zero-shot классификация задаётся текстовыми описаниями классов.
  • VLM (LLaVA, Qwen-VL) добавляют к языковой модели зрительный энкодер.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

CLIP и общее пространство

Контрастное обучение на парах «изображение — подпись».

Обозначения
  • порог или задержка
  • число объектов в выборке
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • скалярное произведение: мера согласованности векторов
  • логарифм: превращает произведения в суммы и сжимает масштаб
  • экспонента
Симметричная InfoNCE: правильная пара должна быть ближе всех остальных в батче
  • Zero-shot классификация: вместо обучения классификатора сравниваем эмбеддинг картинки с эмбеддингами фраз «фото кошки», «фото собаки».
  • Поиск по описанию работает из коробки: текст и изображение лежат в одном пространстве.
  • VLM (LLaVA, Qwen-VL) добавляют зрительный энкодер к языковой модели и позволяют вести диалог о картинке, документе или скриншоте.
2

Прикладные сценарии

Что уже сегодня работает в проде.

  • Поиск по описанию в каталоге товаров и медиатеке.
  • Модерация: zero-shot проверка на запрещённый контент по текстовым описаниям политик.
  • Документы: извлечение полей из счетов и договоров без обучения на каждый шаблон.
  • Автоописания и alt-тексты для доступности.
На практике

У VLM есть характерная слабость: точный подсчёт объектов и чтение мелкого текста. Для этих задач надёжнее специализированные детекторы и OCR.

Связанные темы

Мультимодальность