Единое пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
Ключевые тезисы
- CLIP обучается контрастно на парах «изображение — подпись».
- Zero-shot классификация задаётся текстовыми описаниями классов.
- VLM (LLaVA, Qwen-VL) добавляют к языковой модели зрительный энкодер.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1CLIP и общее пространство
Контрастное обучение на парах «изображение — подпись».
- порог или задержка
- число объектов в выборке
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
- скалярное произведение: мера согласованности векторов
- логарифм: превращает произведения в суммы и сжимает масштаб
- экспонента
- Zero-shot классификация: вместо обучения классификатора сравниваем эмбеддинг картинки с эмбеддингами фраз «фото кошки», «фото собаки».
- Поиск по описанию работает из коробки: текст и изображение лежат в одном пространстве.
- VLM (LLaVA, Qwen-VL) добавляют зрительный энкодер к языковой модели и позволяют вести диалог о картинке, документе или скриншоте.
2Прикладные сценарии
Что уже сегодня работает в проде.
- Поиск по описанию в каталоге товаров и медиатеке.
- Модерация: zero-shot проверка на запрещённый контент по текстовым описаниям политик.
- Документы: извлечение полей из счетов и договоров без обучения на каждый шаблон.
- Автоописания и alt-тексты для доступности.
У VLM есть характерная слабость: точный подсчёт объектов и чтение мелкого текста. Для этих задач надёжнее специализированные детекторы и OCR.
Связанные темы
Мультимодальность
Multimodal Models75%
Мультимодальные модели · Генеративный ИИЕдиная модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.
Vision Transformers75%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
OCR75%
Оптическое распознавание текста · Компьютерное зрениеИзвлечение текста из изображений и сканов: детекция областей текста и его распознавание.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
LLM75%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.