Компьютерное зрение

Image Classification

Классификация изображений

актуальноТекущий рабочий стандарт

Отнесение всего изображения к одному или нескольким классам — базовая задача зрения.

Ключевые тезисы

  • Дообучение предобученного бэкбона почти всегда лучше обучения с нуля.
  • Top-1 и top-5 accuracy — стандартные метрики.
  • Дисбаланс и «шумные» метки — типичные проблемы реальных датасетов.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Рецепт дообучения

Что делать, когда у вас 2000 картинок и десять классов.

  1. Взять предобученный бэкбон, заменить последний слой на свой.
  2. Обучить только голову (2–3 эпохи, lr ).
  3. Разморозить всё, дообучить с малым lr ( и ниже), с cosine-расписанием.
  4. Включить аугментации, label smoothing и early stopping.
На практике

Дисбаланс классов лечится взвешенной функцией потерь или сэмплером; при сильном дисбалансе смотрите на per-class recall, а не на общую accuracy.

2

Диагностика классификатора

Что смотреть, когда accuracy не растёт.

  • Матрица ошибок по классам — обычно путаются две-три конкретные пары.
  • Самые уверенные ошибки — часто это ошибки разметки.
  • Grad-CAM: если модель смотрит на фон, а не на объект, у вас утечка через контекст съёмки.
  • Дубликаты между train и test — проверяйте по хешам и перцептивным хешам.
На практике

Классический пример утечки в CV: снимки больных сделаны на одном аппарате, здоровых — на другом. Модель учится различать аппараты и показывает 0.99 на тесте.

Связанные темы

Свёртки и зрение