Компьютерное зрение

Feature extraction

Извлечение признаков

классикаРучные дескрипторы живы в SLAM и склейке; для остального — эмбеддинги сетей.

От ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.

Ключевые тезисы

  • Классические дескрипторы устойчивы к масштабу и повороту.
  • Сегодня признаки чаще берут из предпоследнего слоя предобученной сети.
  • Такие эмбеддинги работают для поиска похожих изображений и кластеризации.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Ручные дескрипторы и выученные признаки

Что было до сетей и что осталось полезным сейчас.

  • SIFT / ORB — ключевые точки, устойчивые к масштабу и повороту; до сих пор применяются в SLAM, склейке панорам и сопоставлении изображений.
  • HOG — гистограммы направлений градиента; классика детекции пешеходов.
  • Признаки из сети — активации предпоследнего слоя предобученной модели; работают как универсальный дескриптор изображения.
model = timm.create_model("resnet50", pretrained=True, num_classes=0)
model.eval()
with torch.no_grad():
    emb = model(batch)          # (B, 2048) — готовые признаки
emb = torch.nn.functional.normalize(emb, dim=1)   # для косинусного поиска
Поиск похожих изображений без обучения собственной модели

Связанные темы

Свёртки и зрение