Базовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.
Ключевые тезисы
- ResNet, EfficientNet, ConvNeXt — рабочие бэкбоны разного бюджета.
- Transfer learning с ImageNet решает большинство задач при малых данных.
- Свёртки дают полезный индуктивный сдвиг: локальность и трансляционная инвариантность.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Выбор бэкбона
Практическое сравнение популярных архитектур.
| Модель | Параметров | Когда брать |
|---|---|---|
| ResNet-50 | 25M | надёжный дефолт, много готовых весов |
| EfficientNet-B0 | 5M | ограничения по памяти и скорости |
| ConvNeXt | 29M+ | современный свёрточный бэкбон, качество на уровне ViT |
| MobileNetV3 | 5M | мобильные устройства, CPU-инференс |
Transfer learning — почти всегда правильный старт: замораживаем бэкбон, обучаем голову, затем размораживаем и дообучаем всё с малым learning rate.
2Рецептивное поле и разрешение
Почему мелкие объекты теряются и что с этим делать.
Каждый слой с пулингом или stride 2 уменьшает карту признаков вдвое. После пяти таких блоков объект размером 16 пикселей превращается в половину клетки — сеть его просто не видит.
- FPN объединяет карты разных уровней: мелкие объекты берутся с ранних слоёв, крупные — с поздних.
- Dilated convolution увеличивает рецептивное поле без потери разрешения.
- Тайлинг: большие снимки режут на перекрывающиеся окна и обрабатывают по частям.
Связанные темы
Свёртки и зрение
CNN85%
Свёрточные сети · Глубокое обучениеРазделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
Image Classification85%
Классификация изображений · Компьютерное зрениеОтнесение всего изображения к одному или нескольким классам — базовая задача зрения.
Object Detection85%
Детекция объектов · Компьютерное зрениеПоиск объектов на изображении с указанием класса и ограничивающей рамки.
Segmentation85%
Сегментация · Компьютерное зрениеКлассификация на уровне пикселей: семантическая, инстанс- и паноптическая.
Feature extraction85%
Извлечение признаков · Компьютерное зрениеОт ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.
Image preprocessing85%
Предобработка изображений · Компьютерное зрениеПриведение картинок к единому формату и аугментации, расширяющие обучающую выборку.