Приведение картинок к единому формату и аугментации, расширяющие обучающую выборку.
Ключевые тезисы
- Resize, нормализация по статистикам датасета, приведение цветовых каналов.
- Аугментации (flip, crop, color jitter, MixUp) — самая дешёвая регуляризация в CV.
- Аугментации применяются только к train, но должны быть согласованы с доменом.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Приведение к единому виду
Размер, каналы, нормализация — что делают перед каждой сетью.
- Resize / crop: сети обычно ждут фиксированный размер (224×224, 384×384). Центрированный кроп на инференсе, случайный — на обучении.
- Каналы: OpenCV читает BGR, PyTorch ждёт RGB — классический источник тихих багов.
- Нормализация: вычесть среднее и поделить на std, посчитанные по датасету предобучения (для ImageNet это фиксированные константы).
- стандартное отклонение — разброс величины
- среднее значение
- объект: вектор признаков
2Аугментации
Самый дешёвый способ увеличить выборку в десятки раз.
| Аугментация | Что даёт | Когда опасна |
|---|---|---|
| Горизонтальный флип | инвариантность к зеркалу | текст, цифры, медицина с латеральностью |
| Случайный кроп / масштаб | инвариантность к положению | если объект мелкий и может вылететь |
| Цветовой джиттер | устойчивость к освещению | когда цвет — сам признак |
| MixUp / CutMix | регуляризация, калибровка | детекция без адаптации разметки |
Аугментации применяются только к обучающей выборке. Test-time augmentation — отдельный приём: усреднение предсказаний по нескольким версиям одного изображения обычно даёт небольшой стабильный прирост.
Связанные темы
Свёртки и зрение
CNN85%
Свёрточные сети · Глубокое обучениеРазделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
CNN85%
Свёрточные сети в CV · Компьютерное зрениеБазовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.
Image Classification85%
Классификация изображений · Компьютерное зрениеОтнесение всего изображения к одному или нескольким классам — базовая задача зрения.
Object Detection85%
Детекция объектов · Компьютерное зрениеПоиск объектов на изображении с указанием класса и ограничивающей рамки.
Segmentation85%
Сегментация · Компьютерное зрениеКлассификация на уровне пикселей: семантическая, инстанс- и паноптическая.
Feature extraction85%
Извлечение признаков · Компьютерное зрениеОт ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.