Computer Vision
Компьютерное зрение
Обработка изображений, свёрточные и трансформерные архитектуры, детекция, сегментация и мультимодальные модели.
Image preprocessingактуально
Предобработка изображенийПриведение картинок к единому формату и аугментации, расширяющие обучающую выборку.
Feature extractionклассика
Извлечение признаковОт ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.
Transfer Learningактуально
Перенос обученияиз «Глубокое обучение»Использование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Multimodal Modelsновинка
Мультимодальные моделиЕдиное пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
CNNактуально
Свёрточные сети в CVБазовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.
Vision Transformersактуально
Vision TransformersИзображение режется на патчи, которые обрабатываются как последовательность токенов.
CNNактуально
Свёрточные сетииз «Глубокое обучение»Разделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
Image Classificationактуально
Классификация изображенийОтнесение всего изображения к одному или нескольким классам — базовая задача зрения.
Object Detectionактуально
Детекция объектовПоиск объектов на изображении с указанием класса и ограничивающей рамки.
Segmentationактуально
СегментацияКлассификация на уровне пикселей: семантическая, инстанс- и паноптическая.
OCRактуально
Оптическое распознавание текстаИзвлечение текста из изображений и сканов: детекция областей текста и его распознавание.
Object Trackingактуально
Трекинг объектовСопоставление детекций между кадрами: кто из объектов на новом кадре — тот же самый, что и раньше.
Pose and Keypointsактуально
Ключевые точки и позаОпределение положения суставов человека или характерных точек объекта — база для спортивной аналитики, эргономики и контроля процессов.
Kalman Filterактуально
Фильтр Калманаиз «Временные ряды»Рекуррентная оценка скрытого состояния системы по зашумлённым наблюдениям. Оптимален для линейных систем с гауссовым шумом.
Diffusion Modelsновинка
Диффузионные моделииз «Глубокое обучение»Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.
Diffusionновинка
Диффузияиз «Генеративный ИИ»Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
GANклассика
Генеративно-состязательные сетииз «Глубокое обучение»Генератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.
6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.