Раздел 04

Deep Learning

Глубокое обучение

Нейросети учат представления сами, а не получают их от инженера. Здесь собраны их строительные блоки и ключевые архитектуры.

2 новинок12 актуальных5 классикаDS-направлениеИнженерное направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Mixture of Expertsновинка

Смесь экспертов

Архитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.

MLPактуально

Многослойный перцептрон

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

CNNактуально

Свёрточные сети

Разделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.

Transformersактуально

Трансформеры

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Perceptronклассика

Перцептрон

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

RNNклассика

Рекуррентные сети

Обрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.

LSTMклассика

LSTM

Рекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.

GRUклассика

GRU

Упрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.

Graph Neural Networksновинка

Графовые нейросетииз «Графы и сети»

Нейросети, работающие прямо на структуре графа: представление вершины обновляется по представлениям соседей.

LLMновинка

Большие языковые моделииз «Генеративный ИИ»

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Vision Transformersактуально

Vision Transformersиз «Компьютерное зрение»

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

BERTактуально

BERTиз «Обработка естественного языка»

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPTактуально

GPTиз «Обработка естественного языка»

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Diffusion Modelsновинка

Диффузионные модели

Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.

Autoencodersактуально

Автоэнкодеры

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

VAEактуально

Вариационный автоэнкодер

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

GANклассика

Генеративно-состязательные сети

Генератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.

Generative Lossesактуально

Функции потерь генеративных моделейиз «Генеративный ИИ»

Чем измеряется ошибка, когда правильного ответа не существует: правдоподобие, состязательные потери, предсказание шума и контрастные цели.

Attentionактуально

Механизм внимания

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Normalization Layersактуально

Слои нормализации

BatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.

Activation functionsактуально

Функции активации

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Loss functionsактуально

Функции потерь

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Log Lossактуально

Логарифмические потерииз «Метрики»

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

MSEактуально

Среднеквадратичная ошибкаиз «Метрики»

Среднее квадратов ошибок: сильно штрафует большие отклонения.

Backpropagationактуально

Обратное распространение ошибки

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Optimizersактуально

Оптимизаторы

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Transfer Learningактуально

Перенос обучения

Использование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.

Adamактуально

Adamиз «Оптимизация обучения»

Адаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.

Learning Rate Schedulingактуально

Расписание скорости обученияиз «Оптимизация обучения»

Изменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.

Gradient Clippingактуально

Обрезка градиентаиз «Оптимизация обучения»

Ограничение нормы градиента перед шагом оптимизатора — простейшая защита от расходимости обучения.

Mixed Precisionактуально

Смешанная точностьиз «Оптимизация обучения»

Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.

Regularizationактуально

Регуляризацияиз «Оптимизация обучения»

Любое ограничение сложности модели, снижающее переобучение.

Batch sizeактуально

Размер батчаиз «Оптимизация обучения»

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.

14 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.