Deep Learning
Глубокое обучение
Нейросети учат представления сами, а не получают их от инженера. Здесь собраны их строительные блоки и ключевые архитектуры.
Mixture of Expertsновинка
Смесь экспертовАрхитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.
MLPактуально
Многослойный перцептронНесколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.
CNNактуально
Свёрточные сетиРазделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
Transformersактуально
ТрансформерыАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Perceptronклассика
ПерцептронПростейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.
RNNклассика
Рекуррентные сетиОбрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.
LSTMклассика
LSTMРекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.
GRUклассика
GRUУпрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.
Graph Neural Networksновинка
Графовые нейросетииз «Графы и сети»Нейросети, работающие прямо на структуре графа: представление вершины обновляется по представлениям соседей.
LLMновинка
Большие языковые моделииз «Генеративный ИИ»Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Vision Transformersактуально
Vision Transformersиз «Компьютерное зрение»Изображение режется на патчи, которые обрабатываются как последовательность токенов.
BERTактуально
BERTиз «Обработка естественного языка»Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPTактуально
GPTиз «Обработка естественного языка»Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Diffusion Modelsновинка
Диффузионные моделиМодель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.
Autoencodersактуально
АвтоэнкодерыСеть учится восстанавливать вход через узкое место, получая сжатое представление.
VAEактуально
Вариационный автоэнкодерВероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.
GANклассика
Генеративно-состязательные сетиГенератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.
Generative Lossesактуально
Функции потерь генеративных моделейиз «Генеративный ИИ»Чем измеряется ошибка, когда правильного ответа не существует: правдоподобие, состязательные потери, предсказание шума и контрастные цели.
Attentionактуально
Механизм вниманияКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Normalization Layersактуально
Слои нормализацииBatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.
Activation functionsактуально
Функции активацииНелинейности между слоями, без которых сеть не сложнее линейной модели.
Loss functionsактуально
Функции потерьФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Log Lossактуально
Логарифмические потерииз «Метрики»Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
MSEактуально
Среднеквадратичная ошибкаиз «Метрики»Среднее квадратов ошибок: сильно штрафует большие отклонения.
Backpropagationактуально
Обратное распространение ошибкиЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.
Optimizersактуально
ОптимизаторыПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Transfer Learningактуально
Перенос обученияИспользование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Adamактуально
Adamиз «Оптимизация обучения»Адаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.
Learning Rate Schedulingактуально
Расписание скорости обученияиз «Оптимизация обучения»Изменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.
Gradient Clippingактуально
Обрезка градиентаиз «Оптимизация обучения»Ограничение нормы градиента перед шагом оптимизатора — простейшая защита от расходимости обучения.
Mixed Precisionактуально
Смешанная точностьиз «Оптимизация обучения»Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
Regularizationактуально
Регуляризацияиз «Оптимизация обучения»Любое ограничение сложности модели, снижающее переобучение.
Batch sizeактуально
Размер батчаиз «Оптимизация обучения»Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.
14 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.