Глубокое обучение

Diffusion Models

Диффузионные модели

новинкаТекущий стандарт генерации изображений, видео и аудио.

Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.

Что означает каждый компонент
  • шум, который мы сами добавили к чистому объекту — известный ответ
  • предсказание сети: какой шум содержится в зашумлённом объекте на шаге t
Обучение диффузии — обычная регрессия: предсказать добавленный шум

Ключевые тезисы

  • Прямой процесс добавляет гауссов шум, обратный — предсказывает и убирает его.
  • Обучение устойчивее GAN и покрывает моды распределения лучше.
  • Latent diffusion работает в сжатом пространстве, что и сделало Stable Diffusion практичной.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Прямой и обратный процессы

Разрушаем изображение шумом, учимся обращать разрушение.

Обозначения
  • нормальное распределение со средним μ и дисперсией σ²
  • коэффициент сглаживания (инерции)
  • объект: вектор признаков
  • число объектов в выборке
  • распределение, предсказанное моделью
Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • коэффициент сглаживания (инерции)
  • малая константа для численной устойчивости
  • объект: вектор признаков
  • произведение по всем элементам
Любой шаг зашумления получается за одну операцию — поэтому обучение так удобно
Обозначения
  • математическое ожидание — среднее по распределению
  • обучаемые параметры сети
  • малая константа для численной устойчивости
  • объект: вектор признаков
  • функция потерь — то, что минимизируется при обучении
  • норма — длина вектора
Сеть просто предсказывает добавленный шум — обычная регрессия
2

Управление генерацией

Как заставить модель следовать текстовому запросу.

Обозначения
  • обучаемые параметры сети
  • малая константа для численной устойчивости
  • объект: вектор признаков
Classifier-free guidance: управляет силой следования условию
  • Большое — точнее следование промпту, но меньше разнообразия и заметные артефакты.
  • Число шагов сэмплирования — компромисс качества и скорости; DDIM и другие солверы сокращают его с 1000 до 20–50.
  • Latent diffusion делает всё это в сжатом пространстве VAE, что и позволило запускать модели на обычных видеокартах.

Связанные темы

Генеративные модели

VAE80%

Вариационный автоэнкодер · Глубокое обучение

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

GAN80%

Генеративно-состязательные сети · Глубокое обучение

Генератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.

Generative Models80%

Генеративные модели · Генеративный ИИ

Модели, обучающие распределение данных и умеющие порождать новые объекты из него.

Autoregressive Models80%

Авторегрессионные модели · Генеративный ИИ

Порождают объект по частям, каждый раз предсказывая следующий элемент по предыдущим.

VAE80%

Вариационный автоэнкодер · Генеративный ИИ

Генерация через непрерывное вероятностное латентное пространство.

GAN80%

GAN · Генеративный ИИ

Состязательная пара сетей, дающая резкие и реалистичные изображения.

Diffusion80%

Диффузия · Генеративный ИИ

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

Density Estimation80%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.