Чем измеряется ошибка, когда правильного ответа не существует: правдоподобие, состязательные потери, предсказание шума и контрастные цели.
Ключевые тезисы
- Авторегрессионные модели минимизируют кросс-энтропию — ту же, что и обычная классификация, только по токенам.
- У GAN функция потерь сама обучается: её роль играет дискриминатор.
- Диффузия сводит генерацию к регрессии: предсказать добавленный шум.
Тема также относится к главам:Глубокое обучениеФункции потерь · Генеративные архитектуры
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Четыре семейства потерь
Каждая генеративная архитектура оптимизирует своё.
| Модель | Функция потерь | Что минимизируется |
|---|---|---|
| Авторегрессионная (LLM) | кросс-энтропия по токенам | отрицательное лог-правдоподобие |
| VAE | реконструкция + KL (ELBO) | нижняя оценка правдоподобия |
| GAN | состязательная (обучаемая) | расхождение распределений через дискриминатор |
| Диффузия | MSE по шуму | ошибка предсказания добавленного шума |
| Контрастная (CLIP) | InfoNCE | близость правильных пар против остальных |
На практике
Общий знаменатель: все они так или иначе приближают распределение данных. Разница в том, как это расхождение измеряется — явно (правдоподобие) или через вспомогательную модель (дискриминатор).
2Почему оценка генерации сложна
Функция потерь и качество расходятся сильнее, чем в классификации.
- Низкая перплексия не гарантирует полезного ответа: модель может быть уверенной и бесполезной.
- Значение потерь GAN вообще не связано с качеством картинок — нужны FID и человеческая оценка.
- Пиксельная MSE у VAE даёт размытость: она усредняет все правдоподобные варианты.
- Поэтому в генеративных задачах всегда нужна вторая, внешняя метрика качества.
MSE4.00
MAE2.00
Huber1.50