Генеративный ИИ

RLHF

RLHF

новинкаDPO и его варианты постепенно вытесняют классический PPO-конвейер.

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

Ключевые тезисы

  • Пары сравнений ответов обучают reward-модель.
  • PPO или DPO настраивают модель под эту награду.
  • Именно этот этап превращает языковую модель в полезного ассистента.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Три стадии выравнивания

SFT → reward model → оптимизация политики.

  1. SFT: дообучение на демонстрациях «запрос — хороший ответ».
  2. Reward model: обучается на парах сравнений «ответ A лучше ответа B».
  3. RL: PPO максимизирует награду с KL-штрафом за отклонение от SFT-модели.
Обозначения
  • стандартное отклонение — разброс величины
  • параметры генеративной модели
  • награда, полученная агентом на шаге
  • истинное значение целевой переменной
  • объект: вектор признаков
  • веса модели — то, что подбирается при обучении
  • функция потерь — то, что минимизируется при обучении
Модель награды учится на предпочтениях, а не на абсолютных оценках

DPO упрощает третий шаг: оптимизирует политику прямо по парам предпочтений, без отдельной модели награды и без RL. Проще, стабильнее и часто не хуже по качеству.

2

DPO вместо PPO

Прямая оптимизация предпочтений.

Обозначения
  • стандартное отклонение — разброс величины
  • параметры генеративной модели
  • коэффициент сглаживания (инерции)
  • истинное значение целевой переменной
  • объект: вектор признаков
  • веса модели — то, что подбирается при обучении
  • функция потерь — то, что минимизируется при обучении

DPO обходится без отдельной модели награды и без RL-цикла: обучение выглядит как обычная классификация на парах. Проще в реализации, устойчивее и по качеству сопоставимо с PPO на многих задачах.

Связанные темы

Адаптация языковых моделей