Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.
Ключевые тезисы
- Пары сравнений ответов обучают reward-модель.
- PPO или DPO настраивают модель под эту награду.
- Именно этот этап превращает языковую модель в полезного ассистента.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три стадии выравнивания
SFT → reward model → оптимизация политики.
- SFT: дообучение на демонстрациях «запрос — хороший ответ».
- Reward model: обучается на парах сравнений «ответ A лучше ответа B».
- RL: PPO максимизирует награду с KL-штрафом за отклонение от SFT-модели.
- стандартное отклонение — разброс величины
- параметры генеративной модели
- награда, полученная агентом на шаге
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- функция потерь — то, что минимизируется при обучении
DPO упрощает третий шаг: оптимизирует политику прямо по парам предпочтений, без отдельной модели награды и без RL. Проще, стабильнее и часто не хуже по качеству.
2DPO вместо PPO
Прямая оптимизация предпочтений.
- стандартное отклонение — разброс величины
- параметры генеративной модели
- коэффициент сглаживания (инерции)
- истинное значение целевой переменной
- объект: вектор признаков
- веса модели — то, что подбирается при обучении
- функция потерь — то, что минимизируется при обучении
DPO обходится без отдельной модели награды и без RL-цикла: обучение выглядит как обычная классификация на парах. Проще в реализации, устойчивее и по качеству сопоставимо с PPO на многих задачах.
Связанные темы
Адаптация языковых моделей
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Fine-tuning80%
Дообучение · Генеративный ИИАдаптация предобученной модели под домен или формат на собственных данных.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
PPO80%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.
GPT80%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.