Устойчивый policy-gradient метод с ограничением величины обновления политики.
- обычный policy gradient: отношение вероятностей новой и старой политики, умноженное на преимущество
- обрезка: если политика меняется слишком сильно, градиент обнуляется — отсюда устойчивость PPO
Ключевые тезисы
- Clipped surrogate objective не даёт политике уйти слишком далеко за шаг.
- Хороший баланс простоты, стабильности и качества — де-факто стандарт.
- Используется в RLHF для дообучения языковых моделей.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Clipped objective
Как не дать политике измениться слишком сильно за один шаг.
- математическое ожидание — среднее по распределению
- параметры модели
- малая величина: шум, допуск или защита от деления на ноль
- награда, полученная агентом на шаге
- матрица преобразования
- функция потерь — то, что минимизируется при обучении
- политика — правило выбора действия в состоянии
Если новая политика слишком сильно отклоняется от старой, отношение вероятностей обрезается и градиент обнуляется. Это даёт устойчивость TRPO без его сложной оптимизации со вторым порядком.
В RLHF PPO используется с дополнительным KL-штрафом относительно исходной модели: он не даёт языковой модели уйти слишком далеко и потерять языковые способности ради максимизации награды.
2Практические детали PPO
Что настраивать и на что смотреть.
- –; несколько эпох (3–10) по одному собранному батчу.
- Обязательны: нормализация наблюдений и преимуществ, клиппинг градиента.
- Следите за KL между старой и новой политикой: резкий рост означает, что шаг слишком велик.
- Энтропийный бонус в функции потерь предотвращает преждевременную детерминированность.
В RLHF ту же схему применяют к языковой модели: «действие» — это выбранный токен, а KL-штраф относительно исходной модели не даёт ей деградировать ради награды.
Связанные темы
Адаптация языковых моделей · Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Fine-tuning80%
Дообучение · Генеративный ИИАдаптация предобученной модели под домен или формат на собственных данных.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
RLHF80%
RLHF · Генеративный ИИДообучение по человеческим предпочтениям: модель награды + оптимизация политики.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
GPT80%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.