On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Ключевые тезисы
- Учит ценность текущей политики, включая её исследовательские ошибки.
- Ведёт себя осторожнее Q-learning в опасных средах.
- Название — от кортежа (s, a, r, s′, a′).
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1On-policy и осторожность
Учим ценность той политики, по которой действуем.
- скорость обучения: насколько сильно новое наблюдение меняет оценку
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
- ожидаемая суммарная награда за действие a в состоянии s
Q-learning выучивает кратчайший путь вдоль края обрыва — оптимальный, но при ε-исследовании агент периодически падает. SARSA учитывает свою же случайность и выбирает более длинный безопасный путь.
2Expected SARSA и связь семейств
Как один параметр превращает SARSA в Q-learning.
- скорость обучения: насколько сильно новое наблюдение меняет оценку
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
- ожидаемая суммарная награда за действие a в состоянии s
- суммирование по всем перечисленным элементам
- политика — правило выбора действия в состоянии
Если жадная, сумма превращается в максимум и мы получаем Q-learning. Так три алгоритма оказываются частными случаями одной формулы.
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.