Обучение с подкреплением

SARSA

SARSA

классикаУчебный алгоритм; в продовых задачах не используется.

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Ключевые тезисы

  • Учит ценность текущей политики, включая её исследовательские ошибки.
  • Ведёт себя осторожнее Q-learning в опасных средах.
  • Название — от кортежа (s, a, r, s′, a′).

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

On-policy и осторожность

Учим ценность той политики, по которой действуем.

Обозначения
  • скорость обучения: насколько сильно новое наблюдение меняет оценку
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • награда, полученная агентом на шаге
  • ожидаемая суммарная награда за действие a в состоянии s
— реально выбранное следующее действие, а не максимум
Обрыв (Cliff Walking)

Q-learning выучивает кратчайший путь вдоль края обрыва — оптимальный, но при ε-исследовании агент периодически падает. SARSA учитывает свою же случайность и выбирает более длинный безопасный путь.

2

Expected SARSA и связь семейств

Как один параметр превращает SARSA в Q-learning.

Обозначения
  • скорость обучения: насколько сильно новое наблюдение меняет оценку
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • награда, полученная агентом на шаге
  • ожидаемая суммарная награда за действие a в состоянии s
  • суммирование по всем перечисленным элементам
  • политика — правило выбора действия в состоянии
Вместо одного сэмпла берётся ожидание по политике — дисперсия падает

Если жадная, сумма превращается в максимум и мы получаем Q-learning. Так три алгоритма оказываются частными случаями одной формулы.

Связанные темы

Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.