Обучение с подкреплением

MDP

Марковский процесс принятия решений

актуальноТекущий рабочий стандарт

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

Ключевые тезисы

  • Марковское свойство: будущее зависит только от текущего состояния.
  • Кортеж (S, A, P, R, γ) полностью описывает задачу.
  • POMDP расширяет модель на случай частичной наблюдаемости.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Формальное определение

Пять компонентов, задающих любую задачу RL.

Обозначения
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • матрица преобразования
  • скалярное произведение: мера согласованности векторов
  • Марковское свойство: будущее зависит только от текущего состояния, а не от всей истории.
  • $\gamma \in [0,1)$ — коэффициент дисконтирования: насколько важна отложенная награда. При агент близорук, при — планирует далеко.
  • POMDP — обобщение на случай, когда состояние наблюдается частично (почти все реальные задачи).
Обозначения
  • коэффициент дисконтирования: насколько важна отложенная награда
  • награда, полученная агентом на шаге
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
Возврат — то, что агент на самом деле максимизирует
2

Планирование при известной модели

Value iteration и policy iteration — с чего начинается RL.

Обозначения
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
Value iteration: повторяем до сходимости
  • Policy iteration чередует оценку политики и её улучшение; сходится за меньшее число итераций, но каждая дороже.
  • Оба метода требуют знания и — в реальных задачах их обычно нет, отсюда и появляется обучение с подкреплением.
  • Model-based RL сначала выучивает модель среды, затем планирует в ней — это резко экономит взаимодействия.

Связанные темы

Основы обучения с подкреплением

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.