Обучение с подкреплением

Value Functions

Функции ценности

актуальноТекущий рабочий стандарт

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Ключевые тезисы

  • Уравнение Беллмана связывает ценность состояния с ценностью следующих.
  • Функция преимущества A = Q − V снижает дисперсию в policy-методах.
  • Оценки ценности лежат в основе всех value-based алгоритмов.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Уравнения Беллмана

Рекуррентная связь между ценностью состояния и ценностью следующих.

Обозначения
  • математическое ожидание — среднее по распределению
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • награда, полученная агентом на шаге
  • политика — правило выбора действия в состоянии
Обозначения
  • математическое ожидание — среднее по распределению
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • награда, полученная агентом на шаге
Оптимальное уравнение Беллмана — основа Q-обучения

Функция преимущества отвечает на вопрос «насколько это действие лучше среднего в данном состоянии». Она используется в actor-critic методах для снижения дисперсии градиента.

2

TD-обучение против Монте-Карло

Обновляться на каждом шаге или ждать конца эпизода.

Монте-КарлоTD(0)
Когда обновляетв конце эпизодана каждом шаге
Смещениенетесть (бутстрэп)
Дисперсиявысокаянизкая
Непрерывные задачине работаетработает
Обозначения
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • награда, полученная агентом на шаге
  • ожидаемая суммарная награда из состояния s
TD() и GAE плавно интерполируют между двумя крайностями

Связанные темы

Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.