Обучение с подкреплением

Q-Learning

Q-обучение

актуальноТекущий рабочий стандарт

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

Что означает каждый компонент
  • скорость обучения: насколько сильно доверяем новому опыту
  • цель: немедленная награда плюс дисконтированная лучшая ценность следующего состояния
  • текущая оценка. Разность цели и оценки — TD-ошибка, она и двигает обучение

Ключевые тезисы

  • Обновление использует max по действиям следующего состояния.
  • ε-greedy балансирует исследование и эксплуатацию.
  • В табличном виде сходится к оптимуму при достаточном исследовании.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Правило обновления

Off-policy обучение: учимся оптимуму, ведя себя исследовательски.

Обозначения
  • скорость обучения: насколько сильно новое наблюдение меняет оценку
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
  • награда, полученная агентом на шаге
  • ожидаемая суммарная награда за действие a в состоянии s

Максимум по действиям следующего состояния означает, что мы обновляемся в сторону оптимальной политики, независимо от того, какое действие агент реально выбрал. Это и делает метод off-policy.

  • ε-greedy: с вероятностью случайное действие, иначе жадное. обычно затухает со временем.
  • В табличном виде метод сходится к оптимуму при бесконечном исследовании и убывающем .
  • Максимум систематически переоценивает ценности — эту проблему решает Double Q-learning.
2

Стратегии исследования

Как балансировать между «пробовать» и «использовать».

  • ε-greedy с затуханием: от 1.0 в начале до 0.05 к концу обучения.
  • Softmax / Boltzmann: вероятность действия пропорциональна — «почти хорошие» действия выбираются чаще плохих.
  • UCB: бонус за редко пробованные действия, обоснованный доверительными интервалами.
  • Внутренняя мотивация: награда за новизну состояния — спасает при разреженной внешней награде.

Связанные темы

Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.