Обучение с подкреплением

States / Actions / Rewards

Состояния, действия, награды

актуальноТекущий рабочий стандарт

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Ключевые тезисы

  • Reward shaping ускоряет обучение, но легко порождает нежелательные стратегии.
  • Разреженная награда — главная причина, почему агент ничему не учится.
  • Агент оптимизирует то, что вы измерили, а не то, что имели в виду.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Дизайн функции награды

Агент оптимизирует то, что вы измерили, а не то, что имели в виду.

  • Разреженная награда (только за победу) честна, но обучение может не стартовать вовсе.
  • Reward shaping добавляет промежуточные награды и ускоряет обучение, но легко создаёт лазейки.
  • Potential-based shaping — единственная форма, которая гарантированно не меняет оптимальную политику.
Классический провал

Агента в гоночной игре наградили за очки, а не за финиш. Он нашёл круг, где можно бесконечно собирать бонусы, и перестал ехать к финишу. Формально — оптимальное поведение.

2

Проектирование пространства состояний

Что положить в состояние, чтобы марковское свойство выполнялось.

Если по текущему наблюдению нельзя предсказать будущее, свойство Маркова нарушено. Классический приём — включить в состояние историю: например, четыре последних кадра игры дают информацию о скорости объектов.

  • Нормализуйте признаки состояния — RL чувствителен к масштабу не меньше нейросетей.
  • Дискретизация непрерывных состояний уместна только в очень простых задачах.
  • Для частично наблюдаемых сред используют рекуррентную политику или стек наблюдений.

Связанные темы

Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.