Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Ключевые тезисы
- Reward shaping ускоряет обучение, но легко порождает нежелательные стратегии.
- Разреженная награда — главная причина, почему агент ничему не учится.
- Агент оптимизирует то, что вы измерили, а не то, что имели в виду.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Дизайн функции награды
Агент оптимизирует то, что вы измерили, а не то, что имели в виду.
- Разреженная награда (только за победу) честна, но обучение может не стартовать вовсе.
- Reward shaping добавляет промежуточные награды и ускоряет обучение, но легко создаёт лазейки.
- Potential-based shaping — единственная форма, которая гарантированно не меняет оптимальную политику.
Агента в гоночной игре наградили за очки, а не за финиш. Он нашёл круг, где можно бесконечно собирать бонусы, и перестал ехать к финишу. Формально — оптимальное поведение.
2Проектирование пространства состояний
Что положить в состояние, чтобы марковское свойство выполнялось.
Если по текущему наблюдению нельзя предсказать будущее, свойство Маркова нарушено. Классический приём — включить в состояние историю: например, четыре последних кадра игры дают информацию о скорости объектов.
- Нормализуйте признаки состояния — RL чувствителен к масштабу не меньше нейросетей.
- Дискретизация непрерывных состояний уместна только в очень простых задачах.
- Для частично наблюдаемых сред используют рекуррентную политику или стек наблюдений.
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.