Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
Ключевые тезисы
- Критик снижает дисперсию градиента политики.
- A2C/A3C распараллеливают сбор опыта по множеству сред.
- SAC и DDPG — популярные варианты для непрерывного управления.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Два компонента
Актор предлагает действия, критик их оценивает.
- математическое ожидание — среднее по распределению
- параметры модели
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
- веса модели — то, что подбирается при обучении
- матрица преобразования
- A2C/A3C — параллельный сбор опыта многими воркерами.
- DDPG/TD3 — детерминированная политика для непрерывного управления.
- SAC — добавляет энтропийный бонус: агент вознаграждается за разнообразие действий, что улучшает исследование.
2Soft Actor-Critic
Максимизируем награду и энтропию одновременно.
- математическое ожидание — среднее по распределению
- скорость обучения: насколько сильно новое наблюдение меняет оценку
- награда, полученная агентом на шаге
- суммирование по всем перечисленным элементам
- политика — правило выбора действия в состоянии
Такой агент не схлопывается в одну стратегию раньше времени, лучше исследует и оказывается устойчивее к изменению среды. SAC — один из самых надёжных методов для непрерывного управления, в том числе в робототехнике.
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.