Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
Ключевые тезисы
- Марковское свойство: будущее зависит только от текущего состояния.
- Кортеж (S, A, P, R, γ) полностью описывает задачу.
- POMDP расширяет модель на случай частичной наблюдаемости.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Формальное определение
Пять компонентов, задающих любую задачу RL.
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- матрица преобразования
- скалярное произведение: мера согласованности векторов
- Марковское свойство: будущее зависит только от текущего состояния, а не от всей истории.
- $\gamma \in [0,1)$ — коэффициент дисконтирования: насколько важна отложенная награда. При агент близорук, при — планирует далеко.
- POMDP — обобщение на случай, когда состояние наблюдается частично (почти все реальные задачи).
- коэффициент дисконтирования: насколько важна отложенная награда
- награда, полученная агентом на шаге
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
2Планирование при известной модели
Value iteration и policy iteration — с чего начинается RL.
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
- Policy iteration чередует оценку политики и её улучшение; сходится за меньшее число итераций, но каждая дороже.
- Оба метода требуют знания и — в реальных задачах их обычно нет, отсюда и появляется обучение с подкреплением.
- Model-based RL сначала выучивает модель среды, затем планирует в ней — это резко экономит взаимодействия.
Связанные темы
Основы обучения с подкреплением
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.