Обучение с подкреплением

Offline RL

Оффлайн RL

новинкаНовое или быстро растущее направление

Обучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.

Ключевые тезисы

  • Главная проблема — экстраполяция: модель переоценивает действия, которых нет в данных.
  • CQL и IQL штрафуют оценку за выход из распределения логов.
  • Оценка политики по логам (off-policy evaluation) — отдельная и непростая задача.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Проблема экстраполяции

Почему нельзя просто обучить Q-функцию на логах.

Q-функция обучается на действиях из логов, но при выборе максимума заглядывает и в действия, которых там не было. Для них оценка ничем не подкреплена и обычно завышена — политика начинает предпочитать именно их.

  • CQL штрафует Q-значения действий вне распределения данных.
  • IQL вообще избегает максимизации по неизвестным действиям, используя квантильную регрессию.
  • BCQ ограничивает политику действиями, похожими на логированные.
2

Как оценить политику без среды

Off-policy evaluation.

  • Importance sampling: перевзвешивание логов отношением вероятностей политик; дисперсия огромна при длинных траекториях.
  • Doubly robust сочетает модель награды и перевзвешивание — устойчивее.
  • Практический минимум: сравнение с логированной политикой на отложенном периоде и осторожный онлайн-пилот.
На практике

Оффлайн RL особенно интересен там, где эксперименты дороги или опасны: медицина, промышленное управление, рекомендации с долгим горизонтом.

Связанные темы

Решения в условиях неопределённости