Обучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.
Ключевые тезисы
- Главная проблема — экстраполяция: модель переоценивает действия, которых нет в данных.
- CQL и IQL штрафуют оценку за выход из распределения логов.
- Оценка политики по логам (off-policy evaluation) — отдельная и непростая задача.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Проблема экстраполяции
Почему нельзя просто обучить Q-функцию на логах.
Q-функция обучается на действиях из логов, но при выборе максимума заглядывает и в действия, которых там не было. Для них оценка ничем не подкреплена и обычно завышена — политика начинает предпочитать именно их.
- CQL штрафует Q-значения действий вне распределения данных.
- IQL вообще избегает максимизации по неизвестным действиям, используя квантильную регрессию.
- BCQ ограничивает политику действиями, похожими на логированные.
2Как оценить политику без среды
Off-policy evaluation.
- Importance sampling: перевзвешивание логов отношением вероятностей политик; дисперсия огромна при длинных траекториях.
- Doubly robust сочетает модель награды и перевзвешивание — устойчивее.
- Практический минимум: сравнение с логированной политикой на отложенном периоде и осторожный онлайн-пилот.
Оффлайн RL особенно интересен там, где эксперименты дороги или опасны: медицина, промышленное управление, рекомендации с долгим горизонтом.
Связанные темы
Решения в условиях неопределённости
Multi-armed Bandits80%
Многорукие бандиты · Обучение с подкреплениемУпрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.
Beta Distribution80%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
A/B testing80%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Experiment Infrastructure80%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Bayesian Optimization80%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.