Перевод бизнес-вопроса в ML-задачу с целевой переменной, метрикой и ограничениями.
Ключевые тезисы
- Сначала определите, как будет приниматься решение по предсказанию.
- Проверьте, что нужные данные существуют на момент предсказания.
- Иногда правильный ответ — правило или аналитика, а не модель.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Вопросы до первой строчки кода
Половина проваленных проектов проваливается здесь.
- Какое решение будет приниматься по предсказанию? Если никакое — модель не нужна.
- Что именно предсказываем: событие, величину, ранг? Каков горизонт?
- Какие данные доступны в момент предсказания, а не задним числом?
- Как измеряется успех в бизнес-метриках и какая ML-метрика ей ближе всего?
- Какова цена ошибки каждого типа? Отсюда возьмётся порог.
- Каковы ограничения: задержка, стоимость инференса, объяснимость, регуляторика.
Иногда правильный ответ — простое правило или дашборд. Это не поражение: это экономия месяцев и поддерживаемое решение.
2Выбор целевой переменной
Самое ответственное решение всего проекта.
Задача «предсказать отток». Что такое отток: не заходил 30 дней? отменил подписку? снизил траты вдвое? Каждое определение даёт свою модель, свою метрику и своё действие. Определение должно исходить из того, что вы собираетесь делать с предсказанием.
- Целевая переменная должна быть измеримой и однозначно вычисляемой из данных.
- Горизонт («в течение 30 дней») задаётся вместе с определением.
- Проверьте базовую частоту события: при 0.1% положительных нужен другой подход, чем при 30%.
Связанные темы
Рабочий цикл ML-инженера
Baselines70%
Бейзлайны · Практика MLПростейшее решение, с которым сравнивается всё остальное: константа, правило, логистическая регрессия.
Debugging models70%
Отладка моделей · Практика MLСистематический поиск причины, почему модель не учится или ведёт себя странно.
Hyperparameter tuning70%
Настройка гиперпараметров · Практика MLПоиск конфигурации модели по валидационной метрике — последний, а не первый шаг работы.
Overfitting70%
Переобучение · Практика MLМодель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.
Error analysis70%
Анализ ошибок · Оценка моделейРучной разбор случаев, где модель ошибается: почти всегда даёт больше, чем очередной перебор гиперпараметров.
Production ML70%
ML в продакшене · Практика MLМодель в проде — это сервис с SLA, мониторингом, версионированием и планом отката.