Пропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.
Ключевые тезисы
- MCAR / MAR / MNAR — три механизма пропусков с разными последствиями для смещения оценок.
- Простые стратегии: медиана, мода, отдельная категория; сложные: KNN-imputer, модельное восстановление.
- Флаг «значение было пропущено» часто сам по себе является сильным признаком.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три механизма пропусков
MCAR, MAR и MNAR: от механизма зависит, можно ли просто заполнить пропуск.
| Механизм | Что это значит | Пример | Можно ли заполнять |
|---|---|---|---|
| MCAR | пропуск не зависит ни от чего | сбой датчика | да, смещения не будет |
| MAR | зависит от других признаков | молодые реже указывают доход | да, но по группам |
| MNAR | зависит от самого значения | высокие зарплаты скрывают | нет — нужен флаг и осторожность |
Проверить механизм полностью нельзя, но многое видно: сравните распределения признаков в строках с пропуском и без. Если они различаются — это не MCAR.
2Стратегии заполнения
От медианы до модельного восстановления — и когда что оправдано.
- Удалить строки — только если пропусков мало (< 5%) и они MCAR.
- Константа / медиана / мода — быстро и безопасно; медиана устойчивее среднего к выбросам.
- Отдельная категория «неизвестно» — для категориальных признаков часто лучший вариант.
- По группам: медиана дохода внутри возрастной группы — простой способ учесть MAR.
- Модель: обучить регрессию/KNN, предсказывающую пропущенный признак по остальным.
Почти всегда стоит добавить бинарный признак was_missing. Часто сам факт пропуска информативнее подставленного значения: «не указал доход» — сильный сигнал в скоринге.
Связанные темы
Подготовка данных
Data preprocessing75%
Предобработка данных · ДанныеПриведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.
Outliers75%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Encoding75%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Normalization & Standardization75%
Нормализация и стандартизация · ДанныеПриведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.
Feature engineering75%
Конструирование признаков · ДанныеСоздание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
ML Pipelines75%
ML-пайплайны · MLOpsОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.