Данные

Train / Validation / Test split

Разбиение выборки

актуальноТекущий рабочий стандарт

Train учит, validation настраивает гиперпараметры, test даёт единственную честную оценку — и используется один раз.

Ключевые тезисы

  • Стратификация сохраняет баланс классов в каждой части выборки.
  • Группы (пользователи, пациенты, устройства) не должны пересекаться между частями.
  • Для временных данных разбиение только хронологическое, без перемешивания.
Тема также относится к главам:Оценка моделейСхемы валидации

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Зачем три части, а не две

Валидация настраивает, тест измеряет — и смешивать их нельзя.

Если подбирать гиперпараметры по тесту, оценка перестаёт быть честной: вы подстроились под конкретную выборку. Валидация нужна как «расходный материал» для настройки, тест — как единственная финальная проверка, которую используют один раз.

ЧастьДоля (типично)Для чего
Train60–80%обучение параметров
Validation10–20%гиперпараметры, ранняя остановка, отбор признаков
Test10–20%финальная оценка, один раз
2

Стратификация, группы и время

Три случая, когда случайное разбиение неверно.

  • Дисбаланс классовStratifiedKFold: доля редкого класса сохраняется в каждой части.
  • Связанные объектыGroupKFold: все записи одного пользователя, пациента или устройства идут в одну часть.
  • Временные данные → хронологическое разбиение: обучаемся на прошлом, проверяемся на будущем, без перемешивания.
На практике

Если объектов мало, вместо одной валидационной выборки лучше использовать кросс-валидацию: она даёт не только среднее качество, но и его разброс.

фолд 1
фолд 2
фолд 3
фолд 4
фолд 5
обучение валидация
обучений модели5
доля валидации20%
схемаK-Fold
Схема разбиения
K-Fold против временной схемы — сравните, какая часть данных доступна модели в каждом случае

Связанные темы

Утечки и честная валидация

Data leakage85%

Утечка данных · Данные

Ситуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.

Data leakage85%

Утечка данных · Практика ML

Самая дорогая ошибка в ML: модель отлично работает офлайн и разваливается в проде.

Cross-validation85%

Кросс-валидация · Оценка моделей

Многократное разбиение выборки, дающее оценку качества вместе с её разбросом.

K-Fold85%

K-Fold · Оценка моделей

Данные делятся на K частей; каждая по очереди становится валидационной.

Stratified K-Fold85%

Стратифицированный K-Fold · Оценка моделей

K-Fold с сохранением пропорции классов в каждом фолде.

Leave-One-Out85%

Leave-One-Out · Оценка моделей

Предельный случай: валидация состоит ровно из одного объекта, и так N раз.

Bootstrap85%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Normalization & Standardization85%

Нормализация и стандартизация · Данные

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.