Раздел 02

Data

Данные

Качество данных определяет потолок качества модели. Эта глава — про подготовку, признаки и корректное разбиение выборки.

новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Data preprocessingактуально

Предобработка данных

Приведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.

Missing valuesактуально

Пропущенные значения

Пропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.

Outliersактуально

Выбросы

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

Data Qualityактуально

Качество данныхиз «Инженерия данных»

Автоматические проверки, которые ловят поломку источника раньше, чем она попадёт в модель.

Feature engineeringактуально

Конструирование признаков

Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.

Encodingактуально

Кодирование категорий

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

Normalization & Standardizationактуально

Нормализация и стандартизация

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.

Feature selectionактуально

Отбор признаков

Убираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.

Dimensionality reductionактуально

Снижение размерности

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Feature Storesновинка

Хранилища признаковиз «MLOps»

Централизованное хранилище признаков, единое для обучения и онлайн-инференса.

Feature engineeringактуально

Работа с признакамииз «Практика ML»

На табличных данных грамотные признаки дают больший прирост, чем смена модели.

Data leakageактуально

Утечка данных

Ситуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.

Train / Validation / Test splitактуально

Разбиение выборки

Train учит, validation настраивает гиперпараметры, test даёт единственную честную оценку — и используется один раз.

Cross-validationактуально

Кросс-валидацияиз «Оценка моделей»

Многократное разбиение выборки, дающее оценку качества вместе с её разбросом.

Synthetic Dataновинка

Синтетические данные

Генерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.

Imbalanced Dataактуально

Дисбаланс классов

Когда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.

Data Labelingактуально

Разметка данных

Организация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.

Weak Supervisionновинка

Слабая разметкаиз «Практика ML»

Программная разметка эвристиками и правилами вместо ручной: быстро, шумно и часто достаточно.

Active Learningактуально

Активное обучениеиз «Практика ML»

Размечать в первую очередь те объекты, которые дадут наибольший прирост качества.

6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.