Организация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Ключевые тезисы
- Согласие аннотаторов (Cohen's kappa) — верхняя граница достижимого качества модели.
- Золотой набор с известными ответами подмешивается в задания для контроля.
- Спорные случаи должны попадать к эксперту, а не решаться большинством голосов.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как организовать разметку
Пять шагов, экономящих месяцы.
- Написать инструкцию с примерами и, главное, с разбором спорных случаев.
- Разметить 100 объектов самому — почти всегда инструкция после этого меняется.
- Измерить согласие аннотаторов на пересекающейся части (каппа Коэна).
- Подмешивать золотой набор с известными ответами для контроля качества.
- Настроить цикл: спорные случаи → эксперт → обновление инструкции.
2Качество разметки и потолок модели
Почему модель не может быть точнее данных.
Если два эксперта согласны в 85% случаев, ждать от модели 95% бессмысленно: оставшиеся 15% — это не ошибка модели, а неопределённость самой задачи. Часто выгоднее уточнить определение класса, чем менять архитектуру.
Практическое правило: прежде чем вкладываться в модель, проверьте, сколько ошибок в топ-100 самых уверенных ошибок относятся к разметке. Обычно их там от четверти до половины.
Связанные темы
Разметка и слабый надзор
Synthetic Data85%
Синтетические данные · ДанныеГенерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Active Learning85%
Активное обучение · Практика MLРазмечать в первую очередь те объекты, которые дадут наибольший прирост качества.
Weak Supervision85%
Слабая разметка · Практика MLПрограммная разметка эвристиками и правилами вместо ручной: быстро, шумно и часто достаточно.
Cohen's Kappa85%
Каппа Коэна · МетрикиСогласие двух разметчиков или модели с разметкой с поправкой на случайные совпадения.
Error analysis85%
Анализ ошибок · Оценка моделейРучной разбор случаев, где модель ошибается: почти всегда даёт больше, чем очередной перебор гиперпараметров.