Генерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Ключевые тезисы
- Работает лучше всего там, где процесс порождения известен: рендеринг, симуляция, шаблоны документов.
- Разрыв домена (sim-to-real) — главная проблема: модель учится на артефактах генератора.
- Синтетика от LLM полезна для холодного старта, но требует проверки на дубликаты и смещения.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Способы получить синтетику
От простых аугментаций до генеративных моделей.
| Метод | Где работает | Ограничение |
|---|---|---|
| Аугментации | изображения, аудио, текст | не создаёт новых сущностей |
| Симуляция / рендеринг | зрение, робототехника | разрыв домена sim-to-real |
| Шаблоны и правила | документы, логи, табличные данные | не покрывает редкие случаи |
| Генеративные модели | текст, изображения | наследует смещения и может дублировать обучающие данные |
2Риски и проверки
Как не обучить модель на артефактах генератора.
- Тестовая выборка всегда только реальная — иначе оценка не значит ничего.
- Проверяйте, отличает ли простой классификатор синтетику от реальных данных: если отличает легко, разрыв домена велик.
- Следите за дубликатами: генератор склонен воспроизводить обучающие примеры почти дословно.
- Доля синтетики в обучении — гиперпараметр; часто оптимум далеко не 100%.
Связанные темы
Разметка и слабый надзор
Data Labeling85%
Разметка данных · ДанныеОрганизация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Active Learning85%
Активное обучение · Практика MLРазмечать в первую очередь те объекты, которые дадут наибольший прирост качества.
Weak Supervision85%
Слабая разметка · Практика MLПрограммная разметка эвристиками и правилами вместо ручной: быстро, шумно и часто достаточно.
Cohen's Kappa85%
Каппа Коэна · МетрикиСогласие двух разметчиков или модели с разметкой с поправкой на случайные совпадения.
Error analysis85%
Анализ ошибок · Оценка моделейРучной разбор случаев, где модель ошибается: почти всегда даёт больше, чем очередной перебор гиперпараметров.