Использование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Ключевые тезисы
- Заморозка бэкбона и обучение головы — минимальный рецепт при нескольких сотнях примеров.
- Дискриминативный learning rate: нижние слои учим медленнее верхних.
- Разрыв доменов решает промежуточное дообучение на неразмеченных данных целевого домена.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Рецепт дообучения
Порядок действий, работающий в большинстве задач.
- Заменить голову под свою задачу, заморозить бэкбон, обучить голову (2–3 эпохи).
- Разморозить верхние блоки, продолжить с lr в 5–10 раз меньше.
- При достаточном объёме данных разморозить всё с дискриминативным lr по слоям.
- Всегда: аугментации, ранняя остановка, отслеживание разрыва train/val.
Чем меньше данных и чем ближе домен к предобучению, тем больше слоёв стоит держать замороженными.
2Разрыв доменов
Что делать, когда данные совсем не похожи на ImageNet.
Медицинские снимки, спутниковые изображения и промышленный контроль плохо покрываются обычным предобучением. Помогает промежуточный этап: self-supervised дообучение на своих неразмеченных данных, а уже потом обучение с метками.
- Даже несколько тысяч неразмеченных изображений своего домена дают заметный эффект.
- Для текста аналог — дообучение языковой модели на корпусе домена перед классификацией.
Связанные темы
Эффективность моделей
Mixture of Experts80%
Смесь экспертов · Глубокое обучениеАрхитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.
Distillation80%
Дистилляция · Генеративный ИИОбучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
GPU Inference80%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Cost Model80%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.