Глубокое обучение

Transfer Learning

Перенос обучения

актуальноТекущий рабочий стандарт

Использование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.

Ключевые тезисы

  • Заморозка бэкбона и обучение головы — минимальный рецепт при нескольких сотнях примеров.
  • Дискриминативный learning rate: нижние слои учим медленнее верхних.
  • Разрыв доменов решает промежуточное дообучение на неразмеченных данных целевого домена.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Рецепт дообучения

Порядок действий, работающий в большинстве задач.

  1. Заменить голову под свою задачу, заморозить бэкбон, обучить голову (2–3 эпохи).
  2. Разморозить верхние блоки, продолжить с lr в 5–10 раз меньше.
  3. При достаточном объёме данных разморозить всё с дискриминативным lr по слоям.
  4. Всегда: аугментации, ранняя остановка, отслеживание разрыва train/val.
На практике

Чем меньше данных и чем ближе домен к предобучению, тем больше слоёв стоит держать замороженными.

2

Разрыв доменов

Что делать, когда данные совсем не похожи на ImageNet.

Медицинские снимки, спутниковые изображения и промышленный контроль плохо покрываются обычным предобучением. Помогает промежуточный этап: self-supervised дообучение на своих неразмеченных данных, а уже потом обучение с метками.

  • Даже несколько тысяч неразмеченных изображений своего домена дают заметный эффект.
  • Для текста аналог — дообучение языковой модели на корпусе домена перед классификацией.

Связанные темы

Эффективность моделей