Генеративный ИИ

Distillation

Дистилляция

новинкаНовое или быстро растущее направление

Обучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.

Ключевые тезисы

  • Ученик учится на «мягких» распределениях учителя, а не только на метках.
  • Для LLM это чаще всего дообучение на ответах сильной модели по вашим запросам.
  • Каскад «маленькая модель + эскалация в большую» часто выгоднее чистой дистилляции.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как дистиллировать

Три рабочих варианта.

  1. По логитам: ученик приближает распределение учителя (классический Hinton-подход).
  2. По ответам: ученик дообучается на выходах сильной модели по вашим реальным запросам.
  3. По рассуждениям: в обучающие примеры включаются цепочки рассуждений учителя.
Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • истинное значение целевой переменной
  • распределение, предсказанное моделью
  • функция потерь — то, что минимизируется при обучении
  • норма — длина вектора
Температура T смягчает распределения и переносит «тёмные знания» о похожих классах
2

Каскад вместо дистилляции

Часто более выгодная альтернатива.

Маленькая модель отвечает сама и оценивает свою уверенность; при низкой уверенности запрос уходит к большой модели. При доле эскалации 20% средняя стоимость падает в несколько раз почти без потери качества.

  • Порог эскалации подбирается по кривой «стоимость — качество» на валидации.
  • Нужна честная оценка уверенности: логиты, самосогласованность или отдельный классификатор.
  • Каскад проще внедрить и откатить, чем дистиллированную модель.

Связанные темы

Эффективность моделей