Архитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.
Ключевые тезисы
- Router выбирает k экспертов из N; активными оказываются единицы процентов параметров.
- Балансировка загрузки экспертов — отдельная задача со своим слагаемым в функции потерь.
- Память нужна под все параметры, поэтому выигрыш именно в вычислениях, а не в объёме модели.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Маршрутизация и разреженность
Как активируется только часть модели.
- истинное значение целевой переменной
- объект: вектор признаков
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
- При N = 64 и k = 2 активны около 3% экспертных параметров на каждый токен.
- Балансировка загрузки нужна, иначе router схлопывается на нескольких «любимых» экспертах.
- Память под все параметры всё равно требуется — экономятся вычисления, а не VRAM.
2Практические следствия
Что это значит для эксплуатации.
- MoE-модель с 100B параметров может считать как плотная на 15B — но требует памяти как 100B.
- Распределение экспертов по узлам добавляет сетевой обмен на каждом слое.
- Качество при равных активных параметрах обычно выше, чем у плотной модели, за счёт большей ёмкости.
Связанные темы
Эффективность моделей
Transfer Learning80%
Перенос обучения · Глубокое обучениеИспользование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Distillation80%
Дистилляция · Генеративный ИИОбучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
GPU Inference80%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Cost Model80%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.