Как выжать из видеокарты пропускную способность и не переплачивать.
Ключевые тезисы
- Декодирование в LLM упирается в пропускную способность памяти, а не в вычисления.
- Квантизация int8/int4 и компиляция (TensorRT, ONNX Runtime) дают кратное ускорение.
- Мультиарендность: несколько моделей на одной карте через MPS или MIG — сложнее, но дешевле.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Где узкое место
Вычисления или память.
У генерации токенов в LLM интенсивность низкая: на каждый токен читаются все веса модели, а вычислений мало. Поэтому декодирование упирается в пропускную способность памяти, и увеличение вычислительной мощности не помогает — помогают квантизация и батчинг.
2Практические оптимизации
По эффекту на усилие.
| Приём | Ускорение | Риск |
|---|---|---|
| int8-квантизация | 1.5–2× | небольшая потеря качества |
| int4 (LLM) | 2–3× | заметнее на сложных задачах |
| Компиляция (TensorRT/ORT) | 1.3–2× | поддержка не всех операций |
| Динамический батчинг | 3–10× | рост задержки |
| Дистилляция | 2–10× | нужна отдельная тренировка |
После любой оптимизации обязательно перепроверьте качество на тестовом наборе: «незаметная» потеря от квантизации иногда бьёт именно по редким и важным классам.
Связанные темы
Эффективность моделей · Инференс и эксплуатация
Cost Model97%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.
Requirements and SLA85%
Требования и SLA · Системный дизайн ML-сервисовЧисла, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.
Serving Architecture85%
Архитектура инференса · Системный дизайн ML-сервисовМодель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.
Caching85%
Кеширование · Системный дизайн ML-сервисовНе считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.
Batching and Queues85%
Батчинг и очереди · Системный дизайн ML-сервисовСобирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.
Scaling85%
Масштабирование · Системный дизайн ML-сервисовГоризонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.
Reliability85%
Отказоустойчивость · Системный дизайн ML-сервисовЧто происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.
Observability85%
Наблюдаемость · Системный дизайн ML-сервисовЛоги, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.
LLM Serving85%
Обслуживание LLM · Системный дизайн ML-сервисовОтдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.
Model Deployment85%
Деплой моделей · MLOpsДоставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.
Monitoring85%
Мониторинг · MLOpsНаблюдение за инфраструктурой, данными и качеством предсказаний после релиза.
Docker85%
Docker · MLOpsКонтейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.
Kubernetes85%
Kubernetes · MLOpsОркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.
Transfer Learning80%
Перенос обучения · Глубокое обучениеИспользование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.
Mixture of Experts80%
Смесь экспертов · Глубокое обучениеАрхитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.
Distillation80%
Дистилляция · Генеративный ИИОбучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.