Раздел 24

ML System Design

Системный дизайн ML-сервисов

Инженерная глава о том, что окружает модель: требования и SLA, архитектура инференса, кеши, очереди, стоимость, приватность и наблюдаемость. Здесь решается, доживёт ли модель до пользователя.

3 новинок10 актуальныхИнженерное направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Requirements and SLAактуально

Требования и SLA

Числа, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.

Serving Architectureактуально

Архитектура инференса

Модель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.

Online and Offline Featuresактуально

Онлайн- и офлайн-признаки

Часть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.

Cost Modelактуально

Экономика сервиса

Стоимость одного предсказания и точка, где модель перестаёт окупаться.

Model Deploymentактуально

Деплой моделейиз «MLOps»

Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.

Dockerактуально

Dockerиз «MLOps»

Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.

GPU Inferenceновинка

GPU-инференс

Как выжать из видеокарты пропускную способность и не переплачивать.

LLM Servingновинка

Обслуживание LLM

Отдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.

Cachingактуально

Кеширование

Не считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.

Batching and Queuesактуально

Батчинг и очереди

Собирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.

Scalingактуально

Масштабирование

Горизонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.

LLMновинка

Большие языковые моделииз «Генеративный ИИ»

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Kubernetesактуально

Kubernetesиз «MLOps»

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.

Privacy and Securityновинка

Приватность и безопасность

Персональные данные, доступы и специфические для ML риски.

Reliabilityактуально

Отказоустойчивость

Что происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.

Observabilityактуально

Наблюдаемость

Логи, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.

Experiment Infrastructureактуально

Инфраструктура экспериментов

Механика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.

Monitoringактуально

Мониторингиз «MLOps»

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

A/B testingактуально

A/B-тестированиеиз «Оценка моделей»

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.