Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.
Ключевые тезисы
- Технические метрики: латентность, ошибки, потребление ресурсов.
- Продуктовые метрики важнее ML-метрик, но приходят с задержкой.
- Логируйте входы и предсказания — без них расследовать инцидент невозможно.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три слоя мониторинга
Инфраструктура, данные, качество.
| Слой | Метрики | Задержка сигнала |
|---|---|---|
| Инфраструктура | latency, RPS, ошибки, память | секунды |
| Данные | доля пропусков, распределения, новые категории | минуты |
| Качество модели | метрика на разметке, бизнес-показатели | дни или недели |
Между предсказанием и появлением истинной метки часто проходят недели (дефолт по кредиту, отток). Поэтому мониторинг данных — единственный ранний сигнал, и он должен быть настроен с первого дня.
2Алерты, на которые реагируют
Главная проблема мониторинга — усталость от ложных срабатываний.
- Пороги ставьте по историческому разбросу метрики, а не «на глаз».
- Требуйте устойчивости: алерт после N последовательных нарушений, а не первого выброса.
- У каждого алерта должен быть владелец и понятный первый шаг разбора.
- Регулярно ревизуйте: алерт, который все игнорируют, хуже отсутствия алерта.
Связанные темы
Инференс и эксплуатация · Безопасность и приватность ML · Продакшен и эксплуатация
Model Deployment97%
Деплой моделей · MLOpsДоставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.
Docker97%
Docker · MLOpsКонтейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.
Kubernetes97%
Kubernetes · MLOpsОркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.
Requirements and SLA85%
Требования и SLA · Системный дизайн ML-сервисовЧисла, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.
Serving Architecture85%
Архитектура инференса · Системный дизайн ML-сервисовМодель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.
Caching85%
Кеширование · Системный дизайн ML-сервисовНе считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.
Batching and Queues85%
Батчинг и очереди · Системный дизайн ML-сервисовСобирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.
Scaling85%
Масштабирование · Системный дизайн ML-сервисовГоризонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.
GPU Inference85%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Reliability85%
Отказоустойчивость · Системный дизайн ML-сервисовЧто происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.
Observability85%
Наблюдаемость · Системный дизайн ML-сервисовЛоги, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.
Cost Model85%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.
LLM Serving85%
Обслуживание LLM · Системный дизайн ML-сервисовОтдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.
Drift Detection80%
Детекция дрейфа · MLOpsОбнаружение расхождения между данными обучения и данными прода.
Retraining80%
Переобучение моделей · MLOpsРегулярное обновление модели на свежих данных по расписанию или по триггеру.
ML Pipelines80%
ML-пайплайны · MLOpsОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.
Production ML80%
ML в продакшене · Практика MLМодель в проде — это сервис с SLA, мониторингом, версионированием и планом отката.
Privacy and Security70%
Приватность и безопасность · Системный дизайн ML-сервисовПерсональные данные, доступы и специфические для ML риски.
Agents70%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
Prompting70%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Data Contracts70%
Контракты данных · Инженерия данныхЯвная договорённость между источником и потребителем: какие поля, каких типов и с какими гарантиями.