Системный дизайн ML-сервисов

Privacy and Security

Приватность и безопасность

новинкаНовое или быстро растущее направление

Персональные данные, доступы и специфические для ML риски.

Ключевые тезисы

  • Минимизация данных: не логируйте персональные поля, если они не нужны для расследования.
  • Риски ML: извлечение обучающих данных из модели, membership inference, состязательные примеры.
  • Для LLM-сервисов отдельно: prompt injection, утечка системного промпта, доступ инструментов агента.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Работа с персональными данными

Минимизация и разграничение доступа.

  • Не логируйте персональные поля, если они не нужны для расследования; используйте хеши и токены.
  • Разделяйте окружения: доступ к сырым данным — у пайплайна, не у сервиса инференса.
  • Псевдонимизация и агрегация признаков снижают риски без потери качества.
  • Срок хранения логов должен быть конечным и соответствовать регламенту.
2

Атаки, специфичные для ML

Риски, которых нет у обычного сервиса.

АтакаСутьЗащита
Model extractionвоспроизведение модели по ответам APIлимиты, огрубление вероятностей
Membership inferenceопределение, был ли объект в обучениирегуляризация, дифференциальная приватность
Adversarial examplesмалое возмущение меняет ответаугментация, детекторы, ансамбли
Prompt injectionинструкции внутри данных для LLMразделение данных и команд, ограничение прав инструментов
Data poisoningпорча обучающих данныхвалидация источников, контроль изменений

Связанные темы

Безопасность и приватность ML