Генеративный ИИ

LLM

Большие языковые модели

новинкаНовое или быстро растущее направление

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Ключевые тезисы

  • Законы масштабирования связывают параметры, данные и качество.
  • Ключевые ограничения: длина контекста, галлюцинации, дата обучения.
  • Инференс упирается в память и пропускную способность, а не только во FLOPs.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Законы масштабирования

Как связаны параметры, данные и качество.

Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • коэффициент сглаживания (инерции)
  • число объектов в выборке
  • матрица преобразования
  • функция потерь — то, что минимизируется при обучении
Потери падают степенным образом по числу параметров и объёму данных

Работа Chinchilla показала, что многие модели были недообучены: при фиксированном бюджете выгоднее модель поменьше, обученная на большем числе токенов. Ориентир — примерно 20 токенов на параметр.

2

Экономика инференса

Почему генерация дороже, чем чтение промпта.

  • Prefill (обработка промпта) параллелится по токенам и упирается в вычисления.
  • Decode (генерация) последователен и упирается в пропускную способность памяти: на каждый токен читаются все веса.
  • KV-кэш растёт линейно с длиной контекста и занимает существенную часть памяти.
  • Отсюда приёмы: квантизация (int8/int4), батчинг запросов, спекулятивное декодирование, PagedAttention.

Связанные темы

Внимание и трансформеры · Поиск, эмбеддинги и RAG · Мультимодальность

Vision Transformers96%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

Embeddings95%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformers85%

Трансформеры · Глубокое обучение

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Attention85%

Внимание в NLP · Обработка естественного языка

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Transformers85%

Трансформеры в NLP · Обработка естественного языка

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPT85%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Transformer forecasting85%

Трансформеры для прогноза · Временные ряды

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

Semantic Search80%

Семантический поиск · Обработка естественного языка

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

RAG80%

Retrieval-Augmented Generation · Обработка естественного языка

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

TF-IDF80%

TF-IDF · Обработка естественного языка

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

MAP80%

Средняя усреднённая точность · Метрики

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.

Multimodal Models75%

Мультимодальные модели · Компьютерное зрение

Единое пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.

Multimodal Models75%

Мультимодальные модели · Генеративный ИИ

Единая модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.

OCR75%

Оптическое распознавание текста · Компьютерное зрение

Извлечение текста из изображений и сканов: детекция областей текста и его распознавание.