Обработка естественного языка

Attention

Внимание в NLP

актуальноТекущий рабочий стандарт

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Ключевые тезисы

  • Снимает узкое место фиксированного вектора состояния в seq2seq.
  • Карты внимания дают частичную интерпретируемость модели.
  • Из вспомогательного механизма выросла целая архитектура.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Откуда взялось внимание

Узкое место seq2seq и его решение.

В классическом seq2seq энкодер сжимал всё предложение в один вектор. Для длинных предложений это узкое место: начало забывалось к концу. Богданау и соавторы предложили дать декодеру доступ ко всем состояниям энкодера и на каждом шаге взвешивать их.

Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
  • экспонента
Контекстный вектор — взвешенная сумма состояний энкодера
Кошка
села
на
тёплый
коврик
Кошка
0.66
0.05
0.04
0.06
0.20
села
0.14
0.57
0.10
0.06
0.13
на
0.07
0.14
0.47
0.11
0.21
тёплый
0.07
0.05
0.08
0.50
0.30
коврик
0.16
0.06
0.09
0.20
0.49
запрос (query)Кошка
максимум вниманияКошка
вес0.657
сумма весов строки1.000
Матрица весов внимания: каждая строка — распределение по исходным токенам для одного шага
2

Внимание и интерпретируемость

Что карты внимания показывают, а что нет.

Веса внимания выглядят как объяснение: видно, на какие слова «смотрела» модель. Но исследования показали, что это объяснение частичное: можно изменить веса и получить тот же ответ, а важность признаков по градиенту нередко расходится с картой внимания.

  • Карты внимания полезны для отладки: например, видно, что модель зацепилась за технический токен.
  • Для строгих объяснений используйте SHAP или градиентные методы поверх итогового предсказания.

Связанные темы

Внимание и трансформеры

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformers85%

Трансформеры · Глубокое обучение

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Transformers85%

Трансформеры в NLP · Обработка естественного языка

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPT85%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Vision Transformers85%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

Transformer forecasting85%

Трансформеры для прогноза · Временные ряды

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

LLM85%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.