Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Ключевые тезисы
- Снимает узкое место фиксированного вектора состояния в seq2seq.
- Карты внимания дают частичную интерпретируемость модели.
- Из вспомогательного механизма выросла целая архитектура.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Откуда взялось внимание
Узкое место seq2seq и его решение.
В классическом seq2seq энкодер сжимал всё предложение в один вектор. Для длинных предложений это узкое место: начало забывалось к концу. Богданау и соавторы предложили дать декодеру доступ ко всем состояниям энкодера и на каждом шаге взвешивать их.
- коэффициент, задающий вес слагаемого или скорость обновления
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
- экспонента
2Внимание и интерпретируемость
Что карты внимания показывают, а что нет.
Веса внимания выглядят как объяснение: видно, на какие слова «смотрела» модель. Но исследования показали, что это объяснение частичное: можно изменить веса и получить тот же ответ, а важность признаков по градиенту нередко расходится с картой внимания.
- Карты внимания полезны для отладки: например, видно, что модель зацепилась за технический токен.
- Для строгих объяснений используйте SHAP или градиентные методы поверх итогового предсказания.
Связанные темы
Внимание и трансформеры
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformers85%
Трансформеры · Глубокое обучениеАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Transformers85%
Трансформеры в NLP · Обработка естественного языкаОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPT85%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Vision Transformers85%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
Transformer forecasting85%
Трансформеры для прогноза · Временные рядыВнимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
LLM85%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.