Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Ключевые тезисы
- Блок = multi-head attention + feed-forward + residual + layer norm.
- Позиционные кодировки (в т.ч. RoPE) возвращают модели понятие порядка.
- Единая архитектура для текста, изображений, аудио и мультимодальных данных.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Устройство блока
Четыре компонента, повторённые N раз.
- пропуски: модель сказала «нет», а объект был положительным
- истинное значение целевой переменной
- объект: вектор признаков
- Multi-head attention — смешивает информацию между позициями.
- FFN — два линейных слоя с нелинейностью, работают с каждой позицией отдельно; там сосредоточена большая часть параметров.
- Residual — путь для градиента.
- LayerNorm — стабилизация масштабов активаций.
2Позиционные кодировки
Внимание симметрично — порядок нужно задать явно.
Если перемешать токены, self-attention даст те же результаты в переставленном порядке: сам по себе он ничего не знает о позиции. Поэтому к эмбеддингам добавляют позиционную информацию.
- Абсолютные обучаемые — просто таблица эмбеддингов позиций (BERT).
- Синусоидальные — не требуют обучения и в принципе экстраполируются.
- RoPE — поворот векторов q и k на угол, зависящий от позиции; стандарт современных LLM, естественно кодирует относительные расстояния.
3Три семейства архитектур
Encoder, decoder и encoder-decoder — под какие задачи.
| Тип | Внимание | Задачи | Примеры |
|---|---|---|---|
| Encoder-only | двунаправленное | классификация, NER, поиск | BERT, E5 |
| Decoder-only | causal | генерация, чат, few-shot | GPT, Llama |
| Encoder-decoder | оба + cross | перевод, суммаризация | T5, BART |
Связанные темы
Внимание и трансформеры
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Attention85%
Внимание в NLP · Обработка естественного языкаИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Transformers85%
Трансформеры в NLP · Обработка естественного языкаОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPT85%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Vision Transformers85%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
Transformer forecasting85%
Трансформеры для прогноза · Временные рядыВнимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
LLM85%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.