Схема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.
Ключевые тезисы
- Teacher forcing ускоряет обучение, но создаёт разрыв с инференсом.
- Beam search улучшает качество генерации по сравнению с жадным декодированием.
- T5 и BART — трансформерные представители семейства.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Обучение и декодирование
Teacher forcing, exposure bias и beam search.
При обучении декодеру подают правильный предыдущий токен (teacher forcing) — так обучение идёт быстро и параллельно. На инференсе модель вынуждена опираться на свои же предсказания, и ошибки накапливаются: это называют exposure bias.
- Greedy — берём самый вероятный токен: быстро, но близоруко.
- Beam search — держим лучших гипотез; стандарт для перевода, где важна точность.
- Sampling — для творческих задач, где нужно разнообразие.
- Метрики: BLEU и chrF для перевода, ROUGE для суммаризации.
2Метрики генерации
BLEU, ROUGE и их ограничения.
| Метрика | Что считает | Задача |
|---|---|---|
| BLEU | точность n-грамм со штрафом за краткость | перевод |
| chrF | F-мера по символьным n-граммам | перевод, морфологичные языки |
| ROUGE-L | длиннейшая общая подпоследовательность | суммаризация |
| BERTScore | близость эмбеддингов токенов | любая генерация |
Все метрики совпадения плохо ловят перефразировки: правильный по смыслу ответ другими словами получит низкий BLEU. Поэтому для генеративных задач всё чаще используют оценку моделью-судьёй с прозрачной рубрикой.
Связанные темы
Последовательные модели
RNN80%
Рекуррентные сети · Глубокое обучениеОбрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.
LSTM80%
LSTM · Глубокое обучениеРекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.
GRU80%
GRU · Глубокое обучениеУпрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.
RNN/LSTM for NLP80%
RNN/LSTM в NLP · Обработка естественного языкаПервое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.
RNN/LSTM80%
RNN/LSTM для рядов · Временные рядыНейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.