Первое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.
Ключевые тезисы
- Двунаправленные версии видят контекст слева и справа.
- Долго были стандартом для NER и разметки последовательностей.
- Уступили трансформерам из-за отсутствия параллелизма и ограниченной памяти.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как их применяли к тексту
Разметка последовательностей и классификация до эпохи трансформеров.
- Классификация: последнее скрытое состояние (или его max/mean-пулинг) подаётся в линейный слой.
- Разметка (NER): на каждом шаге свой выход; сверху часто ставили CRF для согласованности меток.
- BiLSTM: два прохода — слева направо и справа налево — дают контекст с обеих сторон.
BiLSTM-CRF долгие годы был стандартом для NER и до сих пор остаётся разумным выбором, когда нужна маленькая быстрая модель без GPU.
2BiLSTM-CRF для разметки
Зачем поверх нейросети ставить условное случайное поле.
Сеть предсказывает метку каждого токена независимо, поэтому может выдать невозможную последовательность вроде I-PER сразу после O. CRF моделирует переходы между метками и выбирает наиболее правдоподобную последовательность целиком.
- истинное значение целевой переменной
- объект: вектор признаков
- суммирование по всем перечисленным элементам
Связанные темы
Последовательные модели
RNN80%
Рекуррентные сети · Глубокое обучениеОбрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.
LSTM80%
LSTM · Глубокое обучениеРекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.
GRU80%
GRU · Глубокое обучениеУпрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.
Sequence-to-Sequence80%
Seq2Seq · Обработка естественного языкаСхема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.
RNN/LSTM80%
RNN/LSTM для рядов · Временные рядыНейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.