Рекуррентная ячейка с состоянием и тремя вентилями, решающая проблему долгосрочной памяти.
Ключевые тезисы
- Вентили входа, забывания и выхода управляют потоком информации в cell state.
- Аддитивный путь состояния позволяет градиенту течь через сотни шагов.
- До трансформеров — стандарт для перевода, речи и временных рядов.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три вентиля и состояние ячейки
Что именно решает каждый вентиль.
- сигмоида: сжимает число в интервал от 0 до 1
- объект: вектор признаков
- Forget gate решает, что стереть из памяти.
- Input gate — что записать.
- Output gate — что показать наружу на этом шаге.
Ключевой момент: обновляется сложением, а не умножением на матрицу. Градиент течёт по этому пути почти без затухания — это тот же принцип, что и скип-связи в ResNet.
2Практика обучения LSTM
Что настраивают и какие грабли встречаются.
- Обрезка градиента по норме (1.0–5.0) обязательна: без неё обучение периодически взрывается.
- Инициализация forget gate смещением +1 помогает сети сразу «помнить» и ускоряет старт.
- Dropout применяют между слоями и как recurrent dropout, но не к самому состоянию ячейки напрямую.
- Длина развёртки (truncated BPTT) — компромисс между памятью и объёмом контекста.
Связанные темы
Последовательные модели
RNN80%
Рекуррентные сети · Глубокое обучениеОбрабатывают последовательность шаг за шагом, перенося скрытое состояние между позициями.
GRU80%
GRU · Глубокое обучениеУпрощённая LSTM: два вентиля вместо трёх и отсутствие отдельного cell state.
RNN/LSTM for NLP80%
RNN/LSTM в NLP · Обработка естественного языкаПервое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.
Sequence-to-Sequence80%
Seq2Seq · Обработка естественного языкаСхема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.
RNN/LSTM80%
RNN/LSTM для рядов · Временные рядыНейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.
Backpropagation80%
Обратное распространение ошибки · Глубокое обучениеЭффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.