Временные ряды

Transformer forecasting

Трансформеры для прогноза

новинкаОбласть активно развивается; обязательно сравнивайте с простыми бейзлайнами.

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

Ключевые тезисы

  • Patch-подход режет ряд на окна-токены, снижая вычислительную стоимость.
  • TFT добавляет интерпретируемость через веса внимания и отбор признаков.
  • На коротких рядах простые бейзлайны всё ещё конкурентоспособны.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Трансформерные модели прогноза

Что изменили Informer, Autoformer, PatchTST и TFT.

МодельКлючевая идея
Informerразреженное внимание — снижает
Autoformerдекомпозиция на тренд и сезонность внутри модели
PatchTSTряд режется на патчи-окна, как изображение в ViT
TFTинтерпретируемость: веса внимания и отбор признаков
На практике

Важная отрезвляющая работа: на многих стандартных бенчмарках простая линейная модель (DLinear) обыгрывает сложные трансформеры. Всегда сравнивайте с сильным простым бейзлайном.

2

Обязательные бейзлайны

С чем сравнивать, прежде чем радоваться.

БейзлайнФормула
Наивный
Сезонный наивный
Скользящее среднее
Линейная модель на лагахобычная регрессия
На практике

Работа «Are Transformers Effective for Time Series Forecasting?» показала, что на ряде популярных бенчмарков простая линейная модель обходит сложные трансформеры. Это не приговор архитектуре, но обязательная проверка.

Связанные темы

Внимание и трансформеры · Прогнозирование рядов

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformers85%

Трансформеры · Глубокое обучение

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Attention85%

Внимание в NLP · Обработка естественного языка

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Transformers85%

Трансформеры в NLP · Обработка естественного языка

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPT85%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Vision Transformers85%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

LLM85%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Stationarity85%

Стационарность · Временные ряды

Постоянство статистических свойств ряда во времени — предпосылка большинства классических моделей.

Autocorrelation85%

Автокорреляция · Временные ряды

Связь ряда с собственными прошлыми значениями — главный источник признаков и диагностики.

AR / MA / ARIMA85%

AR / MA / ARIMA · Временные ряды

Классическое семейство: авторегрессия, скользящее среднее ошибок и их комбинация с дифференцированием.

SARIMA85%

SARIMA · Временные ряды

ARIMA с явными сезонными компонентами — для рядов с недельной, месячной или годовой периодикой.

Exponential Smoothing85%

Экспоненциальное сглаживание · Временные ряды

Взвешивание прошлых наблюдений с экспоненциально убывающими весами; модель Хольта — Винтерса добавляет тренд и сезонность.

Prophet85%

Prophet · Временные ряды

Аддитивная модель тренда, сезонностей и праздников с упором на удобство для аналитика.

Feature-based forecasting85%

Прогноз через признаки · Временные ряды

Ряд превращается в табличную задачу: лаги, скользящие статистики, календарь — и дальше градиентный бустинг.

RNN/LSTM85%

RNN/LSTM для рядов · Временные ряды

Нейросети, обучаемые сразу на множестве связанных рядов, улавливают общие паттерны.