Transformers and their Application for Time-Series Prediction
Transformery a jejich využití pro predikci časových řad
bakalářská práce (OBHÁJENO)
Zobrazit/ otevřít
Trvalý odkaz
http://hdl.handle.net/20.500.11956/210795Identifikátory
SIS: 291625
Kolekce
- Kvalifikační práce [12373]
Autor
Vedoucí práce
Oponent práce
Čelko, Tomáš
Fakulta / součást
Matematicko-fyzikální fakulta
Obor
Informatika se specializací Umělá inteligence
Katedra / ústav / klinika
Katedra teoretické informatiky a matematické logiky
Datum obhajoby
18. 6. 2026
Nakladatel
Univerzita Karlova, Matematicko-fyzikální fakultaJazyk
Angličtina
Známka
Výborně
Klíčová slova (česky)
dlouhá krátkodobá paměť|hluboké neuronové sítě|transformery|predikce časových řad|interpretabilitaKlíčová slova (anglicky)
Long Short-Term Memory|deep neural networks|transformer models|time series forecasting|interpretabilityTato práce představuje srovnávací analýzu šesti architektur neuronových sítí apliko- vatelných pro dlouhodobou predikci časových řad ze tří paradigmatických rodin: základní lineární model DLinear, základní rekurentní model LSTM a čtyři varianty Transformeru (PatchTST, iTransformer, Temporal Fusion Transformer, TOEformer). Modely jsou vy- hodnoceny na dvou reálných datových sadách z oblasti energetiky a klimatologie (ETTh1, Weather) napříč šesti predikčními horizonty s 10 běhy na konfiguraci (celkem 1400 běhů). Výsledky motivují návrh sedmého modelu, DecompPatchTST, hybrid kombinující de- kompozici klouzavým průměrem na trend a sezónní složku s Transformer enkodérem založeným na segmentech (patch). Ukazujeme, že tento typ dekompozice zlepšuje pre- dikci, pokud je velikost jádra dekompozice sladěna s periodicitou dat, avšak jinak může výkon zhoršovat. Chování modelů je analyzováno třemi metodami interpretability: ma- pami významnosti (Grad-CAM a vstupní gradienty), projekcemi reprezentací (UMAP) a vizualizací pozornosti (attention).
This thesis presents a comparative analysis of six neural network architectures ap- plicable to long-term time series forecasting that spans three paradigm families: the linear baseline DLinear, the recurrent baseline LSTM, and four Transformer variants (PatchTST, iTransformer, Temporal Fusion Transformer, TOEformer). The models are evaluated on two real-world datasets from the energy and climate domains (ETTh1, Weather) across six prediction horizons, with 10 training runs per configuration (1400 runs in total). The results motivate the design of a seventh model, DecompPatchTST, a hybrid that combines moving average trend-seasonal decomposition with a patch-based Transformer encoder. We show that this type of decomposition improves forecasting when the decomposition kernel size aligns with the data's periodicity, but may degrade performance otherwise. Model behavior is analyzed using three interpretability methods: saliency maps (Grad-CAM and input-gradient), UMAP representation projections, and attention visualization.
