Generative Pretrained Hierarchical Transformer for Time Series Forecasting
Zhiding Liu, Jiqian Yang, Mingyue Cheng, Yucong Luo, Zhi Li
Abstract
Recent efforts have been dedicated to enhancing time series forecasting accuracy by introducing advanced network architectures and self-supervised pretraining strategies. Nevertheless, existing approaches still exhibit two critical drawbacks. Firstly, these methods often rely on a single dataset for training, limiting the model's generalizability due to the restricted scale of the training data. Secondly, the one-step generation schema is widely followed, which necessitates a customized forecasting head and overlooks the temporal dependencies in the output series, and also leads to increased training costs under different horizon length settings. To address these issues, we propose a novel generative pretrained hierarchical transformer architecture for forecasting, named GPHT. There are two aspects of key designs in GPHT. On the one hand, we advocate for constructing a mixed dataset under the channelindependent assumption for pretraining our model, comprising various datasets from diverse data scenarios. This approach significantly expands the scale of training data, allowing our model to uncover commonalities in time series data and facilitating improved transfer to specific datasets. On the other hand, GPHT employs an auto-regressive forecasting approach, effectively modeling temporal dependencies in the output series. Importantly, no customized forecasting head is required, enabling a single model to forecast at arbitrary horizon settings. We conduct sufficient experiments on eight datasets with mainstream self-supervised pretraining models and
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Cited by top-tier papers10
- Multi-Scale Finetuning for Encoder-based Time Series Foundation ModelsZhongzheng Qiao, Chenghao Liu, Yiming Zhang, Ming Jin et al.NeurIPS 2025 · 17 citations
- Improving Time Series Forecasting via Instance-aware Post-hoc RevisionZhiding Liu, Mingyue Cheng, Guanhao Zhao, Jiqian Yang et al.NeurIPS 2025 · 16 citations
- FusAD: Time-Frequency Fusion with Adaptive Denoising for General Time Series AnalysisDa Zhang, Bingyu Li, Zhiyuan Zhao, Feiping Nie et al.ICDE 2026 · 4 citations
- GTM: A General Time-series Model for Enhanced Representation Learning of Time-Series dataCheng He, Xu Huang, Gangwei Jiang, Zhaoyi Li et al.ICLR 2026 · 4 citations
- BLAST: Balanced Sampling Time Series Corpus for Universal Forecasting ModelsZezhi Shao, Yujie Li, Fei Wang, Chengqing Yu et al.KDD 2025 · 3 citations
Builds on28
- Language Models are Few-Shot LearnersTom B. Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah et al.NeurIPS 2020 · 64,255 citations
- Bootstrap Your Own Latent - A New Approach to Self-Supervised LearningJean-Bastien Grill, Florian Strub, Florent Altché, Corentin Tallec et al.NeurIPS 2020 · 9,171 citations
- Informer: Beyond Efficient Transformer for Long Sequence Time-Series ForecastingHaoyi Zhou, Shanghang Zhang, Jieqi Peng, Shuai Zhang et al.AAAI 2021 · 7,289 citations
- Autoformer: Decomposition Transformers with Auto-Correlation for Long-Term Series ForecastingHaixu Wu, Jiehui Xu, Jianmin Wang, Mingsheng LongNeurIPS 2021 · 5,824 citations
- FEDformer: Frequency Enhanced Decomposed Transformer for Long-term Series ForecastingTian Zhou, Ziqing Ma, Qingsong Wen, Xue Wang et al.ICML 2022 · 2,912 citations
Related papers
- Considering Nonstationary within Multivariate Time Series with Variational Hierarchical Transformer for ForecastingMuyao Wang, Wenchao Chen, Bo ChenAAAI 2024 · 13 citations
- HMformer: Unleashing Transformer's Potential for Time Series Forecasting via Hierarchical Multi-Scale ModelingRenjun Huang, Han Xiao, Bingqing Li, Baili Zhang et al.AAAI 2026
- TimeCAP: A Channel-Aware Pre-Training Framework for Multivariate Time Series ForecastingChuanru Ren, Yao Lu, Tianjin Huang, Haowen Zheng et al.AAAI 2026
- HDT: Hierarchical Discrete Transformer for Multivariate Time Series ForecastingShibo Feng, Peilin Zhao, Liu Liu, Pengcheng Wu et al.AAAI 2025 · 6 citations
- HN-MVTS: HyperNetwork-based Multivariate Time Series ForecastingAndrey V. Savchenko, Oleg KachanAAAI 2026
