Information Geometry Loss for Time Series Forecasting
Jiayu Fang, Xuande Liu, Sangsha Fang, Zhen Tian, Hongwei Ma, Zhiqi Shao, Junbin Gao
Abstract
Time series forecasting fundamentally involves learning probability distributions over future observations. However, existing loss functions rely on point-wise Euclidean metrics, neglecting the intrinsic geometric structure of probability distributions. This leads to suboptimal alignment between predicted and true distributions, particularly for uncertainty quantification. We propose InfoGeo Loss, a principled loss function grounded in information geometry that measures distributional discrepancies on statistical manifolds. Our approach comprises three key components: (1) a distribution parameterization module that models predictions with learnable sufficient statistics, (2) a Fisher information metric that quantifies intrinsic distributional distance, and (3) a Bregman divergence component that captures asymmetric prediction errors. We further introduce a natural gradient weighting strategy for efficient optimization on statistical manifolds. Theoretically, we prove statistical consistency and establish convergence guarantees. Extensive experiments on seven datasets with five architectures show that InfoGeo Loss consistently outperforms existing losses, achieving average improvements of 6.8% in MSE and 5.3% in MAE. The code is available at https://github.com/fangjiayu98/ infoGeo.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Builds on11
- Informer: Beyond Efficient Transformer for Long Sequence Time-Series ForecastingHaoyi Zhou, Shanghang Zhang, Jieqi Peng, Shuai Zhang et al.AAAI 2021 · 7,289 citations
- Are Transformers Effective for Time Series Forecasting?Ailing Zeng, Muxi Chen, Lei Zhang, Qiang XuAAAI 2023 · 3,619 citations
- FEDformer: Frequency Enhanced Decomposed Transformer for Long-term Series ForecastingTian Zhou, Ziqing Ma, Qingsong Wen, Xue Wang et al.ICML 2022 · 2,912 citations
- One Fits All: Power General Time Series Analysis by Pretrained LMTian Zhou, Peisong Niu, Xue Wang, Liang Sun et al.NeurIPS 2023 · 1,178 citations
- Time-LLM: Time Series Forecasting by Reprogramming Large Language ModelsMing Jin, Shiyu Wang, Lintao Ma, Zhixuan Chu et al.ICLR 2024 · 915 citations
Related papers
- Categorical Flow Matching on Statistical ManifoldsChaoran Cheng, Jiahan Li, Jian Peng, Ge LiuNeurIPS 2024 · 48 citations
- Beyond MSE: Ordinal Cross-Entropy for Probabilistic Time Series ForecastingJieting Wang, Huimei Shi, Feijiang Li, Xiaolei ShangAAAI 2026
- InfoGlobe: Local-and-Global Information-Preserving Statistical Manifold Learning for Single-Cell TranscriptomicsCheng Wang, Jinpu Cai, Chongxiao Mao, Yuxuan Wang et al.ICML 2026
- Fisher SAM: Information Geometry and Sharpness Aware MinimisationMinyoung Kim, Da Li, Shell Xu Hu, Timothy M. HospedalesICML 2022 · 96 citations
- DistDF: Time-series Forecasting Needs Joint-distribution Wasserstein AlignmentEric Wang, Licheng Pan, Yuan Lu, Zhixuan Chu et al.ICLR 2026 · 19 citations
