CIS-BWE: Chaos-Informed Speech Bandwidth Extension
Tarikul Islam Tamiti, Tonmoy Das, Nursadul Mamun, Anomadarshi Barua
Abstract
Recovering high-frequency components lost to bandwidth constraints is crucial for applications ranging from telecommunications to high-fidelity audio on limited resources. We introduce NDSI-BWE, a new adversarial Band Width Extension (BWE) framework that leverage four new discriminators inspired by nonlinear dynamical system to capture diverse temporal behaviors: a Multi-Resolution Lyapunov Discriminator (MRLD) for determining sensitivity to initial conditions by capturing deterministic chaos, a Multi-Scale Recurrence Discriminator (MS-RD) for self-similar recurrence dynamics, a Multi-Scale Detrended Fractal Analysis Discriminator (MSDFA) for long range slow variant scale invariant relationship, a Multi-Resolution Poincaré Plot Discriminator (MR-PPD) for capturing hidden latent space relationship, a Multi-Period Discriminator (MPD) for cyclical patterns, a Multi-Resolution Amplitude Discriminator (MRAD) and Multi-Resolution Phase Discriminator (MRPD) for capturing intricate amplitude-phase transition statistics. By using depth-wise convolution at the core of the convolutional block with in each discriminators, NDSI-BWE attains an eight-times parameter reduction. These seven discriminators guide a complex-valued ConformerNeXt based genetor with a dual stream Lattice-Net based architecture for simultaneous refinement of magnitude and phase. The genertor leverage the transformer based conformer's global dependency modeling and ConvNeXt block's local temporal modeling capability. Across six objective evaluation metrics and subjective based texts comprises of five human judges, NDSI-BWE establishes a new SoTA in BWE.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext 3ba97c88-84e1-412c-b5c9-01e2c1e2093aBuilds on4
- HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech SynthesisJungil Kong, Jaehyeon Kim, Jaekyoung BaeNeurIPS 2020 · 2,890 citations
- PHASEN: A Phase-and-Harmonics-Aware Speech Enhancement NetworkDacheng Yin, Chong Luo, Zhiwei Xiong, Wenjun ZengAAAI 2020 · 387 citations
- AccEar: Accelerometer Acoustic Eavesdropping with Unconstrained VocabularyPengfei Hu, Hui Zhuang, Panneer Selvam Santhalingam, Riccardo Spolaor et al.S&P 2022 · 65 citations
- TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable PlatformsYueyuan Sui, Minghui Zhao, Junxi Xia, Xiaofan Jiang et al.UbiComp 2025 · 18 citations
Related papers
- Avocodo: Generative Adversarial Network for Artifact-Free VocoderTaejun Bak, Junmo Lee, Hanbin Bae, Jinhyeok Yang et al.AAAI 2023 · 44 citations
- On the Effectiveness of Spectral Discriminators for Perceptual Quality ImprovementXin Luo, Yunan Zhu, Shunxin Xu, Dong LiuICCV 2023 · 16 citations
- Latent Swap Joint Diffusion for 2D Long-Form Latent GenerationYusheng Dai, Chenxi Wang, Chang Li, Chen Wang et al.ICCV 2025 · 6 citations
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-ResolutionSeungho Choi, Jeahun Sung, Jihyong OhCVPR 2026 · 3 citations
- Frequency Dynamic Convolution for Dense Image PredictionLinwei Chen, Lin Gu, Liang Li, Chenggang Yan et al.CVPR 2025
