CIS-BWE: Chaos-Informed Speech Bandwidth Extension
Tarikul Islam Tamiti, Tonmoy Das, Nursadul Mamun, Anomadarshi Barua
摘要
Recovering high-frequency components lost to bandwidth constraints is crucial for applications ranging from telecommunications to high-fidelity audio on limited resources. We introduce NDSI-BWE, a new adversarial Band Width Extension (BWE) framework that leverage four new discriminators inspired by nonlinear dynamical system to capture diverse temporal behaviors: a Multi-Resolution Lyapunov Discriminator (MRLD) for determining sensitivity to initial conditions by capturing deterministic chaos, a Multi-Scale Recurrence Discriminator (MS-RD) for self-similar recurrence dynamics, a Multi-Scale Detrended Fractal Analysis Discriminator (MSDFA) for long range slow variant scale invariant relationship, a Multi-Resolution Poincaré Plot Discriminator (MR-PPD) for capturing hidden latent space relationship, a Multi-Period Discriminator (MPD) for cyclical patterns, a Multi-Resolution Amplitude Discriminator (MRAD) and Multi-Resolution Phase Discriminator (MRPD) for capturing intricate amplitude-phase transition statistics. By using depth-wise convolution at the core of the convolutional block with in each discriminators, NDSI-BWE attains an eight-times parameter reduction. These seven discriminators guide a complex-valued ConformerNeXt based genetor with a dual stream Lattice-Net based architecture for simultaneous refinement of magnitude and phase. The genertor leverage the transformer based conformer's global dependency modeling and ConvNeXt block's local temporal modeling capability. Across six objective evaluation metrics and subjective based texts comprises of five human judges, NDSI-BWE establishes a new SoTA in BWE.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
它引用的顶会 Paper4
- HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech SynthesisJungil Kong, Jaehyeon Kim, Jaekyoung BaeNeurIPS 2020 · 被引用 2,890 次
- PHASEN: A Phase-and-Harmonics-Aware Speech Enhancement NetworkDacheng Yin, Chong Luo, Zhiwei Xiong, Wenjun ZengAAAI 2020 · 被引用 387 次
- AccEar: Accelerometer Acoustic Eavesdropping with Unconstrained VocabularyPengfei Hu, Hui Zhuang, Panneer Selvam Santhalingam, Riccardo Spolaor 等S&P 2022 · 被引用 65 次
- TRAMBA: A Hybrid Transformer and Mamba Architecture for Practical Audio and Bone Conduction Speech Super Resolution and Enhancement on Mobile and Wearable PlatformsYueyuan Sui, Minghui Zhao, Junxi Xia, Xiaofan Jiang 等UbiComp 2025 · 被引用 18 次
相关 Paper
- Avocodo: Generative Adversarial Network for Artifact-Free VocoderTaejun Bak, Junmo Lee, Hanbin Bae, Jinhyeok Yang 等AAAI 2023 · 被引用 44 次
- On the Effectiveness of Spectral Discriminators for Perceptual Quality ImprovementXin Luo, Yunan Zhu, Shunxin Xu, Dong LiuICCV 2023 · 被引用 16 次
- Latent Swap Joint Diffusion for 2D Long-Form Latent GenerationYusheng Dai, Chenxi Wang, Chang Li, Chen Wang 等ICCV 2025 · 被引用 6 次
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-ResolutionSeungho Choi, Jeahun Sung, Jihyong OhCVPR 2026 · 被引用 3 次
- Frequency Dynamic Convolution for Dense Image PredictionLinwei Chen, Lin Gu, Liang Li, Chenggang Yan 等CVPR 2025
