Towards Efficient Tensor Decomposition-Based DNN Model Compression With Optimization Framework
Miao Yin, Yang Sui, Siyu Liao, Bo Yuan
摘要
Advanced tensor decomposition, such as tensor train (TT) and tensor ring (TR), has been widely studied for deep neural network (DNN) model compression, especially for recurrent neural networks (RNNs). However, compressing convolutional neural networks (CNNs) using TT/TR always suffers significant accuracy loss. In this paper, we propose a systematic framework for tensor decomposition-based model compression using Alternating Direction Method of Multipliers (ADMM). By formulating TT decompositionbased model compression to an optimization problem with constraints on tensor ranks, we leverage ADMM technique to systemically solve this optimization problem in an iterative way. During this procedure, the entire DNN model is trained in the original structure instead of TT format, but gradually enjoys the desired low tensor rank characteristics. We then decompose this uncompressed model to TT format, and fine-tune it to finally obtain a high-accuracy TTformat DNN model. Our framework is very general, and it works for both CNNs and RNNs, and can be easily modified to fit other tensor decomposition approaches. We evaluate our proposed framework on different DNN models for image classification and video recognition tasks. Experimental results show that our ADMM-based TT-format models demonstrate very high compression performance with high accuracy. Notably, on CIFAR-100, with 2.3ˆand 2.4ˆcompression ratios, our models have 1.96% and 2.21% higher top-1 accuracy than the original on ImageNet, our model achieves 2.47ˆFLOPs reduction without accuracy loss.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper15
- CHIP: CHannel Independence-based Pruning for Compact Neural NetworksYang Sui, Miao Yin, Yi Xie, Huy Phan 等NeurIPS 2021 · 被引用 198 次
- Compressible-composable NeRF via Rank-residual DecompositionJiaxiang Tang, Xiaokang Chen, Jingbo Wang, Gang ZengNeurIPS 2022 · 被引用 125 次
- Approximate Caching for Efficiently Serving Text-to-Image Diffusion ModelsShubham Agarwal, Subrata Mitra, Sarthak Chakraborty, Srikrishna Karanam 等NSDI 2024 · 被引用 44 次
- BATUDE: Budget-Aware Neural Network Compression Based on Tucker DecompositionMiao Yin, Huy Phan, Xiao Zang, Siyu Liao 等AAAI 2022 · 被引用 37 次
- HALOC: Hardware-Aware Automatic Low-Rank Compression for Compact Neural NetworksJinqi Xiao, Chengming Zhang, Yu Gong, Miao Yin 等AAAI 2023 · 被引用 35 次
相关 Paper
- Towards Extremely Compact RNNs for Video Recognition With Fully Decomposed Hierarchical Tucker StructureMiao Yin, Siyu Liao, Xiao-Yang Liu, Xiaodong Wang 等CVPR 2021
- TDC: Towards Extremely Efficient CNNs on GPUs via Hardware-Aware Tucker DecompositionLizhi Xiang, Miao Yin, Chengming Zhang, Aravind Sukumaran-Rajam 等PPoPP 2023 · 被引用 4 次
- Fully-Connected Tensor Network Decomposition and Its Application to Higher-Order Tensor CompletionYu-Bang Zheng, Ting-Zhu Huang, Xi-Le Zhao, Qibin Zhao 等AAAI 2021 · 被引用 183 次
- Towards Compact CNNs via Collaborative CompressionYuchao Li, Shaohui Lin, Jianzhuang Liu, Qixiang Ye 等CVPR 2021
- Tensor FISTA-Net for Real-Time Snapshot Compressive ImagingXiaochen Han, Bo Wu, Zheng Shou, Xiao-Yang Liu 等AAAI 2020 · 被引用 46 次
