Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
Junhan Kim, Chungman Lee, Eulrang Cho, Kyungphil Park, Ho-Young Kim, Joonyoung Kim, Yongkweon Jeon
摘要
With the increasing complexity of generative AI models, post-training quantization (PTQ) has emerged as a promising solution for deploying hyper-scale models on edge devices such as mobile and TVs. Existing PTQ schemes, however, consume considerable time and resources, which could be a bottleneck in real situations where frequent model updates and multiple hyperparameter tunings are required. As a cost-effective alternative, learning-free PTQ schemes have been proposed. However, the performance is somewhat limited because they cannot consider the inter-layer dependency within the attention module, which is a significant feature of Transformers. In this paper, we thus propose a novel PTQ algorithm that balances accuracy and efficiency. The key idea of the proposed algorithm called aespa is to perform quantization layer-wise for efficiency while targeting attention-wise reconstruction to consider the cross-layer dependency. Through extensive experiments on various language models and complexity analysis, we demonstrate that aespa is accurate and efficient in quantizing Transformer models.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper5
- TurboBoA: Faster and Exact Attention-aware Quantization without BackpropagationJunhan Kim, Yeo Jeong Park, Seungwoo Son, Chungman Lee 等ICLR 2026 · 被引用 3 次
- Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models QuantizationChenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei 等CVPR 2026 · 被引用 3 次
- BoA: Attention-aware Post-training Quantization without BackpropagationJunhan Kim, Ho-Young Kim, Eulrang Cho, Chungman Lee 等ICML 2025
- STLA: Spatiotemporal Lookahead Alignment for Post-Training QuantizationZuqi Zhang, Chenghe Sun, Xiangyi Chu, Wei-Han Yu 等ICML 2026
- LogART: Pushing the Limit of Efficient Logarithmic Post-Training QuantizationJiawei Xu, Yi Zheng, Chenghe Sun, Taiyu Zhou 等ICLR 2026
它引用的顶会 Paper19
- High-Resolution Image Synthesis with Latent Diffusion ModelsRobin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser 等CVPR 2022 · 被引用 13,123 次
- Measuring Massive Multitask Language UnderstandingDan Hendrycks, Collin Burns, Steven Basart, Andy Zou 等ICLR 2021 · 被引用 7,905 次
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language ModelsGuangxuan Xiao, Ji Lin, Mickaël Seznec, Hao Wu 等ICML 2023 · 被引用 1,493 次
- Learned Step Size quantizationSteven K. Esser, Jeffrey L. McKinstry, Deepika Bablani, Rathinakumar Appuswamy 等ICLR 2020 · 被引用 1,037 次
- Up or Down? Adaptive Rounding for Post-Training QuantizationMarkus Nagel, Rana Ali Amjad, Mart van Baalen, Christos Louizos 等ICML 2020 · 被引用 816 次
相关 Paper
- RL-PTQ: RL-based Mixed Precision Quantization for Hybrid Vision TransformersEunji Kwon, Minxuan Zhou, Weihong Xu, Tajana Rosing 等DAC 2024 · 被引用 4 次
- CBQ: Cross-Block Quantization for Large Language ModelsXin Ding, Xiaoyu Liu, Zhijun Tu, Yun Zhang 等ICLR 2025 · 被引用 1 次
- EasyQuant: An Efficient Data-free Quantization Algorithm for LLMsHanlin Tang, Yifu Sun, Decheng Wu, Kai Liu 等EMNLP 2023 · 被引用 4 次
- GPTAQ: Efficient Finetuning-Free Quantization for Asymmetric CalibrationYuhang Li, Ruokai Yin, Donghyun Lee, Shiting Xiao 等ICML 2025
- DVD-Quant: Data-free Video Diffusion Transformers QuantizationZhiteng Li, Hanxuan Li, Junyi Wu, Kai Liu 等ICLR 2026 · 被引用 13 次
