Continuous Self-Attention Models with Neural ODE Networks
Jing Zhang, Peng Zhang, Baiwen Kong, Junqiu Wei, Xin Jiang
摘要
Stacked self-attention models receive widespread attention, due to its ability of capturing global dependency among words. However, the stacking of many layers and components generates huge parameters, leading to low parameter efficiency. In response to this issue, we propose a lightweight architecture named Continuous Self-Attention models with neural ODE networks (CSAODE). In CSAODE, continuous dynamical models (i.e., neural ODEs) are coupled with our proposed self-attention block to form a self-attention ODE solver. This solver continuously calculates and optimizes the hidden states via only one layer of parameters to improve the parameter efficiency. In addition, we design a novel accelerated continuous dynamical model to reduce computing costs, and integrate it in CSAODE. Moreover, since the original self-attention ignores local information, CSAODE makes use of N-gram convolution to encode local representations, and a fusion layer with only two trainable scalars are designed for generating sentence vectors. We perform a series of experiments on text classification, natural language inference (NLI) and text matching tasks. With fewer parameters, CSAODE outperforms state-of-the-art models on text classification tasks (e.g., 1.3% accuracy improved on SUBJ task), and has competitive performances for NLI and text matching tasks as well.
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了最后一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper8
- ContiFormer: Continuous-Time Transformer for Irregular Time Series ModelingYuqi Chen, Kan Ren, Yansen Wang, Yuchen Fang 等NeurIPS 2023 · 被引用 131 次
- ODE Transformer: An Ordinary Differential Equation-Inspired Model for Sequence GenerationBei Li, Quan Du, Tao Zhou, Yi Jing 等ACL 2022 · 被引用 43 次
- Continuous-Time Attention for Sequential LearningJen-Tzung Chien, Yi-Hsiang ChenAAAI 2021 · 被引用 19 次
- Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient LearningBei Li, Tong Zheng, Rui Wang, Jiahao Liu 等NeurIPS 2024 · 被引用 5 次
- Quantum-Inspired Neural Network with Runge-Kutta MethodZipeng Fan, Jing Zhang, Peng Zhang, Qianxi Lin 等AAAI 2024 · 被引用 4 次
它引用的顶会 Paper3
- ALBERT: A Lite BERT for Self-supervised Learning of Language RepresentationsZhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel 等ICLR 2020 · 被引用 7,418 次
- Learning to Encode Position for Transformer with Continuous Dynamical ModelXuanqing Liu, Hsiang-Fu Yu, Inderjit S. Dhillon, Cho-Jui HsiehICML 2020 · 被引用 139 次
- Multiple Positional Self-Attention Network for Text ClassificationBiyun Dai, Jinlong Li, Ruoyi XuAAAI 2020 · 被引用 10 次
相关 Paper
- Sparse Modular Activation for Efficient Sequence ModelingLiliang Ren, Yang Liu, Shuohang Wang, Yichong Xu 等NeurIPS 2023 · 被引用 23 次
- Stateful ODE-Nets using Basis Function ExpansionsAlejandro F. Queiruga, N. Benjamin Erichson, Liam Hodgkinson, Michael W. MahoneyNeurIPS 2021 · 被引用 18 次
- eNODE: Energy-Efficient and Low-Latency Edge Inference and Training of Neural ODEsJunkang Zhu, Yaoyu Tao, Zhengya ZhangHPCA 2023 · 被引用 4 次
- COSA:Co-Operative Systolic Arrays for Multi-head Attention Mechanism in Neural Network using Hybrid Data Reuse and Fusion MethodologiesZhican Wang, Gang Wang, Honglan Jiang, Ningyi Xu 等DAC 2023 · 被引用 14 次
- ACT: an Attentive Convolutional Transformer for Efficient Text ClassificationPengfei Li, Peixiang Zhong, Kezhi Mao, Dongzhe Wang 等AAAI 2021 · 被引用 47 次
