LLaMA-Omni 2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis
Qingkai Fang, Yan Zhou, Shoutao Guo, Shaolei Zhang, Yang Feng
摘要
Real-time, intelligent, and natural speech interaction is an essential part of the next-generation human-computer interaction. Recent advancements have showcased the potential of building intelligent spoken chatbots based on large language models (LLMs). In this paper, we introduce LLaMA-Omni 2, a series of speech language models (SpeechLMs) ranging from 0.5B to 14B parameters, capable of achieving highquality real-time speech interaction. LLaMA-Omni 2 is built upon the Qwen2.5 series models, integrating a speech encoder and an autoregressive streaming speech decoder. Despite being trained on only 200K multi-turn speech dialogue samples, LLaMA-Omni 2 demonstrates strong performance on several spoken question answering and speech instruction following benchmarks, surpassing previous state-of-theart SpeechLMs like GLM-4-Voice, which was trained on millions of hours of speech data. 1
问问这篇 Paper
智能体会读完全文。
Lune 把这篇 Paper 索引到了每一个公式,引用它的顶会 Paper 也一样。你提问,回答直接引用原文。
引用它的顶会 Paper7
- EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language ModelsLi Zhou, Lutong Yu, You Lyu, Yihang Lin 等ICLR 2026 · 被引用 13 次
- MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language ModelsChung-Ming Chien, Manu Orsini, Eugene Kharitonov, Neil Zeghidour 等ICML 2026 · 被引用 7 次
- Efficient Speech Language Modeling via Energy Distance in Continuous Latent SpaceZhengrui Ma, Yang Feng, Chenze Shao, Fandong Meng 等NeurIPS 2025 · 被引用 5 次
- FastLongSpeech: Enhancing Large Speech-Language Models for Efficient Long-Speech ProcessingShoutao Guo, Shaolei Zhang, Qingkai Fang, Zhengrui Ma 等NeurIPS 2025 · 被引用 4 次
- MoST: Mixing Speech and Text with Modality-Aware Mixture of ExpertsYuxuan Lou, Kai Yang, Yang YouICML 2026 · 被引用 1 次
它引用的顶会 Paper13
- Robust Speech Recognition via Large-Scale Weak SupervisionAlec Radford, Jong Wook Kim, Tao Xu, Greg Brockman 等ICML 2023 · 被引用 6,966 次
- HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech SynthesisJungil Kong, Jaehyeon Kim, Jaekyoung BaeNeurIPS 2020 · 被引用 2,890 次
- SALMONN: Towards Generic Hearing Abilities for Large Language ModelsChangli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen 等ICLR 2024 · 被引用 557 次
- Finite Scalar Quantization: VQ-VAE Made SimpleFabian Mentzer, David Minnen, Eirikur Agustsson, Michael TschannenICLR 2024 · 被引用 442 次
- Textually Pretrained Speech Language ModelsMichael Hassid, Tal Remez, Tu Anh Nguyen, Itai Gat 等NeurIPS 2023 · 被引用 117 次
相关 Paper
- LLaMA-Omni: Seamless Speech Interaction with Large Language ModelsQingkai Fang, Shoutao Guo, Yan Zhou, Zhengrui Ma 等ICLR 2025 · 被引用 2 次
- Scaling Speech-Text Pre-training with Synthetic Interleaved DataAohan Zeng, Zhengxiao Du, Mingdao Liu, Lei Zhang 等ICLR 2025
- NEXUS-O: An Omni-Perceptive and -Interactive Model for Language, Audio, and VisionChe Liu, Yingji Zhang, Dong Zhang, Weijie Zhang 等ACM MM 2025
- VocalNet: Speech LLMs with Multi-Token Prediction for Faster and High-Quality GenerationYuhao Wang, Heyang Liu, Ziyang Cheng, Ronghua Wu 等EMNLP 2025 · 被引用 3 次
- SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical ConsultationSirry Chen, Jieyi Wang, Wei Chen, Zhongyu WeiACL 2026 · 被引用 1 次
