LLaMA-Omni: Seamless Speech Interaction with Large Language Models
要約
# 1. Introduction
- 既存のLLMはテキストベースの対話に限定されており、音声対話を実現するためのオープンソースモデルの探索が不足している
- ASRとTTSを組み合わせたカスケードシステムはレイテンシが高く、音声言語モデルによる直接生成は品質面で課題がある
- LLaMA-Omniは音声エンコーダ・音声アダプタ・LLM・ストリーミング音声デコーダから構成される、低遅延・高品質な音声対話モデルとして提案された
# 2. Model: LLaMA-Omni
- 音声エンコーダにはWhisper-large-v3のエンコーダを使用し、パラメータは凍結したまま音声表現を抽出する
- 音声アダプタはダウンサンプリングと2層パーセプトロンでLLMの埋め込み空間に音声表現をマッピングする
- LLMにはLlama-3.1-8B-Instructを使用し、音声指示から直接テキスト応答を自己回帰的に生成する
- 音声デコーダはNAR(非自己回帰型)ストリーミングTransformerで、LLMの隠れ状態からCTC(Connectionist Temporal Classification)を用いて離散ユニット列を予測する
- 2段階学習戦略を採用:第1段階で音声アダプタとLLMを学習、第2段階で音声デコーダのみをCTC損失で学習
- 推論時はLLMのテキスト生成と並行して音声デコーダが離散ユニットを生成し、チャンク単位でボコーダに入力することでストリーミング音声合成を実現する
# 3. Construction of Speech Instruction Data: InstructS2S-200K
- 既存のテキスト指示データを音声対話向けに3段階で変換:指示の書き換え、応答の生成、音声合成
- 指示の書き換えではフィラーワードの追加・非テキスト記号の変換・簡潔化をLlama-3-70B-Instructで実施
- 応答生成では音声対話に適した簡潔で要点を押さえた応答をLlama-3-70B-Instructで生成
- Alpacaデータセットから約5万件、UltraChatから約15万件の計20万件のデータを構築し、InstructS2S-200Kとした
# 4. Experiments
- S2TIF(音声→テキスト指示追従)タスクでLLaMA-OmniはChatGPTスコア3.99を達成し、SpeechGPT(2.98)、SALMONN+Orca(3.44)、Qwen2-Audio+Orca(3.47)を大幅に上回った
- ストリーミングシナリオで最低236msのレイテンシを達成し、GPT-4oの平均音声レイテンシ320msを下回る
- カスケードシステムは低遅延時に発話速度が急激に低下するのに対し、LLaMA-Omniは異なるレイテンシ条件下でも安定した韻律とリズムを維持
- UTMOS(音声品質スコア)で3.9296を記録し、ベースラインモデルをわずかに上回る自然な音声品質を実現
- 人間評価では有用性・自然性の両面でカスケードシステムより高い勝率を獲得
# 5. Related Work
- 音声言語モデルはLLMの語彙に音声トークンを追加するネイティブ型と、音声エンコーダを前段に追加するエンコーダ型の2種に大別される
- ストリーミング生成手法はモノトニックアテンション型、CTC型、トランスデューサー型の3カテゴリに分類される
- Mini-OmniやMoshiなど同時期の研究と比較し、LLaMA-Omniはより強力なLLM基盤・CTC適応的アライメント・少量データ(20万件)での効率的学習という利点を持つ
# 6. Conclusion
- LLaMA-Omniは音声エンコーダとストリーミング音声デコーダを統合し、236msの低遅延で高品質なテキスト・音声同時応答生成を実現した
- 学習は4 GPUで3日未満で完了し、最新LLMに基づく音声対話モデルの効率的な開発が可能であることを示した
- 今後は生成音声の表現力向上とリアルタイム対話機能の強化を目指す
評価
# 新規性
- 音声エンコーダ、音声アダプタ、LLM、ストリーミング音声デコーダを統合した新しいエンドツーエンドモデルアーキテクチャ(LLaMA-Omni)を提案し、音声指示からテキスト応答と音声応答を同時に低遅延で生成可能にした
- 非自己回帰型(NAR)ストリーミングTransformerとCTC(Connectionist Temporal Classification)を組み合わせた音声デコーダにより、LLMの出力隠れ状態から離散音声ユニットを適応的に生成する仕組みを設計した
- 音声対話シナリオに特化した200Kの音声指示データセット「InstructS2S-200K」を構築し、テキスト指示の書き換え・応答生成・音声合成の3段階パイプラインを確立した
- わずか4台のGPUで3日未満の訓練で、GPT-4oの平均音声遅延(320ms)を下回る236msの応答遅延を達成した
# 言及されている全ての関連研究との相違点
- GPT-4o (OpenAI, 2024)との違い: GPT-4oはプロプライエタリモデルであるのに対し、LLaMA-Omniはオープンソースのモデルを基盤として構築されており、少ない計算資源でリアルタイム音声対話を実現する
- SpeechGPT (Zhang et al., 2023)との違い: SpeechGPTはテキスト指示→テキスト応答→音声応答を逐次生成するため遅延が大きく(>4500ms)、音声とテキストの整合性が低い(ASR-WER 45.00)のに対し、LLaMA-Omniはテキストと音声を同時生成し236msの遅延を達成
- SpeechGPT-Gen (Zhang et al., 2024a)との違い: Chain-of-information方式で音声生成をスケールするのに対し、LLaMA-OmniはCTCベースの非自己回帰的アプローチで音声テキスト間のアライメントを適応的に学習する
- AudioPaLM (Rubenstein et al., 2023)との違い: 音声トークンをLLMの語彙に追加して大規模な事前学習を必要とするのに対し、LLaMA-Omniは200Kデータのみで効率的に訓練可能
- AnyGPT (Zhan et al., 2024)との違い: 離散系列モデリングによるマルチモーダルLLMで大規模なデータと計算資源を必要とするのに対し、LLaMA-Omniは4GPUで3日未満の訓練コストで済む
- SALMONN (Tang et al., 2024)との違い: SALMONNは音声理解のみ可能で音声生成にはTTSカスケードが必要であり、ストリーミング時にワード単位の音声合成でエラーが増加し発話速度が低下するのに対し、LLaMA-Omniはエンドツーエンドで安定した韻律と発話速度を維持
- Qwen2-Audio (Chu et al., 2024)との違い: 汎用音声理解モデルだが音声生成機能がなくTTSカスケードが必要で、音声対話シナリオに未整合でフォーマット付きの冗長な応答を生成するのに対し、LLaMA-Omniは音声対話に最適化された簡潔な応答を生成
- Qwen-Audio (Chu et al., 2023)との違い: 音声・オーディオ理解に特化したモデルで音声生成機能を持たないのに対し、LLaMA-Omniは音声理解と生成の両方を備える
- Mini-Omni (Xie & Wu, 2024)との違い: テキストと音声の同時生成を目指す同時期の研究だが、LLaMA-Omniはより強力なLlama-3.1-8B-Instructを基盤とし、CTCによる適応的アライメント学習で事前アライメントが不要、かつ訓練データ量が数桁少ない
- Moshi (Défossez et al., 2024)との違い: リアルタイム対話のための音声テキスト基盤モデルだが、LLaMA-Omniは訓練データ200Kサンプルのみで4GPU・3日の訓練コストと大幅に効率的
- VALL-E (Wang et al., 2023b)との違い: ニューラルコーデック言語モデルによるゼロショットTTSだがLLMベースではないのに対し、LLaMA-Omniは最新LLMの推論能力を活用
- VioLA (Wang et al., 2023c)との違い: 統一コーデック言語モデルで音声認識・合成・翻訳を行うがLLMベースではないのに対し、LLaMA-Omniはオープンソースの最新LLMに音声機能を付与
- Whisper (Radford et al., 2023)との違い: 汎用音声認識モデルであり、LLaMA-Omniではその事前学習済みエンコーダを音声特徴抽出器として凍結して利用する関係
- HuBERT (Hsu et al., 2021)との違い: 自己教師あり音声表現学習モデルであり、LLaMA-Omniでは音声の離散化(K-means量子化)に利用する関係
- Llama-3.1-8B-Instruct (Dubey et al., 2024)との違い: テキスト専用のLLMであり、LLaMA-Omniはこれに音声エンコーダと音声デコーダを追加して音声対話機能を拡張
- CosyVoice (Du et al., 2024)との違い: ゼロショット多言語TTSモデルであり、LLaMA-Omniではデータ構築時の音声合成ツールとして使用するが、推論時にはエンドツーエンドモデル内で音声生成を完結
- VITS (Kim et al., 2021)との違い: 条件付きVAEによるエンドツーエンドTTSモデルであり、LLaMA-Omniではデータセット構築時の応答音声合成に利用
- HiFi-GAN (Kong et al., 2020; Polyak et al., 2021)との違い: GANベースのボコーダであり、LLaMA-Omniでは離散ユニットから波形合成するための後段ボコーダとして使用
- AudioLM (Borsos et al., 2023)との違い: 言語モデリングによるオーディオ生成でテキスト不要のアプローチだが、LLaMA-Omniはテキストと音声の同時生成でLLMの推論能力を維持
- Generative Spoken Dialogue (Lakhotia et al., 2021; Nguyen et al., 2023)との違い: 音声トークンの言語モデルを訓練してテキスト不要で音声生成するがLLMベースではないのに対し、LLaMA-OmniはLLMの能力を活用
- LLaSM (Shu et al., 2023)との違い: 音声エンコーダをLLM前段に追加して音声理解を実現するが音声生成機能がないのに対し、LLaMA-Omniは音声理解と生成の両方を実現
- Pengi (Deshmukh et al., 2023)との違い: オーディオ言語モデルで音声タスクを処理するが音声生成がないのに対し、LLaMA-Omniは音声応答の生成が可能
- BLSP (Wang et al., 2023a)との違い: 言語音声事前学習のブートストラップ手法だが音声生成機能がないのに対し、LLaMA-Omniは理解と生成を統合
- 各種同時生成手法(Wait-k (Ma et al., 2018)、MMA (Ma et al., 2019)、EDAtt (Papi et al., 2022)、Seg2Seg (Zhang & Feng, 2024))との違い: これらはモノトニックアテンションベースの同時翻訳手法であるのに対し、LLaMA-OmniはCTCベースの非自己回帰的ストリーミング生成をLLMの音声デコーダに適用
- CTC/Transducerベースの同時生成手法(Ma et al., 2023; 2024a; Zhang et al., 2024b; Liu et al., 2021; Tang et al., 2023; Chen et al., 2021)との違い: これらは同時通訳やストリーミング音声合成の個別タスクに適用されるのに対し、LLaMA-OmniはLLMのテキスト応答と並行して音声を生成するアーキテクチャとして統合
- ストリーミングTTS手法(Ma et al., 2020; Stephenson et al., 2020; Saeki et al., 2021a;b; Liu et al., 2022; Dekel et al., 2024)との違い: ルックアヘッドや言語モデルによる将来予測を用いたカスケード型ストリーミングTTSであるのに対し、LLaMA-Omniはエンドツーエンドモデル内でCTCにより直接ストリーミング音声生成を実現
- Orca TTSとの違い: 産業用ストリーミングTTSモデルとしてカスケードシステムで使用されるが、ストリーミング時にワード単位合成で自然さが低下するのに対し、LLaMA-Omniはエンドツーエンドで韻律を維持
- Speechworthy (Cho et al., 2024)との違い: 音声対話に適した応答スタイルの研究であり、LLaMA-Omniはこの知見を活かしてInstructS2S-200Kデータセットの応答を簡潔なスタイルに設計
- Tacotron 2 (Shen et al., 2018)との違い: メルスペクトログラム予測ベースのTTSモデルであり、その上にルックアヘッド戦略を構築するストリーミングTTS研究の基盤として言及。LLaMA-Omniはこれとは異なるCTCベースのアプローチを採用
- WavLLM (Hu et al., 2024)との違い: ロバストで適応的な音声LLMだが音声理解に特化しているのに対し、LLaMA-Omniは音声理解と生成を統合
- LLaST (Chen et al., 2024)との違い: LLMを活用したエンドツーエンド音声翻訳システムであるのに対し、LLaMA-Omniは音声対話(指示応答)に特化
- 各種ASR-LLM統合手法(Fathullah et al., 2024a; Yu et al., 2024; Ma et al., 2024b; Hono et al., 2024; Wu et al., 2023; Fathullah et al., 2024b; Das et al., 2024)との違い: 音声認識やその他音声理解タスクに特化しているのに対し、LLaMA-Omniは音声理解と音声生成の双方を実現
# 有効性
- S2TIF(音声→テキスト指示追従)タスクでChatGPTスコア3.99を達成し、SpeechGPT(2.98)、SALMONN(3.44)、Qwen2-Audio(3.47)の全ベースラインを上回った
- S2SIF(音声→音声指示追従)タスクでもChatGPTスコア3.47で最高を達成し、エンドツーエンドモデルとしてSpeechGPT(2.19)と比較してテキスト・音声応答の整合性が大幅に向上(ASR-WER 10.82 vs 45.00)
- ストリーミングシナリオにおいて最小遅延236msを達成し、GPT-4oの平均音声遅延320msを下回りながら、異なるレイテンシ条件下でChatGPTスコア・ASR-WER・発話速度が安定して維持された
- カスケードシステム(SALMONN+Orca, Qwen2-Audio+Orca)と比較して、ストリーミング時の発話速度低下や不自然な間(ポーズ)の問題が発生せず、韻律とリズムが一貫して維持された
- UTMOS(音声品質)スコア3.9296(オフライン)でベースラインモデルを上回り、生成音声の自然さが高いことを確認
- 人間評価において、SALMONN+OrcaおよびQwen2-Audio+Orcaの両方に対して、有用性・自然さの両面でLLaMA-Omniの方が高い勝率を獲得
# 信頼性
- データの規模・質について: InstructS2S-200Kは200Kの音声指示データ(音声指示418時間、音声応答1058時間)で構成され、Alpaca(50K)とUltraChat(150K)という既存の高品質テキスト指示データを基盤としてLlama-3-70B-Instructで音声対話スタイルに変換して構築されている
- 再現性について: 学習・推論の設定が詳細に記載され(4 NVIDIA L40 GPU、2段階訓練、バッチサイズ32、学習率スケジュールなど)、コード・モデル・音声サンプルがGitHub/HuggingFaceで公開されており、greedy searchで再現可能な実験結果を保証している
- 統計的妥当性について: 評価はInstructS2S-Eval(199指示)で実施され、ChatGPTスコア・ASR-WER・UTMOS・WPS・レイテンシの複数指標で定量評価を行い、さらに5名の参加者による100票の人間評価(有用性・自然さの2軸、side-by-side比較)で補完している。ただし評価データセットのサイズが199指示と比較的小規模であり、音声応答の評価がASRモデルを介した間接的なテキスト評価に依存している点は限界として存在する
和訳
1 / 1
100%