SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities
要約
# 1. Introduction
- 現在のLLMはマルチモーダル情報の理解はできるが、自発的にマルチモーダルコンテンツを生成できず、画像や音声などの連続信号を離散トークンベースのLLMに直接適用できないという課題がある
- 既存の音声言語モデルはカスケード方式(ASR/TTSとLLMの直列接続)が主流だが、モダリティ間の知識転移ができず、感情やプロソディなどのパラ言語情報が失われる問題がある
- SpeechGPTは離散音声表現を用いてモダリティを統一し、SpeechInstructデータセットの構築と3段階学習戦略(モダリティ適応事前学習、クロスモーダル指示微調整、Chain-of-Modality指示微調整)により、音声の知覚・生成が可能な初のマルチモーダルLLMを提案する
# 2. Related Work
- **Multi-modal Large Language Model**: PaLM-E、LLaVA、X-LLMなど既存のマルチモーダルLLMは視覚ドメインが中心で、マルチモーダル入力の処理は可能だがマルチモーダル出力の生成能力がない
- **Generative Spoken Language Model**: AudioLMやVALL-Eなど離散自己教師あり表現に基づく音声生成モデルは進歩しているが、特定タスク向けでありLLMの恩恵を受けられない
- **Speech-Enabled LLM Interaction**: HuggingGPTやAudioGPTはLLMと専門音声モデルを統合するが、複雑性・リソース消費・エラー蓄積の問題がある。SpeechGPTはASR/TTSシステムに依存せずLLMとの直接音声対話を実現する
# 3. SpeechInstruct Construction
- **3.1 Cross-modal Instruction**: Gigaspeech、Common Voice、LibriSpeechなど大規模ASRデータセットを収集し、mHuBERTで音声を離散ユニットに変換して900万のユニット-テキストペアを取得。GPT-4を用いてASR/TTSタスクの指示文を各100種類ゼロショット生成し、テンプレートに従い指示データをフォーマットする
- **3.2 Chain-of-Modality Instruction**: テキスト指示データを音声に変換するtext-to-unitジェネレータをTransformerで構築し、moss-002-sft-dataから37,969サンプルを選択して音声指示・テキスト指示・テキスト応答・音声応答の4つ組を生成する
- Chain-of-Modality指示データは、音声命令→テキストで思考→音声で応答という連鎖的な処理を行い、Speech-Speech、Speech-Text、Text-Speech、Text-Textの4種類の入出力形式をサポートする
# 4. SpeechGPT
- **4.1 Model Structure**: モデルは離散ユニット抽出器(HuBERT)、大規模言語モデル(LLaMA)、ユニットボコーダ(マルチスピーカーHiFi-GAN)の3コンポーネントで構成される。HuBERTは連続音声をk-meansクラスタリングで離散ユニット列に変換し、HiFi-GANが離散表現から音声信号を復元する
- **4.2 Training - 語彙拡張と前半2段階**: LLMの語彙を音声離散ユニットトークンで拡張し、Stage 1ではLibriLight(60K時間)を用いた次トークン予測タスクで音声モダリティへの適応事前学習を行い、Stage 2ではSpeechInstructのCross-modal Instructionとテキスト指示データを混合してクロスモーダル指示微調整を実施する
- **4.2 Training - Stage 3**: Chain-of-Modality Instructionデータに対してパラメータ効率的なLoRA微調整(ランク8、alpha 16、学習可能パラメータ6M)を適用し、アテンション機構にLoRA重みを追加してさらなるモダリティ整合を達成する
# 5. Experiments
- **5.1 Experimental Setups**: LLaMA-13Bをバックボーンとし、Stage 1は96 A100 GPUでバッチサイズ768・900ステップ、Stage 2は96 A100 GPUでバッチサイズ1536・2100ステップ、Stage 3は8 A100 GPUでバッチサイズ128・4200ステップで学習
- **5.2 Cross-modal Instruction Following**: 多様な指示に対してASR(音声→テキスト)やTTS(テキスト→音声)タスクを正確に実行でき、指示に応じた適切な出力を生成する能力を示した
- **5.2 Spoken Dialogue**: 音声対話において、SpeechGPTは音声指示を理解し音声で応答可能であり、HHH基準(無害・有益・正直)に従った応答を生成することがケーススタディで確認された
# 6. Limitation
- パラ言語情報(異なる感情トーンでの応答生成など)を考慮しておらず、音声応答の前にテキスト応答の生成が必須であり、コンテキスト長の制限によりマルチターン対話をサポートできない
# 7. Conclusion
- SpeechGPTはマルチモーダルコンテンツの知覚・生成が可能な初の内在的クロスモーダルLLMであり、音声-テキストクロスモーダル指示追従データセットSpeechInstructと3段階学習パラダイムにより有望な結果を達成した
- 離散音声トークンを言語モデルに統合するアプローチが、他のモダリティへの拡張にも有望な方向性であることを示した
評価
# 新規性
- (情報なし)
# 言及されている全ての関連研究との相違点
- (情報なし)
# 有効性
- (情報なし)
# 信頼性
- (情報なし)
和訳
1 / 1
100%