Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
要約
# 1. Introduction
- 大規模言語モデル(LLM)はNLPタスクで人間レベル以上の性能を達成し、音声・視覚などマルチモーダル知覚への応用が進んでいるが、複数話者が同時に話す「カクテルパーティー」シナリオでの音声LLMの活用は未開拓である
- 従来のマルチトーカーASR手法(PIT、HEAT、SOT等)は全話者の音声を無差別に書き起こすのみで、特定の話者属性(性別、キーワード等)に基づく柔軟な書き起こしには対応できない
- 本研究では、LLMの指示追従能力を活用し、マルチトーカーASR、ターゲット話者ASR、性別・出現順・言語・キーワード指定ASRの6種類の多様な指示に基づく音声認識を行うMT-LLMを提案する
- WavLM(話者特性に敏感な音響情報)とWhisperエンコーダ(意味的文脈)の二重エンコーダで多面的な音声表現を抽出し、LoRAで微調整したLLMに入力する構成を採用している
# 2. Methods
# 2.1 Problem Formulation
- マルチトーカー環境での音声認識を次トークン予測の言語モデリングタスクとして定式化し、入力音声波形Xとテキスト指示Iを条件として、ターゲットテキストYを自己回帰的に生成する
- 複数話者の書き起こし順序にはSerialized Output Training(SOT)を採用し、話者の発話開始順に並べ、話者交代を「<sc>」トークンで区切る
# 2.2 Model Architecture
- Whisperエンコーダは最終層出力から意味情報を抽出し、WavLMは複数層の隠れ状態を学習可能な重みで集約して話者特性に関する音響情報を捕捉する、二重音声エンコーダ構成を採用
- 各エンコーダに対応するアダプタ(畳み込み層2層+ボトルネックアダプタ+線形層)と線形プロジェクタにより、音声表現をLLMの特徴空間に射影する
- バックボーンLLMはLlama-2-7b-chatを使用し、LoRA(ランク32)をattentionモジュールのkey/query/value/output重み行列に適用して音声モダリティ処理能力を付与する(全パラメータ75.5億中、学習可能パラメータは1%の7660万)
# 2.3 Task Descriptions
- 6つのタスクを設計:(1) Multi-Talker ASR(全話者同時書き起こし)、(2) Target-Talker ASR(参照音声3秒で指定した話者の書き起こし)、(3) Keyword-Tracing ASR(指定キーワードを発話した話者の書き起こし)
- (4) Sex-Specific ASR(男性/女性話者の書き起こし)、(5) Order-Specific ASR(出現順で指定した話者の書き起こし)、(6) Target-Lingual ASR(英語/ドイツ語など指定言語の話者の書き起こし)
# 3. Experimental Setup
# 3.1 Training Data Construction
- LibriSpeech 960時間から2話者・3話者の重畳音声をシミュレーション生成し、CoVoST 2のドイツ語180時間をTarget-Lingual ASR用にLibriSpeechと混合して使用
- 単一話者コーパスと合わせ、総学習音声データは約6,300時間(うち約10%がドイツ語含有)
# 3.2 Evaluation and Metrics
- 公式の2話者・3話者LibriSpeechMixテストセット、自作のEn-De-Mixedテストセット、LibriSpeech test-cleanおよびCoVoST 2ドイツ語テストセットで評価
- 評価指標はWER(単語誤り率)で、複数話者タスクでは最小誤りの順列を用いて算出
# 3.3 Model Settings and Training Details
- Whisper-large-v2エンコーダとWavLM-baseを音声エンコーダとし、Llama-2-chat-7bをバックボーンLLMとして使用、事前学習済みモデルのパラメータは全て凍結
- NVIDIA A100-40G GPU 32台で150Kステップ学習、AdamWオプティマイザ使用、ピーク学習率1e-4、6タスク全てを混合して統一モデルを訓練
# 4. Results and Discussion
# 4.1 Results on Multi-Talker ASR
- MT-LLMはLibriSpeech単一話者で2.3% WER、2話者LibriSpeechMixで5.2% WERを達成し、PITベースのD2V-Sidecar-DBを上回り、SOT-Conformerと2話者で同等の性能を示す
- SOT-Conformerは多話者ASR特化のため単一話者性能が劣化するのに対し、MT-LLMは指示理解能力により単一話者・多話者の両方で安定した性能を維持
- 音声LLMのSALMONNは重畳音声認識で大幅に劣る性能(2話者32.9%、3話者45.9% WER)を示し、MT-LLMの有効性が際立つ
# 4.2 Results on Versatile Tasks Based on Instructions
- Target-Talker、Keyword-Tracing、Sex-Specific ASRタスクでは、best-matching結果と近い性能を達成し、MT-LLMが指示に基づいて正確に話者を識別・書き起こしできることを実証(例:2話者TTでbest-matching 5.5% vs MT-LLM 6.7%)
- Order-Specific ASRではbest-matchingとの差が大きく(2話者で5.7% vs 9.0%)、話者出現順の判定が課題であり、位置埋め込みやアダプタ拡大による改善が期待される
- Target-Lingual ASRはドイツ語データの限られた量とノイズにより性能が制限されるが、英語・ドイツ語間のWERが近く、言語識別自体はある程度機能している
- 3話者シナリオでは重畳の複雑さからWERが上昇するが、MT-LLMは指示に従った書き起こし能力を維持している
# 4.3 Ablation Study
- WavLMエンコーダの追加により特に3話者シナリオで大幅な改善(WavLMなし16.1% → あり10.7%)が確認され、多層音響情報の重要性が示された
- マルチタスク学習により基本のMT ASRタスク自体の性能も向上(2話者5.5% → 5.2%、3話者10.7% → 10.2%)し、各タスクが相互補完的であることが判明
# 4.4 Limitations and Future Work
- 本研究は多様なタスクに対応する汎用音声LLMの構築ではなく、LLMのマルチトーカー環境での指示追従能力の探索が主目的である
- 実験はシミュレーションデータに限定されており、実世界データでの評価は未実施(リソース制約のため)
- 今後は精緻な学習データと設計によるカクテルパーティー環境向けの包括的な音声LLMの開発が期待される
# 5. Conclusion
- LLMを用いた指示ベースのマルチトーカー音声認識の先駆的研究として、Whisperエンコーダ(意味情報)とWavLM(話者特性の音響情報)の二重エンコーダ構成とLoRAによるパラメータ効率的な微調整を提案
- MT-LLMは6種類の多様な指示(マルチトーカーASR、ターゲット話者ASR、性別・出現順・言語・キーワード指定ASR)に基づく書き起こしで有望な性能を実証
- 複雑なマルチトーカー環境におけるLLMの音声タスク処理能力と、より自然な人間-コンピュータインタラクションの可能性を示した
評価
# 新規性
- LLMを多話者(カクテルパーティ)環境での音声認識に適用した先駆的研究であり、多様な自然言語指示に基づいて特定話者の音声を書き起こすフレームワーク(MT-LLM)を初めて提案
- 6種類の多様な指示ベースASRタスク(多話者ASR、ターゲット話者ASR、キーワード追跡ASR、性別指定ASR、発話順序指定ASR、言語指定ASR)を単一モデルで統合的に処理する枠組みを設計
- WavLM(話者特性に敏感な音響情報)とWhisperエンコーダ(意味的文脈情報)のデュアルエンコーダ構成により、多面的な音声表現を抽出しLLMに入力する手法を提案
- パラメータ効率的なLoRA微調整(全体75.5億パラメータ中わずか1%=7,660万パラメータのみ学習可能)で、LLMに音声理解・書き起こし能力を付与
# 言及されている全ての関連研究との相違点
- PIT(Permutation Invariant Training)ベースの手法(Zhang et al. [13], Chang et al. [14], Meng et al. [15])との違い:PITは全話者を無差別に書き起こすのみで、特定話者への紐付けや指示ベースの選択的書き起こしができないが、MT-LLMは自然言語指示に基づき特定話者を選択的に書き起こし可能
- HEAT(Heuristic Error Assignment Training)ベースの手法(Lu et al. [16], Raj et al. [17])との違い:同様に全話者一括書き起こしであり、話者属性に基づく柔軟な指示対応ができない
- SOT(Serialized Output Training)ベースの手法(Kanda et al. [18][19], Shi et al. [20], Kang et al. [21], Zheng et al. [22])との違い:SOTの出力順序方式を採用しつつも、SOTのみでは話者属性指定の柔軟性がないのに対し、MT-LLMはLLMの指示理解能力を活用して多様な話者属性指定に対応
- D2V-Sidecar-DB(Meng et al. [28])との違い:PITベースの多話者ASRとダイアライゼーションの統合モデルであるが、タスクが限定的で話者属性指定の柔軟性がない。MT-LLMは2話者・3話者の両条件でWERを上回る性能を達成
- SOT-Conformer(Kanda et al. [25])との違い:多話者ASR特化の最先端モデルで、2話者条件ではMT-LLMと同等だが、単一話者ASRでは性能が劣化する専門化の問題がある。MT-LLMは単一話者でも一貫して良好な性能を維持
- SALMONN(Tang et al. [6])との違い:重なり音声認識を含む様々な音声タスクを学習した音声LLMだが、多話者シナリオでの性能が大幅に劣る(2話者WER 32.9% vs MT-LLM 5.2%)
- WavLLM(Hu et al. [5])との違い:WavLMの多層特徴量活用やデュアルエンコーダの設計思想を参考にしているが、WavLLMは単一話者の音声タスクが対象であり、多話者環境への対応は行っていない
- Whisper(Radford et al. [30])との違い:大規模弱教師ありデータで訓練された音声認識モデルだが、多話者環境での選択的書き起こしには対応しておらず、MT-LLMではそのエンコーダを意味情報抽出に活用
- WavLM(Chen et al. [31])との違い:自己教師あり事前学習モデルで多層の音響情報を持つが、それ自体は認識モデルではなく、MT-LLMでは話者特性を捉える特徴抽出器として活用
- 外部・内部話者モデルを用いたアプローチ(Huang et al. [23], Masumura et al. [24], Kanda et al. [25], Zhang et al. [26], Masumura et al. [27])との違い:話者埋め込み等の追加モジュールで話者情報を取得するが、話者属性(性別・キーワード・言語等)に基づく柔軟な指示対応はできない
- Meng et al. [29]のWhisperベース多話者・ターゲット話者ASRとの違い:Whisperを多話者とターゲット話者ASRに拡張したが、対応タスクが限定的で、LLMの指示理解能力を活用した多様な話者属性指定には対応していない
- Llama 2(Touvron et al. [3])との違い:テキストLLMとして優れた文脈理解・生成能力を持つが、音声モダリティの処理能力がなく、MT-LLMではLoRA微調整とアダプタにより音声理解能力を付与
- GPT-4(OpenAI [1])、LLaMA(Touvron et al. [2])との違い:NLPタスクで高性能だがマルチモーダル音声処理、特に多話者環境には直接対応しておらず、MT-LLMはこれらの基盤モデルの能力を音声領域に拡張する方向性を示す
- Qwen2-Audio(Chu et al. [7])との違い:音声関連LLMとして多様なタスクに対応するが、カクテルパーティ環境での指示ベース選択的書き起こしは扱っていない
- LoRA(Hu et al. [32])との違い:パラメータ効率的微調整手法として利用しているが、MT-LLMではこれを音声モダリティ統合のための手段として、多話者音声認識という新たな応用に展開
# 有効性
- 多話者ASRにおいて、PITベースのD2V-Sidecar-DBを全条件で上回り(2話者: 5.2% vs 7.5%、3話者: 10.2% vs 11.9%)、SOT-Conformerと2話者条件で同等の性能を達成(5.2% vs 4.9%)
- SALMONNと比較して多話者ASRで大幅に優れた性能を示す(2話者: 5.2% vs 32.9%、3話者: 10.2% vs 45.9%)
- 単一話者ASRでもLibriSpeechで2.3%のWERを達成し、SOT-Conformer(2.4%)と同等以上であり、多話者特化モデルと異なり単一話者でも性能低下がない
- ターゲット話者ASR(TT)で2話者6.7%、3話者16.2%のWERを達成し、best-matching結果(5.5%、12.0%)との差が小さく、指示に基づく話者特定が有効に機能
- キーワード追跡ASR(KT)で2話者5.0%のWERを達成し、best-matching(4.8%)とほぼ同等の高い話者特定精度を示す
- 性別指定ASR(SS)で2話者5.5%(best-matching 4.9%)、3話者15.0%(best-matching 12.4%)と、性別に基づく話者弁別が有効に機能
- マルチタスク学習によりベースの多話者ASR性能も向上(2話者: 5.5%→5.2%、3話者: 10.7%→10.2%)し、タスク間の相補性を確認
- デュアルエンコーダ(WavLM追加)の有効性をアブレーションで実証(3話者: 16.1%→10.7%と大幅改善)
- 英独混合(En-De-Mix)テストセットでも、限られたドイツ語データにもかかわらず多言語多話者の同時認識が可能であることを実証
# 信頼性
- 訓練データは約6,300時間の音声で構成(LibriSpeech 960時間 + CoVoST 2ドイツ語180時間を基に2~3話者混合音声をシミュレーション生成)。ただしドイツ語は全体の約10%と限定的
- 評価はLibriSpeechMixの公式2話者・3話者テストセットとCoVoST 2ドイツ語テストセットを使用し、訓練データの話者と評価データの話者が重複しないことを保証
- 多話者音声はシミュレーション(単一話者音声のランダム重畳)であり、実環境の残響・雑音・自然な発話交替を含む実データでの検証は未実施(著者自身がこれを限界として認識)
- WER計算には先行研究に準拠した順列最小誤り方式を採用し、評価手法の妥当性を担保
- コード・モデル・サンプルがGitHub(https://github.com/cuhealthybrains/MT-LLM)で公開されており、再現性に配慮
- 32台のNVIDIA A100-40G GPUで150Kステップの訓練という大規模計算資源を使用しており、一般的な研究環境での再現にはハードウェア面の障壁がある
- 順序指定ASR(OS)と言語指定ASR(TL)ではbest-matchingとの差が比較的大きく、これらのタスクでは改善の余地がある(OS 2話者: 9.0% vs 5.7%)
- En-De-Mixテストセットは自作(home-made)であり、標準ベンチマークではないため、言語指定タスクの結果の一般化には注意が必要
和訳
1 / 1
100%