GoLLIE: Annotation Guidelines Improve Zero-Shot Information-Extraction
要約
# 1. Introduction
- 情報抽出(IE)タスクは複雑なアノテーションガイドラインを必要とするが、現行のSoTAモデルは人手アノテーションデータに大きく依存し、新しいスキーマへの汎化性能が著しく低下する
- 大規模言語モデル(LLM)を用いたゼロショットIEの試みは、GPT-3.5をガイドライン付きでプロンプトしても低いF1スコア(Music・Politicsドメインで約20)にとどまり、ガイドラインへの追従に失敗している
- GoLLIE(Guideline-following Large Language Model for IE)は、少数の既知IEタスクのガイドラインに従うようファインチューニングされたLLMであり、未知IEタスクへのゼロショット汎化でSoTAを上回る性能を達成した
# 2. Related Work
- LLMの指示チューニング(multitask fine-tuning)は多くのタスクで汎化能力を発揮するが、IE分野ではエンコーダのみのモデル(XLM-RoBERTa等)が依然として最も効果的であり、LLMベースのIEは性能が劣る
- 従来のゼロショットIE手法はラベル名のみをプロンプトに使用(例:「全てのPersonをリストせよ」)しており、ラベル定義の曖昧さ・データセット間の定義差異に対処できないという制約がある
- Instruct-UIE(Wang et al., 2023a)は34のIEデータセットでFlanT5をチューニングしたが、ガイドライン情報を使用しておらず、GoLLIEとの主要な差別化要因となっている
# 3. Approach
- 入出力表現にPythonコードベースの形式を採用し、ラベルをPythonクラス、ガイドラインをdocstring、代表的候補をコメントとして統一的に表現することで、自動標準化・容易なパース・LLMのコード事前学習との親和性を実現
- ガイドライン強化表現(Guidelines Enhanced Representation)として、ラベル定義をクラスdocstringに、代表的候補をコード内コメントに組み込み、ゼロショット汎化の改善を図る
- 訓練時の正則化として、クラス順序シャッフル、クラスドロップアウト、ガイドラインパラフレーズ、代表候補サンプリング、クラス名マスキングの5手法を導入し、モデルがガイドラインの内容自体に注目するよう強制する
# 4. Experimental Setup
- 訓練データはNews・Biomedicalドメイン(ACE05、CoNLL 2003、BC5CDR等12データセット)を使用し、評価データはTwitter・Cybercrime・Wikipedia等の多様なドメイン(BroadTwitter、CrossNER、FabNER等)を使用してゼロショット汎化を厳密に評価
- NER、RE、EE、EAE、SFの5タスクで訓練し、NER・EE・EAEの3タスクで評価。RE・SFは訓練データの多様性向上のために追加
- Code-LLaMAをバックボーンとし、QLoRA(4bit量子化+LoRA)で効率的にファインチューニング。7B・13B・34Bの3サイズで実験を実施
# 5. Results
- 教師あり評価では、GoLLIEとベースラインの差は平均0.3 F1ポイントとほぼ同等であり、ガイドライン追従のための正則化ノイズにもかかわらず性能劣化がないことを確認
- ゼロショット評価では、GoLLIEがベースライン比で平均13 F1ポイントの大幅な改善を達成し、Instruct-UIE・PromptNER等のSoTA手法を大きく上回った
- 未知ラベルに対する性能低下がGoLLIEではベースラインより小さく、モデルサイズ増大に伴いさらにギャップが縮小。7Bモデルでも十分に強力なゼロショット能力を示す
- アブレーション実験により、代表的候補(candidates)の寄与が最も大きく(除去で-5.4 F1)、定義と候補が相補的に機能することが判明
# 6. Error Analysis
- 多義的ラベル(MEDIA、VULNERABILITYPATCH等)ではガイドラインが有効に機能し、ベースライン比で大幅な改善(例:MultiNERD Media: 13.6→69.1 F1)
- 曖昧なラベル(MISCELLANEOUS、PLOT等)は定義が広範すぎるため、一貫したガイドライン策定が困難であり、GoLLIEも正確なラベリングに失敗
- 訓練データに含まれるラベルの先入観(例:POLITICAL PARTYをORGANIZATIONと分類)が残存しており、訓練データセットの数と多様性の拡大が解決策として期待される
- MultiNERD TIMEラベルでは、GoLLIEがガイドライン通りに年号をTIMEとラベリングしたが、データセット自体のアノテーションがガイドラインに準拠していないケースも発見
# 7. Conclusions
- GoLLIEはアノテーションガイドラインに従うようファインチューニングされたLLMであり、ガイドラインを活用しない従来手法やガイドライン追従にチューニングされていないモデルを大幅に上回るゼロショットIE性能を実現
- 今後の展望として、より大規模で多様な事前訓練データセットの使用、および曖昧・粗粒度ラベルへの対応力向上のための指示セット拡張が計画されている
# Appendix A. Examples
- NER・EE・EAEに加え、RE(関係抽出)・SF(スロットフィリング)タスクの入力例も示され、SFではスロットごとの詳細定義・オプション引数・型制約等の複雑な入力構造が採用されている
- ユーザー定義のカスタムスキーマ(例:Launcher・Missionエンティティ)への汎化例が示され、モデルが新規定義されたクラスの型制約を正しく遵守して出力を生成できることが実証されている
# Appendix B. Seen vs Unseen Labels
- ゼロショットデータセットの各ラベルを訓練時の既知(seen)・未知(unseen)に厳密に分類し、類似ラベル(例:COUNTRYとGEOPOLITICAL)も既知とみなす厳格な基準を適用
- GoLLIEは既知・未知の両ラベルでベースラインを上回り、ガイドライン活用によりラベル先入観への頑健性が向上していることが定量的に確認された
# Appendix C. Model Hallucinations
- パース不能な出力とハルシネーション(入力クラスに定義されていないラベルの出力)の発生率は全ゼロショットデータセットで1%未満であり、GoLLIEの高い信頼性を示す
# Appendix D. Extended Training Details
- 損失計算はガイドライントークンを除外し出力トークンのみで行うことで、正則化によるガイドライン損失の過大な影響を回避し、学習の高速化と性能向上を実現
- QLoRA(全パラメータの約0.5%のみ訓練)がフルモデルファインチューニングよりもゼロショット性能で大幅に優れており、過学習防止のボトルネック効果が有効に機能
- CO2排出量は7Bモデルで0.61kg、34Bモデルで6.67kgと文書化されている
# Appendix E. Handling Datasets with Hundreds of Labels
- 数百ラベルのデータセットではガイドライン込みの入力がLLMのコンテキストサイズを超過する制約があり、ラベルをバッチ分割して複数回推論する緩和策が提案されている
- Pythonコードスタイルプロンプトのオーバーヘッドは、詳細なガイドラインを持つラベルでは入力の小さな割合に留まり、主要な制約はコード構造ではなくガイドライン定義のサイズである
# Appendix F. Human Effort to Build the Prompts
- 大部分のデータセットではデータセット著者提供のガイドラインを再利用でき、事前定義テンプレートへのラベル・ガイドライン記入のみで実装可能なため、人的コストは最小限
- ガイドラインが公開されていないデータセットでは開発分割の例から人手でガイドラインを構築する必要があるが、ドメイン専門家は不要
# Appendix G. Data Contamination
- Code-LLaMAの事前学習データにアクセスできないため、評価ベンチマークのデータ汚染の可能性を完全には排除できない
- ただし、全ての比較はGoLLIEと同一バックボーン(Code-LLaMA)のベースラインとの間で行われているため、データ汚染があってもベースラインに対する改善は影響を受けない
評価
# 新規性
- アノテーションガイドラインに従うようLLMをファインチューニングし、ゼロショット情報抽出の性能を大幅に向上させるGoLLIE(Guideline-following Large Language Model for IE)を提案した点
- Pythonコードベースの入出力表現を採用し、スキーマ定義(ラベルをPythonクラスとして表現)、ガイドライン(docstring)、代表的候補(コメント)を統一フォーマットで扱う方式を設計した点
- ガイドラインへの注意を強制するための複数の学習時正則化手法(クラス順序シャッフル、クラスドロップアウト、ガイドラインパラフレーズ、代表候補サンプリング、クラス名マスキング)を導入した点
# 言及されている全ての関連研究との相違点
- Radford et al. (2019)との違い: 事前学習のみで自然言語タスク記述によるゼロショットを行ったが、GoLLIEはガイドラインに従うようファインチューニングし情報抽出に特化
- Brown et al. (2020)との違い: GPT-3は大規模パラメータによるfew-shot学習を示したが、GoLLIEはガイドライン準拠のファインチューニングにより7Bパラメータでも高いゼロショット性能を実現
- Wang et al. (2022) / Chung et al. (2022)との違い: マルチタスクファインチューニング(instruction tuning)を行うが、ラベル名のみをプロンプトに含め、詳細なアノテーションガイドラインは使用していない
- Raffel et al. (2020)との違い: T5のtext-to-text形式を提案したが、IE固有のガイドライン表現やコードベース入出力は含まない
- Schick & Schütze (2021) / Scao & Rush (2021)との違い: プロンプトベースの手法だがIE向けガイドライン準拠の仕組みはなく、GoLLIEはガイドラインを構造化してモデルに与える
- Wang & Komatsuzaki (2021) / Black et al. (2022) / Rozière et al. (2023)との違い: コード生成モデル(GPT-J, GPT-NeoX, Code-LLaMA)を基盤モデルとして利用するが、GoLLIEはCode-LLaMAをIEガイドライン準拠にファインチューニング
- Touvron et al. (2023a; 2023b)との違い: LLaMA/LLaMA-2は汎用LLMだが、GoLLIEはCode-LLaMAをバックボーンとし、コード表現を活かしたIE特化のファインチューニングを実施
- Chowdhery et al. (2022)との違い: PaLMはスケーリングによる汎化を追求するが、GoLLIEはガイドライン準拠の正則化手法でより小規模モデルでも高いゼロショット性能を達成
- Muennighoff et al. (2023)との違い: 多言語・多タスクファインチューニングで汎化を追求するが、IEガイドライン活用の仕組みはない
- Singhal et al. (2022; 2023)との違い: 医療ドメインでのLLM応用だが、IE固有のアノテーションガイドライン準拠メカニズムはない
- Conneau et al. (2020) / He et al. (2023)との違い: XLM-RoBERTa/mDEBERTAなどのエンコーダのみモデルはIE共有タスクで高性能だが、ゼロショット汎化能力に限界があり、GoLLIEはガイドライン準拠により未知タスクへの汎化を実現
- Tan et al. (2023)との違い: LLMと自然言語指示をIEに活用するが、エンコーダモデルに性能で劣る。GoLLIEはガイドライン準拠ファインチューニングでこの課題を克服
- Zhou et al. (2023)との違い: UniversalNERはLLMからの知識蒸留でオープンNERを行うが、ガイドライン準拠の仕組みは持たない
- Zhang et al. (2023a)(PromptNER)との違い: GPT-3.5やT5にChain-of-Thoughtでガイドライン定義をプロンプトするが、モデル自体をガイドライン準拠にファインチューニングしていないため性能が低い。GoLLIEはファインチューニングによりガイドライン準拠能力を獲得
- Blevins et al. (2023)との違い: LLMのラベルに対する強い事前知識がガイドライン準拠を妨げることを示したが、GoLLIEは正則化手法でこの問題に対処
- Sainz et al. (2021; 2022a; 2022b)との違い: テキスト含意や質問応答を利用した間接的教師なし手法でゼロショットIEを改善するが、GoLLIEはガイドラインを直接活用しより高い性能を達成
- Levy et al. (2017)との違い: 読解理解によるゼロショット関係抽出を行うが、GoLLIEのようなガイドライン準拠の統一フレームワークではない
- Obeidat et al. (2019)との違い: Wikipediaからのラベル説明をLSTMで埋め込みエンコードするが、GoLLIEはPythonコードベースでガイドラインを構造的に表現しLLMに直接入力
- Chen et al. (2021)との違い: 外部知識を活用したゼロショット細粒度NERだが、GoLLIEはガイドラインをコード形式で統一的に表現する汎用的アプローチ
- Lu et al. (2022a; 2022b)との違い: 統一テキスト→構造生成でIEタスクを普遍的にモデル化するが、ガイドライン情報を活用しておらず、GoLLIEのゼロショット性能に劣る
- Lou et al. (2023)との違い: IEタスクをセマンティックマッチング問題に変換し新ドメインへ汎化するが、GoLLIEのようなアノテーションガイドライン準拠アプローチとは異なる
- Wang et al. (2023a)(InstructUIE)との違い: IEタスクを自然言語記述指示としてフレーム化しLLMを学習するが、ガイドライン情報を使用しない。GoLLIEは12データセットのみで34データセット使用のInstructUIEを大幅に上回る
- Wang et al. (2023b) / Li et al. (2023)(CodeIE)との違い: コードベースの表現をIEに適用する点は類似するが、GoLLIEはガイドラインをdocstringとして統合し、正則化手法でガイドライン準拠を強制
- Fetahu et al. (2023)との違い: MultiCoNER共有タスクではエンコーダモデルが最高性能だが、GoLLIEはガイドライン準拠LLMによるゼロショット汎化という異なるアプローチ
- Hu et al. (2022) / Dettmers et al. (2023)との違い: LoRA/QLoRAは効率的ファインチューニング手法であり、GoLLIEはこれを活用してゼロショット汎化に最適化(フルモデルファインチューニングより高性能)
- Penedo et al. (2023)との違い: Falconは汎用LLMだが、GoLLIEの予備実験でCode-LLaMAがコード表現との相性で優位と判明
- Wang et al. (2021)との違い: 外部知識による文脈検索でNERを改善するが、GoLLIEはガイドライン準拠という異なるアプローチで汎化を実現
- Ratinov & Roth (2009)との違い: NERの設計課題を指摘した先行研究であり、GoLLIEの誤り分析で曖昧ラベル問題の文脈で参照
# 有効性
- ゼロショット評価で、ベースライン(ガイドラインなし)と比較して平均13 F1ポイントの大幅な性能向上を達成
- 従来のゼロショットSoTA手法であるInstructUIE(34データセット・11B FlanT5使用)を、わずか12データセット・7B Code-LLaMAベースで大幅に上回った
- PromptNER(GPT-3.5、175Bパラメータ)と比較して、全データセットで有意に高い性能を示し、LLMをガイドライン準拠にファインチューニングする重要性を実証
- 教師あり評価ではベースラインと平均0.3 F1ポイント差であり、ゼロショット汎化のための正則化が教師あり性能を損なわないことを確認
- 未見ラベルと既見ラベルの性能差がベースラインより小さく、GoLLIEの優れた汎化能力を実証(特にモデルサイズ増加に伴い差が縮小)
- アブレーション研究により、代表的候補(candidates)の除去が最大の性能低下(-5.4 F1)をもたらし、ガイドラインの各構成要素が相補的に機能することを確認
- ハルシネーション分析で、全ゼロショットデータセットにおいて解析不能出力・ハルシネーションラベルともに予測の1%未満と極めて低い割合を達成
- 7Bから34Bへのモデルスケーリングにより、ゼロショット平均性能が55.3→57.2 F1と改善し、スケーラビリティを実証
# 信頼性
- 19のIEデータセット(NER, RE, EE, EAE, SF の5タスク)を使用し、ニュース・生物医学・Twitter・サイバー犯罪・科学・クエリ・Wikipediaなど多様なドメインをカバーする包括的な評価設計
- 訓練データと評価データをドメインベースで分離し、ゼロショット評価のデータリーク回避に配慮。また、ベースラインと同一のバックボーンLLMを使用することでデータ汚染の影響を相対的に排除
- 全実験結果に標準偏差を付記し、統計的検定(片側p値)をアブレーション研究で実施。クラスドロップアウト(p=4.0e-3)および代表候補(p=2.2e-10)は統計的に有意
- 7B・13B・34Bの3つのモデルサイズで一貫した傾向を確認し、結果の頑健性を検証
- QLoRA vs フルモデルファインチューニングの比較実験により、QLoRAの優位性を実証し、手法選択の妥当性を根拠付け
- コード・データ・モデルを公開しており(GitHub: hitz-zentroa/GoLLIE)、再現性を担保
- カーボンフットプリント(CO2排出量)まで記載しており、計算リソースの透明性が高い
- データ汚染の可能性について正直に議論し、Code-LLaMAの事前学習データへのアクセスがない限界を明示した上で、ベースラインとの公平な比較により影響を緩和していると説明
和訳
1 / 1
100%