AutoWebGLM: Bootstrap And Reinforce A Large Language Model-based Web Navigating Agent
要約
# 1. Introduction
- AutoWebGLMは、ChatGLM3-6Bを基にしたGPT-4を上回るウェブナビゲーションエージェント
- ウェブページを簡潔に表現するHTMLシンプル化アルゴリズムを考案
- カリキュラム学習のためのウェブブラウジングデータをハイブリッドな人間-AIの手法で構築
- 強化学習とリジェクションサンプリングでモデルをブートストラップし、ウェブページの理解、ブラウザ操作、効率的なタスク分割を促進
- 二言語のウェブブラウジングベンチマーク「AutoWebBench」を確立
- AutoWebGLMを様々なウェブナビゲーションベンチマークで評価し、改善点と実環境で取り組むべき課題を明らかに
# 2. Method
## 2.1 Problem Setup
- ウェブブラウジングタスクをシーケンシャルな意思決定プロセスと見なす
- 状態は現在のページ状態、アクションは全てのブラウジング操作を含む
- 履歴情報の更新、現在の状態と履歴に基づく行動選択をモデル化
## 2.2 The AutoWebGLM Framework
- HTMLシンプル化とOCRモジュールを通して情報を処理
- 操作可能な要素をマークし、エージェントが相互作用
- オブザーベーション空間とアクション空間を提案
## 2.3 Data Preparation
- 高品質で複雑なウェブブラウジングデータの不足に対処するため、ハイブリッドな人間-AIデータ構築手法を提案
- ウェブ認識とシンプルタスク操作の構築、複雑タスク操作の構築の2段階に分けて説明
- Mind2WebとMiniWob++のデータセットとマージしてトレーニングデータセットを形成
- AutoWebBenchを構築し、in-domainとout-of-domainに分割して評価
## 2.4 Training
- カリキュラム学習、強化学習、リジェクションサンプリングの3ステップで学習
- カリキュラム学習でウェブページの理解と操作を学習
- 強化学習で自分の間違いから学習
- リジェクションサンプリングで特定のドメインの専門家に
# 3. Experiments
- 二言語のベンチマークAutoWebBenchを確立し、利用可能なエージェントの能力を評価
- 英語と中国語のウェブサイトのナビゲーションにおけるAutoWebGLMのパフォーマンスを評価
- Mind2Web、MiniWoB++、WebArenaの3つの確立されたウェブナビゲーションベンチマークでも実験
# 4. Related Work
- 言語モデル(LMs)、ウェブナビゲーションのベンチマーク、ウェブオートメーションのエージェント、プロンプトベースのデータ構築手法に関する関連研究を議論
# 5. Conclusion
- 高度な言語モデルベースのエージェントAutoWebGLMを提案し、様々な自律型ウェブナビゲーションベンチマークで高いパフォーマンスを示した
- 二言語のウェブブラウジングベンチマークを導入し、将来の研究の基礎を築いた
- 知的エージェントのためのLLMsの活用における重要な進歩を示した
評価
# 新規性
- 自動ウェブブラウジングエージェントAutoWebGLMの提案。オープンソースのChatGLM3-6Bモデルをベースに、カリキュラム学習、強化学習、リジェクションサンプリングファインチューニングを組み合わせて開発。
- HTMLの簡略化アルゴリズムにより、重要情報を保持しながらページ情報を要約。モデルの理解と操作を改善。
- 人間とAIのハイブリッド手法によるウェブブラウジングデータの構築。強化学習とリジェクションサンプリングにより、ページ理解、ブラウザ操作、タスク分解能力を自律的に向上。
- 実世界のウェブブラウジングタスク用の二言語ベンチマーク「AutoWebBench」を確立。
# 言及されている全ての関連研究との相違点
- GPT-4よりも優れたパフォーマンスを示す。ChatGLM3-6Bをベースとした、実用的なウェブナビゲーションエージェントを開発。
- 既存の研究では、ウェブページの多様性、HTMLの長さ、オープンドメインの複雑さにより、実世界のページでの満足なパフォーマンスが得られていない。本研究ではそれらの課題に取り組んでいる。
- 人間のブラウジングパターンに着想を得たHTMLの簡略化アルゴリズムを考案。重要情報を簡潔に保持。
- 人間とAIのハイブリッド手法でウェブブラウジングデータを構築し、カリキュラム学習に活用。
- 強化学習とリジェクションサンプリングによりモデルをブートストラップ。ページ理解、ブラウザ操作、タスク分解を自律的に向上。
# 有効性
- 様々なウェブナビゲーションベンチマークにおいて、AutoWebGLMが改善を示した。実世界の挑戦的なミッションではまだ人間との差があるが、進歩が見られた。
- 二言語の実世界ウェブブラウジングタスク用ベンチマーク「AutoWebBench」で評価。同一ウェブサイトのデータ(in-domain)と、訓練に含まれないウェブサイトのデータ(out-of-domain)に分けてテスト。
- 6Bパラメータで最先端のLLMベースのエージェントに匹敵するパフォーマンスを達成。実用レベルに到達。
# 信頼性
- 様々なウェブベースのタスク(日常使用、娯楽、学術研究など)についてケーススタディを行い、ほとんどのシナリオで満足のいく結果を得た。
- 一方で、タスク実行時に時折発生するエラー(幻覚、グラフィカル認識の不足、タスク文脈の誤解釈、ポップアップの割り込み)も特定された。これらの克服が今後の課題。
- 二言語のベンチマークデータを用いて定量的に評価。人間のアノテーションによるデータで訓練とテストを行っている。
和訳
1 / 1
100%