Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities (DeR2)
要約
論文タイトル:Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities (DeR2)
論文掲載雑誌名:arXiv preprint arXiv:2601.21937 (cs.AI)(ByteDance Seed, M-A-P)
論文発行年月:202601
# 概要(Abstract)
- 既存ベンチマークで高性能でも、LLMが真に新規な科学情報に対して推論できるかは不明。多くの評価はエンドツーエンドRAGパイプラインを採点し、推論が検索やツールチェーン選択と交絡し、パラメトリック記憶やオープンWebの不安定性で信号が汚染される。
- 本研究は、文書接地推論を分離しつつ深層探索の核心的難しさ(多段合成・ノイズ除去・証拠ベースの結論導出)を保持する制御されたディープリサーチ・サンドボックス DeR2 を提案。
- 証拠アクセスと推論を4レジーム——Instruction-only、Concepts(文書なしのゴールド概念)、Related-only(関連文書のみ)、Full-set(関連文書+話題的に近いディストラクタ)——で分離し、検索損失vs推論損失を操作化する解釈可能なレジーム間ギャップを生み、細粒度のエラー帰属を可能にする。
- パラメトリック漏洩を防ぐ二段階検証(文書なしでは失敗かつオラクル概念で解ける)と、再現性のため凍結文書ライブラリ(2023–2025年の理論論文)+専門家注釈概念+検証済み論拠を提供。最先端モデルの実験で、モード切替脆弱性(Full-setがInstruction-onlyより悪化)や構造的概念誤用(概念を正しく挙げても手順として実行できない)が明らかに。
# 1. はじめに(Introduction)
- 基盤モデルは流暢な助手から強力な問題解決者へ進化し、AIME・SWE-bench等で高性能。エージェントが外部検索と内部推論を結合してパラメトリック知識を超える中、ディープサーチが基礎的評価シナリオとして台頭。
- 現行のディープリサーチ評価には3つの限界:(1)エンドツーエンドのパイプライン交絡と診断力の弱さ(誤りの原因=概念欠落/概念適用失敗/ノイズによる脱線の区別困難)、(2)パラメトリック漏洩・記憶、(3)Webの不安定性・再現不能性。
- DeR2は4レジームで証拠アクセスと推論を分離し交絡を緩和、二段階検証で漏洩を防ぎ、凍結文書ライブラリ(平均6.5文書)でWeb不安定性を排除する。
# 2. ベンチマーク(Benchmark)
- 2.1 概要:科学的問題解決における検索注入推論を評価。(a)文書集合から解に関連する概念を同定・抽出する能力と、(b)それらを構成・スケジュールして正答を導く能力を明示的に分離。
- 2.2 タスク定義:各例は Instruction(最先端論文由来の高次の学術的問い)/Concepts(必要な概念・定理・式)/CoT(概念から答えへの推論過程)/Answer/Doc Set(必要文書+ノイズ文書)の組。概念の操作化(定理のインスタンス化・アルゴリズム実行)を重視。
- 2.3 データ収集:中国トップ大(985)の博士課程生81名が自分の専門分野でのみ注釈(1問2500RMB、監査350RMB)。Step1 出典論文取得(2023–2025年・理論志向に限定、実験系は除外)、Step2 四つ組構築(人手でInstruction-Answer確定)、Step3 オフラインLLMでの難易度較正(概念なしで3回全不正解、概念ありで1回以上正解かつ1回以上不正解)、Step4 出典論文の参考文献から関連・ノイズ文書を収集、レビュア検査。
# 結果と結論(Results and Conclusion)
- 強力な商用・オープンモデル横断で一貫した非自明な失敗モードを観測:(1)推論モード切替失敗(Instruction-onlyがFull-setを上回り、文書追加が有効なパラメトリック推論経路を乱す)、(2)構造的(手続き的)検索失敗(定義は認識するが構成的機構を実行できない)、(3)Concepts-onlyが上限ではない(多概念協調・長距離依存追跡のボトルネック)、(4)非線形なノイズ効果(初期の推論トポロジーを変え回復不能な軌道ドリフトを招く)。
- DeR2は検索と推論を分離し、性能損失を証拠選択/ノイズ除去・文書→概念抽出・概念レベルの構成/スケジューリングに安定的に帰属させ、トップ級システムにも大きな改善余地と具体的失敗モードを示した。
評価
論文タイトル:Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities (DeR2)
論文掲載雑誌名:arXiv preprint arXiv:2601.21937 (cs.AI)(ByteDance Seed, M-A-P)
論文発行年月:202601
# 新規性
- LLMの「検索(証拠アクセス)」能力と「推論」能力を分離して評価する制御ベンチマーク DeR2 を提案した点
- 同一の問いを4レジーム(Instruction-only=パラメトリック知識のみ/Concepts=ゴールド概念のみ/Related-only=関連文書のみ/Full-set=関連+ディストラクタ)で評価し、レジーム間ギャップで「検索損失 vs 推論損失」を操作化し細粒度のエラー帰属(概念欠落・概念誤用・ノイズ起因のモード切替)を可能にする設計が新規
- パラメトリック漏洩防止の二段階検証(文書なしでは失敗かつオラクル概念で可解)と、2023–2025年理論論文由来の凍結文書ライブラリ(専門家注釈概念+検証済みCoT)で再現性とノベルティを両立する点
# 言及されている全ての関連研究との相違点
- クローズドブックQA(内在知識のみ評価)、標準RAGパイプライン(検索と推論が交絡し失敗原因を隠蔽)、ディープリサーチ・ベンチマーク(BrowseComp、HLE)やエージェント設計を概観
- これら先行が「正誤の二値結果」しか出さず、ツールチェーン選択に分散が支配され、Web依存で非定常・再現困難なのに対し、DeR2は証拠アクセスと推論を統制的に分離し、凍結文書ライブラリで再現性を確保、プロセスレベル(証拠利用)の評価を行う点で差別化
# 有効性
- 985大学の博士課程生81名が自専門分野でのみ注釈する厳格なデータ収集(高報酬・難易度較正・レビュア二重検査)で、最先端の商用・オープンモデルを横断評価
- 一貫した非自明な失敗モードを定量的に明らかに:(1)モード切替脆弱性(Full-setがInstruction-onlyより悪化=文書追加が有効な推論経路を乱す)、(2)構造的概念誤用(定義は挙げられるが手順実行できない)、(3)Concepts-onlyが上限でない(多概念協調・長距離依存の限界)、(4)非線形なノイズ効果(初期推論トポロジーを変え回復不能なドリフト)。トップ級システムにも大きな改善余地を示した
- ただし対象が理論志向論文(実験系は除外)に限定され、注釈者が中国トップ大博士に偏る。ベンチマーク提案論文であり、提示は失敗モードの診断が中心で、改善手法そのものは提供しない
# 信頼性
- arXivプレプリント(査読前、2026年1月投稿)だが、ByteDance Seed・M-A-Pによる大規模な取り組みで、二段階検証プロトコル・凍結文書ライブラリ・専門家注釈・難易度較正の手順を詳細に記述し再現性に強く配慮(プロジェクトページ公開)
- 一方、査読を経ておらず、対象分野(理論志向)と注釈者層に偏りがあり、評価対象モデルも論文時点のもの。結論は「現行LLMは検索と推論の分離評価で4つの一貫した失敗モードを示し、トップ級でも改善余地が大きい」という診断的知見の提示にとどまり、解決策は今後の研究に委ねられる
和訳
1 / 1
100%