日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
WebエージェントarXiv:2609.02885v1

Webエージェントのための判別的世界モデル

Discriminative World Models for Web Agents

シェア:XThreadsFacebookLINEはてブBluesky

Webエージェントの行動選択を改善するため、予測状態マッチングという新しい学習目的を導入し、真の結果状態と代替行動の結果を区別できる世界モデルを訓練した。

詳しい要約

1. どんなもの?

本論文は、Webエージェントのテスト時行動選択を改善するための識別的世界モデル(Discriminative World Models)を提案する。従来の世界モデルは、候補行動をサンプリングし、その結果のWeb状態を予測し、ランカーやPRMでスコアリングするために用いられるが、予測された状態が候補間で識別的であることを保証しない。本手法は、予測状態マッチング(predicted-state matching)という新しい訓練目的を導入し、予測された表現が、代替行動によって到達する状態と真の結果状態を区別できるようにする。

2. 先行研究と比べてどこがすごい?

従来の世界モデルは、教師あり次状態予測(supervised next-state prediction)を用いて、HTMLやAXTreeスナップショットのような固定表現を生成するように訓練される。しかし、この目的は、下流のランカーが正確にスコアリングするために予測状態が候補間で識別的であることを必要とする点とミスアライメントである。本手法は、このミスアライメントを直接的に扱い、識別性を明示的に最適化する点が新しい。

3. 技術・手法の肝は?

手法の核心は、予測状態マッチング(predicted-state matching)という訓練目的である。これは、予測された表現が、真の結果状態と代替行動によって到達する状態を区別できるようにする。具体的には、WebArena Go-Browse軌跡から派生した分岐型Webエージェントデータセットを使用し、各決定点に複数の代替行動とその結果状態を含める。モデルは、候補行動の結果状態を予測し、その予測表現が真の状態と代替状態を区別するように訓練される。

4. どうやって有効だと検証した?

有効性は、保持された予測状態マッチングベンチマークで検証され、教師あり次状態予測で訓練された世界モデルよりも優れていることを示した。さらに、WebPRMBench上で、行動のみのPRMや教師あり次状態予測世界モデルで拡張されたPRMと比較して、PRMスタイルの行動ランキングを改善することを示した。最後に、WebArena-Lite上で、テスト時行動選択に世界モデルを使用することで、エンドツーエンドのタスク成功率が向上することを示した。

5. 議論はある?

要旨からは、議論の余地や限界についての詳細は不明である。ただし、提案手法は、予測状態の識別性を高めることでランキング性能を改善するが、予測状態の正確な生成と識別性のバランスや、データセットの分岐構造への依存性などが潜在的な課題として考えられる。

6. 次に読むべき論文は?

要旨で参照されている研究は、WebArena Go-Browse、WebPRMBench、WebArena-Lite、Process Reward Model (PRM)、および教師あり次状態予測を用いた世界モデルである。次に読むべき論文としては、これらのデータセットや手法の詳細を説明する原著論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, Chuyi Shang, Leon Oks, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig

分類: cs.AI, cs.LG

原文アブストラクト

Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction to generate fixed representations like HTML or AXTree snapshots. However, this objective is misaligned with the downstream ranker, which relies on predicted states being discriminative across candidates to accurately score them. To address this, we introduce predicted-state matching, a training objective where the predicted representation must distinguish the true resulting state from those reached by alternative actions. We train these models using a branching web-agent dataset derived from WebArena Go-Browse trajectories, where every decision point contains multiple alternative actions and their resulting states. Experiments on our held-out predicted-state matching benchmark show that our approach outperforms world models trained with supervised next-state prediction. We further show that our approach improves PRM-style action ranking on WebPRMBench compared with action-only PRMs and PRMs augmented with supervised-next-state world models. Finally, on WebArena-Lite, using our world model for test-time action selection improves end-to-end task success. Our project page is available at: https://dhruvpendharkar.github.io/dwm/.