日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
LLMエージェントarXiv:2608.04934

State2State: 環境から導出された中間学習によるLLMエージェントの訓練

State2State: Environment-Derived Mid-Training for LLM Agents

シェア:XThreadsFacebookLINEはてブBluesky

外部タスク指定なしに環境との相互作用のみでエージェントを訓練する手法を提案。探索した環境状態を目標状態に変換し、ルールベースの状態一致で検証することで、スケーラブルで検証可能な訓練目標を提供する。

詳しい要約

1. どんなもの?

State2Stateは、LLMエージェントの訓練において、外部から指定されたタスクや専門家による監視信号を用いず、環境との相互作用のみから学習する環境学習パラダイムを提案する手法。環境探索で得られた状態を訓練目標に変換し、エージェントに指定された目標状態への到達を課す。ALFWorldとScienceWorldでの実験により、単独の環境学習段階として多くの設定で性能を向上させ、下流のRLの初期化としても有効であることを示す。

2. 先行研究と比べてどこがすごい?

従来のLLMエージェント訓練は、専門家の軌跡からの教師ありファインチューニングや、人手で設計したタスクと検証器を用いたオンライン強化学習に依存しており、外部指定のタスクと監視信号にボトルネックがあった。State2Stateは、外部指定のタスクや専門家の監視を必要とせず、環境探索からタスクを自動導出し、ルールベースの状態マッチングで成功を検証するため、スケーラブルで検証可能な訓練目標を提供する点が新しい。

3. 技術・手法の肝は?

手法の核は、環境探索によって得られた状態を訓練目標に変換すること。具体的には、エージェントが環境を探索して状態遷移を収集し、その状態を目標状態として設定する。エージェントは現在の状態から目標状態への到達を試み、成功はルールベースの状態マッチングで検証される。これにより、専門家の監視や手動のタスク設計なしに、検証可能な訓練信号を生成する。

4. どうやって有効だと検証した?

ALFWorldとScienceWorldの2つの環境で実験を実施。State2Stateを単独の環境学習段階として用いた場合の性能を、ベースラインと比較して多くの設定で向上を確認。さらに、下流のRLの初期化として用いた場合、最終性能と学習効率が向上し、環境間の一般化の有望な証拠も得られた。

5. 議論はある?

要旨からは、State2Stateが環境学習パラダイムの有効性を示す一方で、すべての設定で改善するわけではないこと、また環境間の一般化は有望だが限定的である可能性が示唆される。具体的な限界や議論の詳細は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、LLMエージェントの教師ありファインチューニングやオンライン強化学習に関する研究、および環境学習パラダイムに関連する研究が挙げられる。具体的には、ALFWorldやScienceWorldを用いたエージェント研究、および環境探索からのタスク生成に関する研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu

分類: cs.CL, cs.LG

原文アブストラクト

Training LLM agents commonly relies on supervised fine-tuning from expert trajectories or online reinforcement learning over human-specified tasks with handcrafted verifiers. Though effective, both remain bottlenecked by externally specified tasks and supervision signals, limiting the scalability and diversity of agent training. We study an environment learning paradigm in which agents acquire interaction and manipulation capabilities solely through environment interaction, without externally specified tasks. We propose State2State, an environment-derived mid-training method that converts explored environment states into training objectives, challenging agents to reach a specified target state. By deriving tasks from environment exploration and verifying success through rule-based state matching, State2State provides scalable and verifiable training objectives without expert supervision or manual task design. Experiments on ALFWorld and ScienceWorld show that State2State improves agent performance as a standalone environment-learning stage in most settings. As initialization for downstream RL, it further improves final performance and learning efficiency, with promising evidence of cross-environment generalization.

関連論文