何が起きたか

arXivに公開された論文で、HarnessWAMというエージェント型フレームワークが提案された。世界行動モデル(WAM)は環境ダイナミクスとロボットの行動を共同で学習するが、有限ホライズンの予測と行動生成では、グローバルな計画、クロスステージの状態維持、実行検証、失敗回復を必要とする複雑な具現化タスクには不十分であり、これを予測と熟考のギャップと呼ぶ。HarnessWAMは、視覚言語モデルベースのタスクマネージャーを用いて、証拠に基づくシーンの信念と構造化されたタスクグラフを維持する。能力条件付き実行可能空間投影により、オープンエンドな意味的計画を、タスク依存関係、身体状態の制約、基盤となるWAMの能力境界を満たす原子スキルのシーケンスに制約する。実行中は、イベント駆動型の二重タイムスケールフィードバックループを動作させ、軽量な進捗推定器が高頻度の実行証拠を提供し、タスクマネージャーが顕著なマイルストーンで、現在の観察、タスク状態、相互作用履歴を考慮して、タスクを進めるか、追加の観察を取得するか、計画を修正するか、局所的な回復を開始するかを決定する。これにより、サブタスク失敗後に状態を回復し、以前に取得したシーン知識を破棄せずに実行を再開できる。RoboMemArenaでタスク成功率59.6%、サブタスク成功率69.9%、RoboCerebra IdealでSR 23.7%を達成し、モデル外部の構造化状態維持と閉ループのエージェント型意思決定がWAMの局所制御能力を拡張できることを示した。

Key Facts

HarnessWAMは、世界行動モデル(WAM)の予測と熟考のギャップに対処するエージェント型フレームワークである。[0]
HarnessWAMは、視覚言語モデルベースのタスクマネージャーを用いて、証拠に基づくシーンの信念と構造化されたタスクグラフを維持する。[0]
HarnessWAMは、能力条件付き実行可能空間投影により、オープンエンドな意味的計画を原子スキルのシーケンスに制約する。[0]
HarnessWAMは、イベント駆動型の二重タイムスケールフィードバックループを動作させ、軽量な進捗推定器とタスクマネージャーが協調する。[0]
HarnessWAMは、RoboMemArenaでタスク成功率59.6%、サブタスク成功率69.9%を達成した。[0]
HarnessWAMは、RoboCerebra IdealでSR 23.7%を達成した。[0]

なぜ重要か

この研究は、世界行動モデル(WAM)の限界を指摘し、モデル外部の構造化状態維持と閉ループのエージェント型意思決定によって、複雑な具現化タスクの実行を計画可能かつ検証可能、回復可能に拡張できることを示している。