日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.37721

CogWAM: イベント駆動型インターフェースによる意味認知と世界行動モデリングの整合

CogWAM: Aligning Semantic Cognition with World Action Modeling via Event-Driven Interfaces

シェア:XThreadsFacebookLINEはてブBluesky

タスク推論と世界行動学習の間に持続的な意味状態を介した明示的なインターフェースを設け、進捗条件付きクエリで未来予測と行動生成を整合させる認知誘導型世界行動モデルを提案。

詳しい要約

1. どんなもの?

- ロボットポリシーに意味推論と未来予測を統合するCogWAMを提案。 - タスク推論とworld-action学習の間にSemantic Stateを介した明示的な意味インターフェースを構築。 - Semantic Stateは完了したタスクイベントとアクティブなサブタスクを保持し、観測が意味的遷移を示すときのみ更新。 - これによりタスクレベルの文脈が複数のaction chunkにわたり持続。 - progress-conditioned WORLD/ACTIONクエリで意味文脈と物理予測・制御を橋渡し。

2. 先行研究と比べてどこがすごい?

- 従来は意味推論と未来予測を組み合わせても局所予測と行動がタスク進捗と整合しない問題があった。 - CogWAMはSemantic Stateを永続的に維持し、意味的遷移時のみ更新することでタスク文脈をaction chunk間で保持。 - 追加のrobot-action pretrainingなしでRoboDojoで15.56/11.70% Score/SR、BiCoordでSOTAを達成。 - 実世界実験でstep-wise更新よりSemantic State再生成が16.4回少ない閉ループdual-arm manipulationを実証。

3. 技術・手法の肝は?

- 永続的なSemantic Stateが完了イベントとアクティブサブタスクを保存し、観測が意味的遷移を示すときのみ更新。 - progress-conditioned WORLDクエリとACTIONクエリがタスク関連情報を選択的に抽出し、未来予測と行動生成に使用。 - 訓練時はSemantic Stateが両分岐に共有タスク進捗文脈を提供。 - 推論時は未来予測分岐を除去し、観測と維持された状態から直接行動生成。 - 意味的訓練戦略で遷移学習と閉ループ条件付けを改善。

4. どうやって有効だと検証した?

- RoboDojoで15.56/11.70% Score/SRを達成(追加のrobot-action pretrainingなし)。 - BiCoordでstate-of-the-art性能を達成。 - 実世界実験で閉ループdual-arm manipulationを実証し、step-wise更新よりSemantic State再生成が16.4回少ないことを確認。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法としてworld-action model、robot-action pretraining、RoboDojo、BiCoordが挙げられる。 - 同分野の定番としてRT-1、RT-2、Diffusion Policy、PaLM-Eなどが考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Sen Wang, Liu Liu, Xinjiang Wang, Zequn Chen, Haoyi Jiang, Taojun Ding, Tingyang Xiao, Zhizhong Su, Jie Wang, Sanping Zhou

分類: cs.RO, cs.CV

原文アブストラクト

Robot policies increasingly incorporate semantic reasoning and future-world prediction, yet combining these capabilities does not guarantee that local predictions and actions remain aligned with task progress. We introduce CogWAM, a cognition-guided world-action model that establishes an explicit semantic interface between task reasoning and world-action learning through a persistent Semantic State, which stores completed task events and the active subtask. CogWAM updates this state only when observations indicate semantic transitions, allowing task-level context to persist across multiple action chunks. To bridge semantic context with physical prediction and control, CogWAM employs progress-conditioned WORLD and ACTION queries that selectively extract task-relevant information for future-world prediction and action generation. During training, the Semantic State provides shared task-progress context for both branches, while inference removes the future-prediction branch and directly generates actions from observations and the maintained state. We further introduce semantic training strategies to improve transition learning and closed-loop conditioning. Without additional robot-action pretraining, CogWAM achieves 15.56 / 11.70 % Score/SR on RoboDojo and state-of-the-art performance on BiCoord, while real-world experiments demonstrate closed-loop dual-arm manipulation with 16.4 fewer Semantic State regenerations than step-wise updating.

関連論文

PR本紙発行元 EmplifAI