何が起きたか
2026年8月18日にarXivに公開された論文(識別番号2608.17453v1)で、EATR-Stereoが発表された。これは、頭部搭載ステレオカメラを持つヒューマノイドの長期的な視覚・言語・行動(VLA)制御のためのフレームワークである。既存のインターフェースが補完的なステレオ情報を捨てるか、追加観測を融合する際に本来の主視点経路を保持しない問題に対し、EATR-Stereoは主視点トークンを保持し、同期した補助視点トークン列をクエリして主視点に整合したCross-View Auxiliary Tokens(CVAT)を構築する。身体セグメント化された固有受容エンコーダがロボットの構成履歴に基づいてトークンごとの補助使用を調整し、事前学習済みVLAの視覚言語モデルを凍結したまま、言語と主視覚コンテキストを補強する。33自由度の物理ヒューマノイドと37次元の固有受容状態で、100回以上の探索・接近・把持・配置・帰還タスクを9構成で評価し、全タスク成功率60.0%、把持成功率100.0%、段階成功率80.0%を達成した。
詳細
EATR-Stereoの核心は、embodiment-aware token-routingフレームワークにある。主視点トークンを保持しつつ、同期した補助視点トークン列をクエリして主視点に整合したCross-View Auxiliary Tokens(CVAT)を生成する。身体セグメント化された固有受容エンコーダがロボットの構成履歴に基づいてトークンごとの補助使用を調整し、行動生成中にステレオ情報を選択的に組み込む。このルーティングされた補助ストリームは、事前学習済みVLAの言語と主視覚コンテキストを補強するが、視覚言語モデルは凍結されたままである。 評価は33自由度の物理ヒューマノイドと37次元の固有受容状態で行われ、100回以上の探索・接近・把持・配置・帰還タスクを9構成で実施した。その結果、EATR-Stereoは全タスク成功率60.0%、把持成功率100.0%、段階成功率80.0%を達成した。重度の非対称遮蔽下では、回復率がCVAT単独の30%に対し80%に改善した。アブレーション研究により、主トークンの保持と、構造化された固有受容ルーティングと組み合わせたクロスビュー補助特徴の重要性が示された。
Key Facts
| EATR-Stereoは、頭部搭載ステレオカメラを持つヒューマノイドの長期的な視覚・言語・行動(VLA)制御のためのフレームワークである。 | 出典一覧 |
| EATR-Stereoは主視点トークンを保持し、同期した補助視点トークン列をクエリして主視点に整合したCross-View Auxiliary Tokens(CVAT)を構築する。 | 出典一覧 |
| 身体セグメント化された固有受容エンコーダがロボットの構成履歴に基づいてトークンごとの補助使用を調整する。 | 出典一覧 |
| 事前学習済みVLAの視覚言語モデルは凍結されたまま、言語と主視覚コンテキストを補強する。 | 出典一覧 |
| 33自由度の物理ヒューマノイドと37次元の固有受容状態で評価された。 | 出典一覧 |
| 100回以上の探索・接近・把持・配置・帰還タスクを9構成で実施した。 | 出典一覧 |
| EATR-Stereoは全タスク成功率60.0%、把持成功率100.0%、段階成功率80.0%を達成した。 | 出典一覧 |
| 重度の非対称遮蔽下では、回復率がCVAT単独の30%に対し80%に改善した。 | 出典一覧 |
| アブレーション研究により、主トークンの保持と、構造化された固有受容ルーティングと組み合わせたクロスビュー補助特徴の重要性が示された。 | 出典一覧 |
なぜ重要か
EATR-Stereoは、ヒューマノイドの長期的なVLA制御において、ステレオ視覚情報を効果的に活用する方法を示した。既存手法が補完的なステレオ情報を捨てる問題を解決し、事前学習済みモデルを凍結したまま性能を向上させる点で、実用的なロボット制御への応用が期待される。