何が起きたか

EyeRobot 2.0は2026年10月2日、手首カメラなしで細かな両手操作を行うための「Active Gaze」枠組みをarXivで公表した。入力はステレオカメラ1台で、2つの視点を3次元の注視点へ向け直し、注視中心の画像特徴に多くのビジュアルトークンを割り当てる設計である。実験では、実機1000回超、シミュレーション1800回超の試行で、受動的ステレオのみの方式やego+wrist camera方式と比較した。

詳細

手法は、まず目標物条件付きの低レベル視線サーボ方策を学習し、その後、タスク進行に応じて注視目標を出すターゲット選択器を学習する階層構造を取る。両モジュールは実世界データで強化学習により訓練され、前者は密な幾何学的報酬、後者はBCのグリッパー方策と共同訓練される。 著者らは、7つの実世界タスクと6つのシミュレーションタスクの遠隔操作データを収集した。結果として、実世界では受動的ステレオのみの成功率が52%から27%に下がった一方、EyeRobot 2.0はステレオのみでこの差を埋め、受動的ステレオ比で実世界40%、シミュレーション20%上回った。手首視点が明瞭な場合はego+wrist方式に近い69%対64%を示し、把持物が手首カメラを遮る場合は48%対22%と差が広がった。

Key Facts

EyeRobot 2.0は手首カメラなしで細かな両手操作を行うActive Visual Fixation(AVF)枠組みを提案した。[1]
入力はステレオカメラ1台で、2つの眼の視点を3Dの注視点へ向ける設計である。[1]
注視中心の画像にはより多くのビジュアルトークンを割り当てる。[1]
実世界データで、低レベル視線サーボ方策とターゲット選択器を階層的にRLで学習した。[1]
7つの実世界タスクと6つのシミュレーションタスクで、1000回超の物理試行と1800回のシミュレーション試行を行った。[1]

本紙の見方

この発表の新しさは、手首カメラを足すのではなく、視線を制御して観測そのものを変えた点にある。ロボット操作の精度向上を「より多い視点」ではなく「より狙った視点」によって達成しようとした構成で、計算も画像全体に均等配分せず、注視点の中心に寄せている。これは単なるセンサー削減ではなく、観測、計算、行動を一体で設計し直した提案である。 本紙の過去報道との接続はないが、今回の要点は既存のステレオ対手首視点の二項対立をそのまま受け入れていないところにある。低レベルの視線サーボと、タスク進行に応じて注視点を選ぶ上位モジュールを分け、さらにBCのグリッパー方策と共同訓練しているため、視線は単なる補助入力ではなく操作方策の一部として扱われている。ここからは、ロボット認識の改善がカメラ台数の増加ではなく、注視制御と表現圧縮で実現されうることが読み取れる。 業界構造への含意としては、まず手首カメラ前提の設計を見直す余地がある。把持物がカメラを遮る条件で69%対64%から48%対22%へ差が開いた事実は、視点配置の脆弱性がタスク成否を左右することを示す。他方で、ステレオのみで52%から27%に落ちた既存方式に対し、EyeRobot 2.0が40%改善した点は、単純なセンサー追加よりも、注視点推定と視覚表現の組み合わせが効く可能性を示している。今後確認すべき論点は、実機での対象タスクの広がり、注視サーボの安定性、学習に必要な遠隔操作データの量、そして異なるロボットやカメラ配置への移植性である。

なぜ重要か

手首カメラを増やせない、あるいは増やしたくないロボットにとって、単一のステレオカメラで精密操作の性能を保てるなら設計余地が広がる。発表では、視点が遮られる場面で既存方式との差が大きくなっており、視認性の悪い把持作業でどの程度安定して動くかが実装の焦点になる。

日本への影響

日本のロボット開発では、カメラや手首周辺の機構を増やす設計と、限られた視点からの認識で勝つ設計のどちらを採るかが論点になりうる。特に把持時の遮蔽に弱い構成を前提にしている場合、視線制御と画像表現の圧縮に移る余地がある。