何が起きたか
Alibaba DAMO Academyの研究チームは、カメラ校正を不要とする視覚言語行動モデル「CamVLA」を発表した。論文は2026年7月6日にarXivで公開され、カメラの外部パラメータを明示的に与えずとも、単眼RGB画像とタスク指示からロボットの操作を実現する。
詳細
CamVLAは、カメラ中心のエンドエフェクタ動作(カメラフレーム内での動作)と、カメラとロボットベース間の6自由度ハンドアイ行列を予測し、決定的な幾何学的変換によりロボットベースフレームの動作に合成する。これにより、キャリブレーション不要、深度不要、単眼視点で、展開時には単眼RGB画像とタスク指示のみを入力とする。評価はシミュレーションと実ロボットデータで行われ、多様な未見視点での成功率向上が確認された。
Key Facts
| CamVLAはカメラ中心のエンドエフェクタ動作と6自由度ハンドアイ行列を予測し、幾何学的変換でロボットベースフレームの動作に合成する。 | [1] |
| CamVLAはキャリブレーション不要、深度不要、単眼視点で、展開時には単眼RGB画像とタスク指示のみを入力とする。 | [1] |
| シミュレーションと実ロボットデータの評価で、多様な未見視点での成功率向上が示された。 | [1] |
なぜ重要か
CamVLAは、カメラ校正を不要にすることで、VLAモデルの実ロボット展開におけるセットアップの負担を軽減する可能性がある。これにより、ロボット導入の障壁が下がり、より柔軟なカメラ配置が可能になることが期待される。ただし、実環境での性能や限界については、今後の検証が必要である。