何が起きたか

arXivに公開された論文で、Mind-VLAという手法が提案された。従来のVision-Language-Action (VLA)モデルはシーン全体を一様に整列させるため、指示対象の3D幾何を無視していた。Mind-VLAは、言語指示から対象物体を特定し、そのトライビュー画像からVAEとVGGTの特徴を抽出して、VLAモデルの潜在表現を整列させる。これにより、細かい操作や遮蔽タスクでの性能が向上した。

Key Facts

Mind-VLAは指示対応型の空間表現アライメント手法で、言語指示で指定された対象物体の3D幾何に基づいて表現を整列させる。[0]
Mind-VLAはLIBEROで93.9%、CALVINで4.47を達成し、バックボーンは345Mパラメータ。[0]
実ロボットの遮蔽タスクで平均成功率54%を達成し、指示非対応の最良手法より32ポイント高い。[0]
コードは公開予定。[0]

なぜ重要か

VLAモデルはロボットの操作学習において重要だが、従来は指示対象の3D理解が不十分で、細かい操作や遮蔽時に失敗していた。Mind-VLAは指示対応型のアライメントにより、この問題を解決し、実ロボットでの性能を大幅に向上させた。これは、より正確で堅牢なロボット操作の実現につながる。