何が起きたか
StanfordのHomeBodyは、VLMが現在のego view、map context、gripper state、recalled observations、previous resultを使って技能と対象を選び、その選択をstructured tool callで実行系に渡す方式を示した。VLMは低レベル実装を知る必要がなく、把持では0〜1000で正規化した画像点と使用する手を指定する。移動は2D goalと向き、配置は手・3D release target・release distance、引き出し操作はhandle alignmentとhooking posture、backward walkingを組み合わせる。
詳細
把持の処理では、画像上の点がsegmentationを促し、Fast-FoundationStereoがD435i stereo imagesから深度を推定する。camera calibrationでmasked geometryを3Dに投影し、そこからgraspをanalyticalに予測する。さらにarm plannerがminimum-jerk timingのspline referenceを作り、inverse kinematicsを軌道に沿って解き、swept motionのcollision clearanceを確認する。 他の技能も対象表現が分かれている。navigationはmap coordinatesでmeters単位の2D goalとfacing pointを用い、placingはtorso frameでの3D release targetとrelease distanceを指定する。drawer openingは、reachからpullへの移行を一つの技能としてまとめている。
Key Facts
| HomeBodyは、VLMがskillとtargetを選び、structured tool callを通じて実行系に渡す設計である。 | [1] |
| 把持では、image pointは0〜1000に正規化され、どの手を使うかも指定する。 | [1] |
| Fast-FoundationStereoはD435i stereo imagesから深度を推定する。 | [1] |
| arm plannerはminimum-jerk timingのspline reference、inverse kinematics、collision clearanceチェックを組み合わせる。 | [1] |
| navigation、placing、drawer openingは、それぞれ2D goal、3D release target、handle alignmentとhooking postureを含む技能として扱われる。 | [1] |
本紙の見方
HomeBodyの新規性は、VLMを「全部を直接計画する主体」ではなく、技能選択とターゲット指定に限定し、その先の運動生成を別系統に委ねている点にある。ここで重要なのは、視覚言語モデルが知覚から行動までを一気通貫で抱え込むのではなく、map contextやgripper state、previous resultまで含めて高位の判断を行い、低位の実装はskill側に閉じていることだ。これは既存のロボット制御を置き換えるというより、推論層と実行層の境界を明示的に切り直す提案だと読める。 本紙の過去報道との接続はないが、今回の記述からは、把持・移動・配置・引き出しという異なる行動を同じ枠組みで扱おうとする方向が見える。特に、把持だけは画像点、手、深度、3D復元、解析的把持、軌道、衝突確認まで細かく分解し、navigationはmeters単位の2D goalとfacing point、placingはtorso frameの3D release targetとrelease distanceと、行動ごとに座標系と入力形式を切り替えている。つまり、汎用的な一枚岩のポリシーではなく、タスクごとの空間表現を揃えることで、実世界の操作をつなごうとしている構造である。 業界構造への含意としては、モデル性能だけでなく、セグメンテーション、ステレオ深度、カメラキャリブレーション、逆運動学、衝突判定といった実行基盤の整合性が重要になる。VLMが高位判断だけを担うなら、評価の焦点も「何を選ぶか」と「その選択がskill側で正しく実行されるか」に分かれる。ここで未確定なのは、HomeBodyがどの程度のタスク範囲を一貫して扱えるのか、どのskillが実装されているのか、また実環境での成功率や失敗時の復帰がどう設計されているかである。さらに、structured tool callの仕様が他のロボット基盤へどれだけ移植可能かも、今後確認すべき点だ。
なぜ重要か
VLMが把持や移動の細部を直接出力せず、skill選択とターゲット指定に集中する設計は、ロボット側の実装を差し替えやすくする可能性がある。発表内容上、把持では0〜1000の画像点、navigationでは2D goal、placingでは3D release targetといった異なる入力表現を使い分けており、行動ごとの座標系を明示している点が実装上の論点になる。
日本への影響
日本のロボット開発では、VLMそのものだけでなく、D435iのようなステレオ深度、キャリブレーション、逆運動学、衝突判定を含む実行層の統合が課題になるとみられる。特に、把持・移動・配置で異なる座標系を切り替える設計は、産業用ロボットやサービスロボットの制御基盤を持つ企業にとって、既存ソフト資産の活用余地と再設計範囲を見極める材料になる。