何が起きたか

arxiv.orgは2026-09-22、視覚言語モデル(VLM)を用いたロボット制御のためのハーネス「KnowBody」を公開した。モデル重みは固定したまま、行動に関係する身体の関係を明示し、検索でき、再修正できるようにする方式である。実機4課題で32回の固定予算試行を行ったところ、初期化したKnowBodyの完了率は75%で、ネイティブハーネスの25%を上回った。

詳細

KnowBodyは、タスク目標を理解できてもロボットの動作と機能部位の関係を把握しない一般的なVLMの制約を踏まえ、身体モデルを補助層として導入する。初期状態は1本のオフタスク軌道から与えられ、部分的な身体モデルが行動選択と過去の相互作用の解釈を導く。 新しい証拠が得られるとモデルは更新され、修正後の身体推定に依存する知識は再利用前に再確認される。著者らは、永続的な更新を有効にした場合、最初に記録した成功から5回目の成功までの間に、プランナーのラウンド数が29〜53%減少したとしている。

Key Facts

arxiv.orgが2026-09-22に「Know Your Body: A Harness for Direct and Self-Improving Robot Control with VLMs」を公開した。[1]
KnowBodyは、モデル重みを固定したまま身体関係を明示・検索可能・更新可能にする設計である。[1]
実機4課題で32回の固定予算試行を行い、初期化したKnowBodyの完了率は75%だった。[1]
同条件でのネイティブハーネスの完了率は25%だった。[1]
永続的な更新を有効にした場合、プランナーのラウンド数は最初の成功から5回目の成功までに29〜53%減少した。[1]

本紙の見方

KnowBodyの新規性は、VLM本体を再学習するのではなく、身体関係を外付けのハーネスとして明示し、その記述を更新しながら制御に使う点にある。つまり、入力されたタスク目標をそのまま行動に変換するのではなく、ロボットの身体構造に関する知識を一段挟む設計である。32回の固定予算試行で75%対25%という差が示されたことは、少なくともこの枠組みでは、モデルサイズや学習済み重みの変更よりも、身体理解の表現方法が性能差を生みうることを示す。固定重みのまま改善するため、再学習コストやモデル更新の頻度を抑えたい場面での意味合いが大きいとみられる。 本紙の関連記事はないため、過去報道との連続性は置かないが、今回の位置づけは「VLMで何を見せるか」ではなく「身体知識をどう保持・再確認するか」に軸足がある点にある。1本のオフタスク軌道から初期化し、新しい証拠で更新し、修正後の知識を再チェックする流れは、単発のデモよりも、実機運用で誤認を蓄積しないための枠組みとして読める。ただし、実験は4課題・32回に限られており、どの程度多様なロボット形状や作業に一般化するかはまだ判断できない。完了率の改善が、特定の課題設計や初期化条件に依存していないかも確認が必要である。 業界構造への含意としては、ロボット制御の差別化が、学習済みVLMそのものではなく、身体モデルの管理層に移る可能性がある。ここでは、入力された観測、身体の部位関係、過去の相互作用、再確認の順に処理がつながっており、制御の信頼性はこの連鎖の設計に依存する。したがって、今後の焦点は、プランナーラウンド数の削減がどのタスクで再現するか、更新のたびに何を再検証するか、そして実機での安全性をどこまで保てるかに移るとみられる。

なぜ重要か

発表者によると、KnowBodyはモデル重みを固定したまま実機4課題で75%の完了率を示した。これは、ロボット制御の改善余地がVLM本体の再学習だけでなく、身体情報の持ち方と更新の仕組みにもあることを示す事実である。 更新を重ねるとプランナーラウンド数が29〜53%減ったとしており、反復制御の手数を減らせる可能性がある。実運用での採否は、少数課題の結果がより広いロボット形状や作業にそのまま当てはまるかどうかに左右される。