何が起きたか

arxiv.orgは2026-09-16、論文「KINO: A Keyframe Interface for VLM Planning and Whole-Body Control in Humanoid Loco-Manipulation」を公開した。論文は、VLMによる計画とRLによる制御の間にモーション・キーフレームを中間表現として置く階層型フレームワークを提案している。評価はシミュレーションに加え、Unitree G1 humanoidでも実施した。

詳細

論文では、各キーフレームが「目標となる全身姿勢」を定義し、必要に応じて物体姿勢も含む。言語指示、シーン観測、実行フィードバックを受けたVLMが、あらかじめ用意したキーフレーム集からタスク関連のものを順次選び、選ばれたキーフレームは現在のシーンに合わせて再ターゲット化される。その後、キーフレーム条件付きの全身ポリシーが関節レベルの行動を生成する。 低レベルポリシーの学習には、saliency-based keyframe sampling strategyを導入したとしており、疎なVLMキーフレームを用いた場合でも、エンドツーエンドのタスク成功率は44%から92%に上がったという。評価対象のタスクは、物体のpickup、transport、placementで、論文は1本手と2本手の操作の両方、ならびに訓練時の参照データを超える配置位置への一般化を報告している。

Key Facts

「KINO: A Keyframe Interface for VLM Planning and Whole-Body Control in Humanoid Loco-Manipulation」は2026-09-16にarxiv.orgで公開された。[1]
KINOは、VLM計画とRL制御の間にモーション・キーフレームを中間表現として置く階層型フレームワークである。[1]
各キーフレームは目標の全身姿勢と、場合により物体姿勢を指定する。[1]
疎なVLMキーフレームを用いた低レベル学習で、エンドツーエンドのタスク成功率は44%から92%に改善したと論文は述べている。[1]
論文はシミュレーションとUnitree G1 humanoidで評価し、1本手・2本手の操作と、訓練参照データを超える配置位置への一般化を報告した。[1]

本紙の見方

KINOの新規性は、ヒューマノイドの全身操作を「VLMがそのまま行動を出す」形ではなく、キーフレームという離散的な中間表現でつなぎ直した点にある。VLMが言語指示とシーン観測からタスク関連のキーフレームを選び、別のポリシーが関節レベルの行動に落とす構造は、計画と制御の分離であり、同時に両者を接続する設計でもある。44%から92%という改善幅は、少なくともこの実験条件では、疎なキーフレーム選択が学習と実行の両方でボトルネックになり得ることを示している。 本紙の関連記事であるUnitreeが身長180センチ、体重70キロの人型ロボットH2を発表は、Unitreeの機体スペックを伝える内容だったが、今回はUnitree G1 humanoidが研究評価の実行基盤として使われた点が焦点である。つまり、機体の大型化や体格差よりも、実運用に近い全身制御をどの抽象層で扱うかが論点になっている。ハードウエアの話から、タスク記述・場面認識・行動生成をどう分割するかというソフト側の設計論に重心が移っているとみられる。 業界構造への含意としては、ヒューマノイドの競争軸が単体性能だけでなく、データ表現と制御スタックの設計に広がっている点が大きい。キーフレームのライブラリ化、再ターゲット化、全身ポリシーの学習という流れは、実機データをそのまま集めるよりも、どの粒度で行動を切り出すかが性能に直結することを示す。今後は、キーフレームの作成方法、参照データの範囲、シミュレーションから実機への移植性、そしてUnitree G1以外の機体で同じ成功率が出るかが確認点になる。

なぜ重要か

Unitree G1 humanoidを使った評価まで含まれているため、ヒューマノイドの研究成果が機体差ではなく制御表現の差で説明できるかが問われる。発表元の論文は、疎なVLMキーフレームでも44%から92%への改善が得られたとしており、操作タスクの設計単位を見直す材料になる。