何が起きたか
arxiv.orgは2026-09-24、Robo-Harness K1を発表した。これは、深度情報、恒久的な視覚アンカー、空間計測、把持仮説をツールとして参照し、その返答を基に汎用モーションを選ぶロボット用エージェント枠組みである。VLMのアーキテクチャを変えず、深度エンコーダも新たに学習せずに3D幾何へアクセスできる設計としている。
詳細
LIBERO-PROの同条件タスクでは、Gemini 3.7 Flash with K1が77.8%の精度を示し、RGBのみのハーネスを用いたGPT-6 Astraの61.1%を上回った。K1を用いたAstraは88.9%まで改善した。さらに、事前のターゲット微調整なしで、Gemini with K1は3つのRoboSuiteアームと双腕のRoboTwinタスクへ転移した。 RoboTwinではEasyが32.0%、Hardが28.0%だった。K1は、次トークン学習と整合するツール呼び出しのトレースも生成した。Qwen3.5-9Bの学生モデルは、教師の107エピソードのみで訓練され、新しい初期状態で44.2%を記録し、OpenVLAの30.2%を上回った。保持外のタスク条件では13.9%で、OpenVLAの0.0%を上回った。
Key Facts
| Robo-Harness K1は、深度、視覚アンカー、空間計測、把持仮説をツールとして参照するロボット用エージェント枠組みである。 | [1] |
| Gemini 3.7 Flash with K1は、LIBERO-PROで77.8%の精度を示した。 | [1] |
| RGBのみのハーネスを用いたGPT-6 AstraはLIBERO-PROで61.1%だった。 | [1] |
| K1は、Geminiを3つのRoboSuiteアームと双腕のRoboTwinタスクへ、ターゲット微調整なしで転移させた。 | [1] |
| Qwen3.5-9Bの学生モデルは、107エピソードの教師データで新しい初期状態に44.2%、保持外条件に13.9%を示した。 | [1] |
本紙の見方
Robo-Harness K1の新規性は、ロボット制御をVLMの中に閉じ込めず、深度や空間計測を外部ツールとして引き出す点にある。つまり、画像だけで方策を直接出す方式でも、VLAのように広範な実演を前提にする方式でもなく、認識能力を保持したまま3D幾何を補う構造である。数値面では、LIBERO-PROで77.8%、RoboTwinでEasy 32.0%、Hard 28.0%と、単一ベンチマーク内の改善だけでなく、視覚・環境摂動への耐性を示す結果が並ぶ。 本紙の見方としては、今回のポイントは性能そのものより、認識と行動の接続方法にある。K1はVLMのアーキテクチャを変更せず、深度エンコーダの学習も不要としているため、既存モデルの再設計よりも「ツール化」に重心が置かれている。これは、Robo-Harness K1: Harnessing Robot-Use Agents via Perception Augmentationという題名どおり、ロボット本体の巧緻性ではなく、知覚をどの粒度で行動系へ渡すかを問う研究だといえる。一方で、結果はLIBERO-PRO、RoboSuite、RoboTwin、さらにQwen3.5-9B学生モデルと複数系統に分かれており、どの条件で効くかはまだ整理が必要である。 業界構造でみると、この枠組みはロボット制御を「モデル内部の一体最適」から「知覚ツール+汎用モーション」の分業へ寄せる含意を持つ。もしこの分業が再現性を持つなら、学習データの量よりも、深度取得、視覚アンカー、空間計測といった周辺モジュールの設計が性能差を作る可能性がある。逆に、評価は現時点で研究ベンチマーク中心であり、実機導入で必要になる安全性、失敗時の復帰、センサーノイズ下での安定性はこの要約だけでは確定しない。次に確認すべきは、異なるロボット形状での再現性、学習エピソード数の削減余地、そしてツール呼び出しが実運用の遅延や誤認識にどこまで耐えるかである。
なぜ重要か
この研究は、VLMをそのままロボット制御に使う場合の弱点に対し、深度や空間情報を外部ツールとして補う設計を示した点に意味がある。開発側にとっては、モデルの再学習よりも知覚インターフェースの設計が性能に効く可能性を示唆する。
日本への影響
日本のロボット研究・実装では、視覚認識モデル単体だけでなく、深度取得や空間計測をどうシステムに組み込むかが論点になりうる。とくに既存機体や既存VLMを活かしたい用途では、学習規模よりも周辺の知覚ツール設計が差別化要因になりうる。