何が起きたか
研究チームは2026年7月28日、arXivにてHiFi-UMIを発表した。これは、ロボットを使わないUMIデータ収集システムの忠実度を高め、実機による追加学習(アンカー)なしで展開可能な操作ポリシーを学習する手法である。3つの基盤モデル(StarVLA-QwenPI、OpenPI-pi_0.5、LingBot-VA)で、テレオペレーションと同等の成功率(差は-2.5、+3.1、-0.6ポイント)を達成した。
詳細
HiFi-UMIは、軌道精度、グリッパー間の相対姿勢、同期、視野を共設計した携帯型UMIデータ生成システムである。具体的には、ヘッドマウント型のオフラインステレオ慣性SLAM、ネイティブな相対姿勢、共有マイクロ秒GPIOトリガー、各手に2つの広角カメラ(約200度の視野)を備える。外部トラッキングインフラなしで、ワークスペース内のエンドエフェクタ精度3mmを達成した。このデータを用いて、実機を使わないポストトレーニング(zero-robot post-training)を実証した。さらに、同じコーパスからの4,000時間の事前学習により、10の未見タスクで動作誤差を41%削減し、StarVLA-QwenPIでは実機成功率をさらに18.1ポイント向上させた。研究チームは、2,000時間のマイクロ秒同期・超広視野デモンストレーションを含むデータセット「HiFi-UMI-2K」をオープンソース化した。
Key Facts
| HiFi-UMIは、ロボットを使わないUMIデータ収集の忠実度を高め、実機による追加学習なしで展開可能な操作ポリシーを学習する手法である。 | [1] |
| HiFi-UMIは、ヘッドマウント型オフラインステレオ慣性SLAM、ネイティブな相対姿勢、共有マイクロ秒GPIOトリガー、各手に2つの広角カメラ(約200度)を備える。 | [1] |
| HiFi-UMIは、外部トラッキングインフラなしでワークスペース内エンドエフェクタ精度3mmを達成した。 | [1] |
| 3つの基盤モデル(StarVLA-QwenPI、OpenPI-pi_0.5、LingBot-VA)で、テレオペレーションと同等の成功率(差は-2.5、+3.1、-0.6ポイント)を達成した。 | [1] |
| 研究チームは、2,000時間のマイクロ秒同期・超広視野デモンストレーションを含むデータセット「HiFi-UMI-2K」をオープンソース化した。 | [1] |
なぜ重要か
HiFi-UMIは、ロボット学習におけるデータ収集のコストと精度のトレードオフを解消する可能性を示した。これにより、実機データをほとんど使わずに展開可能なポリシーを学習できるようになり、ロボットの応用範囲が広がる。また、オープンソースの大規模データセットは、研究コミュニティの進展を加速させるだろう。