何が起きたか

Hugging Face上で、LeRobotがX-VLAのチェックポイント「lerobot/xvla-agibot-world」を公開した。X-VLAは、ソフトプロンプトを用いてクロスエンボディメントとクロスドメインのロボット制御を統一トランスフォーマーアーキテクチャ内で処理するVision-Language-Action基盤モデルである。このチェックポイントはAgileXロボットの器用操作タスク向けに最適化されている。

詳細

X-VLAは、ソフトプロンプトを用いてクロスエンボディメントとクロスドメインのロボット制御を統一トランスフォーマーアーキテクチャ内で処理するVision-Language-Action基盤モデルである。入力は画像(マルチビュー)、プロプリオセプション/状態、任意の言語指示で、出力は連続アクション。学習目的はフローマッチングで、アクション表現は連続。ベースモデルとして、特定のユースケースへのファインチューニングが想定されている。 元論文は「X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model」で、参照実装はGitHub(https://github.com/2toinf/X-VLA)にある。LeRobot実装は元の参照コードに従い互換性を保っている。インストールは「pip install "lerobot[xvla]"」で行う。 推論の例では、LeRobotDataset(例: lerobot/libero)を読み込み、XVLAPolicyをロードしてselect_actionを実行する。トレーニング/ファインチューニングはlerobot-trainコマンドを使用し、--policy.path=lerobot/[BASE_CHECKPOINT]を指定する。実世界での推論と評価にはlerobot-recordスクリプトを使用し、例えばso100_followerロボットで10エピソードの評価を記録できる。

Key Facts

Hugging Face上でLeRobotがX-VLAのチェックポイント「lerobot/xvla-agibot-world」を公開した(ソース: 0)[0]
X-VLAはソフトプロンプトを用いてクロスエンボディメントとクロスドメインのロボット制御を統一トランスフォーマーアーキテクチャ内で処理するVision-Language-Action基盤モデルである(ソース: 0)[0]
このチェックポイントはAgileXロボットの器用操作タスク向けに最適化されている(ソース: 0)[0]
入力は画像(マルチビュー)、プロプリオセプション/状態、任意の言語指示で、出力は連続アクション(ソース: 0)[0]
学習目的はフローマッチングで、アクション表現は連続(ソース: 0)[0]
元論文は「X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model」(ソース: 0)[0]
参照実装はGitHub(https://github.com/2toinf/X-VLA)にある(ソース: 0)[0]
インストールは「pip install "lerobot[xvla]"」で行う(ソース: 0)[0]
トレーニング/ファインチューニングはlerobot-trainコマンドを使用し、--policy.path=lerobot/[BASE_CHECKPOINT]を指定する(ソース: 0)[0]
実世界での推論と評価にはlerobot-recordスクリプトを使用し、例えばso100_followerロボットで10エピソードの評価を記録できる(ソース: 0)[0]

なぜ重要か

X-VLAは、クロスエンボディメントとクロスドメインのロボット制御を統一トランスフォーマーで扱う基盤モデルであり、ロボット学習の汎用性向上に寄与する可能性がある。LeRobotが公開したチェックポイントにより、AgileXロボットの器用操作タスクを対象としたファインチューニングが容易になる。